
从跑分到上线中间隔着一整个真实用户两周时间我把能跑的指标全跑了。MMLU、HellaSwag、TruthfulQA、HumanEval、GSM8K、BIG-Bench Hard、GPQA Diamond——光是把这些名字在周报里排成一排看起来就已经很专业了。旁边再标上百分比画个折线图向上冲刺结论写该模型综合能力达到业界领先水平连我自己都差点信了。业务方看完只问了一句它答的还是不准啊。那一刻我才明白我跑的那些数字和用户真正在意的东西完全是两回事。大模型评测这一年发生了什么大模型评测这件事这几年经历了一场静悄悄的崩塌。最早行业里人手一个 BLEU 和 ROUGE后来发现这两个指标和人类判断几乎没有相关性——机器翻译出来的句子只要关键词对上了分就高但读起来完全是另一回事。到了 2020 年MMLU 横空出世成了新的黄金标准57 个学科的选择题覆盖从中学数学到医学到法律一度看起来非常可靠。然后大家开始在这张卷子上集体刷分。到了 2025 到 2026 年头部模型在 MMLU 上的准确率已经普遍超过 88%GPT-5.2 跑到了 92.4%而人类专家的平均水平大约是 89.8%。这张卷子基本上已经交卷了。但问题在于卷子本身有问题。NAACL 2025 的一篇论文Gema et al., Are We Done with MMLU?手动审查了 5700 道题估计整个 MMLU 数据集中约有 6.5% 的题目存在错误——有的答案本身就是错的有的存在多个正确选项有的题目表述模糊无法回答。细分到病毒学这个子集错误率高达 57%。也就是说我用 MMLU 跑出来的那个 91%可能有三四个百分点是假的是在一个充满错误的答卷上刷出来的虚荣分。Benchmark 饱和是第二个绕不过去的问题。GSM8K 是个很好的例子。2021 年刚发布时GPT-3 只能得 35 分左右到 2024 年主流模型普遍超过 90%到 2025 年末 GPT-5.3 Codex 已经到了 99%。这张卷子不是被模型做懂了是被背下来了。GSM8K 的训练集泄露问题早就被实锤了——有研究移除了被污染的题目之后部分模型的分数直接掉了 13 个百分点。Benchmark 污染是第三个更隐蔽的坑。微软专门做了一个无污染版本叫 MMLU-CF把题目改写、选项打乱测出来的结果让所有模型的分数都大幅下滑GPT-4o 掉了 14.6 分Llama 3.3 70B 掉了 17.5 分。行业里广泛引用的那些漂亮分数有相当一部分不是推理出来的是训练的时候顺带记住了。2025 年一项研究检查了 445 个 AI 评测基准其中只有 16% 在模型对比时使用了合理的统计方法。整个行业都在用一把刻度不准的尺子量进步但大家都在认真读数。让人崩溃的几个真实瞬间真正让人崩溃的不是这些宏观数据而是几个具体的瞬间。第一个瞬间发生在某次上线后的用户反馈会议上。模型在 TruthfulQA 上得分 87%我们宣称有效降低有害信息和幻觉输出。然后客服团队把用户投诉截了张图甩过来模型在回答公司报销政策时编了一个完全不存在的条款还引用了文号用户深信不疑地去跟财务对峙了。TruthfulQA 测的是模型会不会重复常见误解但用户遇到的是一个根本没在任何数据集里出现过的场景——Benchmark 是一张考驾照的卷子用户真正需要的是开着车上路。第二个瞬间是某次评测报告递交之后业务方说了一句让我很难反驳的话你们的测试题太干净了。我回去翻了翻我们的评测集确实都是结构完整的查询、表述清晰的需求、背景完整的上下文。但真实用户写的 query 是什么样的拼写错误、上下文缺失、一个问题里夹着三个不同的需求有时候一句话要联系前五条对话才能理解意图。我们精心设计的评测集和真实用户输入之间的分布差异大到可以另起一个 Benchmark。还有一个让人说不出话的时刻是在某次 RAG 系统上线之后。我们把模型的幻觉率降到了 4% 以下感觉终于能交代了。上线第一周检索模块出了问题返回的文档片段质量下降模型的幻觉率直接蹿到了 20%——这还是在模型本身能力没有任何变化的前提下。Benchmark 测的是模型在最优上下文下的表现而生产系统里每多塞进去一段文档幻觉的概率就多一分上下文窗口利用率超过 60% 之后幻觉率会加速上升。这个问题Benchmark 里从来没有测过。那些让人又气又笑的时刻那些让人又气又笑的时刻现在回想起来反倒成了最好的教材。有一段时间行业里流行组织模型评测比赛各团队拿自己的数据集轮流测给模型排名。卷子越出越难指标越刷越高公关稿越写越漂亮。然后真正把模型推到业务线上的时候大家发现日常问题还是那些分类错了、摘要漏了关键点、多轮对话聊到第三轮模型就开始自相矛盾。没有一个用户在意这个模型在 GPQA Diamond 上答对了 PhD 级别的生物题他们只关心这个模型能不能把自己公司的客服问题答对。最荒诞的经历是换了一套评测框架之后模型的分数反而退步了。原因是新的框架改进了评测方式加入了语义相似度的判断——之前靠关键词命中打分新框架用 embedding 比对语义一批看起来正确的答案被识别出其实存在细微错误。业务方拿着新的评测报告来找我问我是不是模型降级了我只能一点点解释清楚不是模型降级了是尺子变准了。业务方说你们测的不对的时候有时候是对的。他们每天和真实用户打交道比任何评测集都更清楚模型在实际场景里的真实表现。如果评测结果和业务反馈长期背离问题往往不在模型在评测。怎么让评测真正反映模型质量这些经历逼着我重新想清楚一件事评测的目的到底是什么。不是为了给模型的发布提供一张漂亮的成绩单而是为了回答一个最朴素的问题——这个模型放在真实场景里能不能把事情做好。做到这一点需要在几个方向上同时用力用业务真实数据构建评测集让业务方参与人工评估而不是只看自动化指标用 A/B 测试在真实流量里观察模型表现关注模型在高频错误类型上的改进而不是追逐新的 Benchmark 排名。说到底用户只关心准不准这句话不是在否定评测的价值它是在提醒我们评测只是手段不是目的。真正重要的不是这张卷子考了多少分而是模型放在用户的场景里能不能把事情做对、做好、一直做好。现在每次做评测我都会先问自己三个问题这个评测集里的题目真实用户会不会问如果不会它的分数再高也没有意义。这个指标提升之后用户能感知到变化吗如果用户没感觉这个改进到底是在服务谁最后这个分数在三个月后会不会还成立如果它靠的是记住了某个数据集而不是真正学会了那它迟早会露馅。上线前测了二十个指标上线后用户只关心准不准——这不是一个悲观的故事这是一个提醒跑分跑的是数字用起来才知道深浅。评测这件事归根结底只有一个标准它能不能让模型在真实场景里变得更好而不是让它在排行榜上看起来更好看。本文基于公开技术资料与行业实践整理不构成具体产品选型或部署方案建议。