什么是大模型跑分?Benchmark 榜单该怎么看

新模型发布必晒的那些分数到底是什么?MMLU、GSM8K 这些榜单在考什么、为什么跑分高的模型未必好用、普通人该怎么看榜选模型,一文讲清。

什么是大模型跑分?Benchmark 榜单该怎么看
编辑部 ·

每次新模型发布,配图几乎都长一个样:一堆柱状图,自家那根最高,旁边标着 MMLU、GSM8K、HumanEval 这些看不懂的名字。这些就是 Benchmark(基准测试)——通俗点说,给大模型出的标准化考卷。这篇讲清它们在考什么、为什么”跑分第一”和”你用着顺手”常常是两回事。

一句话理解:给模型考试

Benchmark 的逻辑和高考没什么两样:准备一套固定的题目和标准答案,所有模型做同一份卷子,按得分排名。

有了统一的卷子,才能横向比较——否则各家都说自己最强,谁也说不清。常见的几张卷子考的东西完全不同:

榜单考什么大致相当于
MMLU几十个学科的多选题通识百科大考
GSM8K / MATH小学到竞赛级数学题数学卷
HumanEval写函数并跑通测试用例编程上机考
SWE-bench在真实代码仓库里修 bug编程实操考
GPQA研究生级别的科学难题专业课压轴题
MMMU看图 + 推理多模态综合卷

看榜的第一课就是:先看它考的是哪一科。一个数学榜第一的模型,不代表它写文案也第一。

为什么跑分高,用起来却一般

这是最值得说清楚的部分。榜单分数会失真,主要有四个原因:

1. 数据污染:考题提前泄露了

大模型的训练数据是从全网爬来的,而这些 benchmark 的题目和答案也公开在网上。如果测试题混进了训练数据,模型就不是在”解题”,而是在”背答案”。

这在业内叫数据污染(contamination),是最难排查、也最普遍的问题。它会让分数虚高,却完全不会提升模型在你实际任务上的表现。

2. 应试training:为了考试而优化

一旦某个榜单成为公认的宣传指标,就必然有人针对它优化。当一个指标变成目标,它就不再是好指标——模型可以被调得特别擅长做那类题,而通用能力并没有同步提升。

3. 考的不是你的场景

榜单题目大多是有标准答案的封闭问题。但你日常用 AI 干的事——写文案、改简历、整理会议纪要、陪你想方案——大多没有标准答案,也就没法用这种方式打分。

一个 GPQA 能答对研究生难题的模型,未必比另一个更懂怎么把你的邮件写得得体。

4. 分数饱和:都考满分了

很多老榜单已经被刷到 90 分以上,几个顶尖模型之间只差零点几分。这个差距早就小于测试本身的噪声了,拿它排名基本没有意义。这也是为什么新的、更难的榜单在不断被造出来。

那还有别的参考方式吗

有,而且更接近真实体验:

  • 盲测竞技场:让真人同时看两个匿名模型的回答,投票选更好的那个,再用类似棋类的 Elo 算法排名。它衡量的是人真的更喜欢哪个答案,比做题更贴近日常使用。局限是容易偏向”讨喜”的回答风格——话说得漂亮不等于说得对。
  • 自己建一套小测试集:这是最被低估、也最有效的办法。把你工作中最典型的 20 个任务整理出来,每次换模型就跑一遍。 这套”私人卷子”没有污染风险,考的又恰好是你真正在乎的能力。

普通人怎么看榜

四条实用原则:

  1. 先看科目,再看分数——挑和你用途最接近的那一项
  2. 警惕零点几分的差距,那基本是噪声
  3. 参考盲测排名,它比做题更接近真实使用感受
  4. 最终以自己试用为准——花二十分钟拿真实任务跑一遍,胜过看十张柱状图

主流几家模型在实际使用中的差异,可以对照 GPT / Claude / Gemini 横评;开源模型和闭源模型的取舍见开源大模型 vs 闭源大模型

小结

Benchmark 是给模型出的标准化考卷,它的价值在于提供了可比较的尺度,但数据污染、应试优化、场景错配和分数饱和这四个问题,决定了它离”好不好用”始终隔着一层。

记住一句话:跑分衡量的是模型会做题,不是模型懂你。 看榜时先确认科目、别纠结零点几分、多参考真人盲测,最后一定用自己的真实任务试一遍。想更进一步理解分数背后的东西,可以看什么是参数量(模型大小和能力的关系)与什么是推理模型(为什么”会思考”的模型在难题榜单上分数突然拉高)。