为什么人人都看 Leaderboard
大模型迭代太快,选型时逐个实测的成本又高,公开基准跑分于是成了行业通用的「硬通货」:直观、可比、随时能查。但「榜单排名靠前、业务里不好用」的抱怨同样普遍——同一个模型,评测分数领先,落到自己的客服、代码或文档场景却不如上一代。这种错位不是错觉。截至 2026-10-07 的公开研究显示,它至少来自四类系统性的坑:数据污染、面向榜单的刷分、评测方法本身不稳、静态基准的饱和失效。挨个拆开看。
坑一:数据污染——考题漏进了复习资料
机制很朴素:预训练语料来自全网爬取,公开多年的基准(MMLU、GSM8K 这类)的题目与答案会随网页、问答站、代码仓库进入训练数据。模型背过题,考分自然虚高。
这不是猜测。Benchmarking Benchmark Leakage in Large Language Models 用困惑度加 n-gram 命中率两条线索,对 31 个模型在 GSM8K 与 MATH 上做检测,发现约一半模型疑似把基准的训练集用进了训练:Aquila2-7B 在 GSM8K 上的 train–test 指标差约 75%,MATH 上约 159%;Aquila2-34B 的官方文档甚至自己承认「意外接触了整个 GSM8K 测试集」。论文的对照实验更直白:仅用 1000 条 GSM8K 样本微调,模型对见过样本的 5-gram 命中率就从 17.06% 涨到 48.22%——见过,就是不一样。
检测也有天花板。n-gram 重叠只能抓「原格式、原措辞」的泄漏:题目被改写或重排版就漏检(论文中的 ChatGLM-2 案例疑似训练于重排版数据);连答案格式反常这类线索(模型把 GSM8K 标准的 #### 答案头写成了别的格式)它也无能为力。所以更现实的态度是《How Much Can We Forget about Data Contamination?》(ICML 2025)给出的:污染不是一个「有/无」的开关,影响取决于遗忘动态——它无法根治,只能靠换新题、定期检测、透明披露来缓解。
坑二:面向榜单的训练——Goodhart 定律
当一个指标变成优化目标,它就不再是好指标。
榜单分数公开、可比,天然成为训练的靶子:只在评测任务分布上强化、针对性训练,社区称之为 benchmark hacking。《The Leaderboard Illusion》(2025)对 Chatbot Arena 的分析提供了机制性证据:Meta 在 Llama-4 发布前私下测试了 27 个私有变体、择优公开;少数厂商还能拿到不成比例的对战数据——OpenAI 约 20.4%、Google 约 19.2%,而 83 个开放权重模型合计只有约 29.7%。论文估算,在 Arena 数据分布上多训练,可带来最高 112% 的相对提升——涨的是「Arena 分布上的分数」,未必是通用能力。近年来社区对各类榜单刷分争议的讨论也屡见不鲜,Goodhart 定律在评测这件事上几乎从不缺席。
坑三:评测方法本身就不稳
就算题目干净、没人作弊,跑分这把尺子自己也有刻度误差。lm-eval 评测框架团队的《Lessons from the Trenches on Reproducible Evaluation of Language Models》系统记录了这些:
- 提示词敏感:同一模型同一任务,换提示风格,部分情况下分数波动超过 20 个百分点。ARC-Easy 上 GPT-NeoX 用完形填空式提示得 72.4,换 MMLU 考卷式提示只有 26.5,相差约 46 个点;ARC-C 上 Mixtral 两种格式是 56.7 对 81.3。
- 实现不同、结果不同:HELM、lm-eval 与 MMLU 原版三套实现给出不同分数,甚至会改变模型排名顺序;仅「按题平均还是按学科平均」就差好几个百分点。
- 判分环节:regex 抽取对输出格式敏感,LLM-as-judge 又引入裁判模型自身的偏差(这也是 LiveBench 坚持客观可验证答案的原因);few-shot 示例选哪几条、选项如何排列,同样会动分数。
- 小样本方差:GPQA 这类小数据集,单次运行与 10 次运行的置信区间给出的排名结论可以完全不同。
- 复现差异:论文核对发现,部分模型技术报告里的 ARC 分数疑似用了未在报告中说明的 MMLU-style 25-shot 提示。
人工偏好榜也逃不掉。LMSYS 官方博客《Disentangling Style and Substance in Chatbot Arena》的分析显示,回答长度是最大的风格因素(回归系数 0.249,远高于 markdown 标题、加粗、列表);开启 style control 后排名明显变动:gpt-4o 从第 5 升到第 2,grok-2-mini 从第 6 掉到第 18。不开风格修正,你看到的可能部分是「谁更能写」,而不是「谁更会答」。
坑四:饱和与失效的循环
静态公开基准还有个宿命式循环:新基准发布 → 关注度引来刷榜与污染 → 头部模型分数挤在一起分不出高下(饱和)→ 只好造更难的新基准 → 下一轮循环。MMLU、GSM8K 这批基准今天的主要价值更多是回归测试而非能力分水岭;更难的后来者(如 Humanity's Last Exam)大概率也在重复这个生命周期。
应对思路是让评测「动起来」,但三种方案各有代价:
- 动态公开基准(如 LiveBench):基于新论文、新闻等定期出新题,发布时按月更新,截至 2026-10-07 官网显示改为每半年刷新一批;用客观可验证答案避开裁判偏差。代价是持续运营成本,题目覆盖面也有限。
- 人工偏好评测(Chatbot Arena/LMArena):题面真实、天然动态,但受回答风格影响(见坑三),也存在 The Leaderboard Illusion 指出的数据不对称问题。
- 私有一致性评测集:企业自建、题库不公开,几乎无污染、最贴自己的场景,但覆盖窄、维护贵,也缺跨模型的历史可比性。
| 坑 | 典型信号 | 读者对策 |
|---|---|---|
| 数据污染 | 老基准上小模型「超神」 | 看污染检测报告,优先新题基准 |
| 刷分过拟合 | 榜单分涨、实测不涨;变体扎堆 | 多个独立榜单交叉,再加实测 |
| 方法不稳 | 名次差距小于置信区间 | 只信配置透明的评测 |
| 饱和循环 | 头部并列接近满分 | 换未饱和基准,关注区分度 |
读榜 7 条防坑检查
- 可复现吗:是否公开精确提示词、评测代码与原始输出;只给一个分数、什么都查不到的,折扣先打一半。
- 模型口径:是否区分 base 与 instruct 模型,few-shot 数量与示例来源是否写明。
- 污染处理:有没有污染检测报告或去污染说明;基准发布多久了,越老越要警惕。
- 统计纪律:报没报置信区间与多次运行方差;两个名次之间的差距是否超出区间。
- 场景匹配:评测任务与你的场景对得上吗——MMLU 高分不等于客服、代码或长文档场景好用。
- 风格修正:人工偏好榜是否提供 style control 口径,开关前后排名差多少。
- 交叉验证:用自己的一小套评测集或真实任务抽样实测,与榜单结论互证后再拍板。
边界与立场
以上不是「不要看跑分」。分数仍是重要的必要信息:它能低成本排除明显不合格的模型、追踪能力趋势。但它不是充分信息——选型决策应当是「榜单初筛 + 场景实测」的两段式。把 Leaderboard 当地图用,别把它当领土。
参考资料
- Benchmarking Benchmark Leakage in Large Language Models
- Lessons from the Trenches on Reproducible Evaluation of Language Models
- The Leaderboard Illusion
- Disentangling Style and Substance in Chatbot Arena(LMSYS 官方博客)
- LiveBench: A Challenging, Contamination-Free LLM Benchmark
- How Much Can We Forget about Data Contamination?(ICML 2025)
读者留言
COMMENTS 暂无还没有留言,来说第一句?