第 4 章:基准的陷阱——污染、饱和与 Goodhart 定律

上一章:竞技场与人类偏好 | 回到 学习主页 | 下一章:智能体与效率基准

考卷制度发明后的第二天,作弊就发明了。基准测试同理:分数一旦被用来排名、宣传、融资,就有人有动力让分数失真。这一章讲三类陷阱——它们不是边缘漏洞,而是任何基准的生命周期里必然出现的阶段。

陷阱一:数据污染——模型「背过题」

LLM 在互联网规模的文本上训练,而基准题目就发布在互联网上。当训练语料混入了考题和答案,模型可能不是「推理出」答案,而是「回忆出」答案——就像学生在考试前偷到了原卷。

污染的传播路径:

  • 题库发布在 GitHub、arXiv、HuggingFace,爬虫无差别抓取;
  • 网友把题目和解答写进博客、论坛,污染进一步扩散;
  • 训练数据规模以万亿 token 计,事后排查几乎不可能穷尽

GPT-4 技术报告公开承认了这一点,并专门做了污染评估(见 AI 论文精读:GPT-4 技术报告)。检测污染的方法通常是「n-gram 重叠」:检查考题与训练语料的字面重合度。但更高明的污染(改写、翻译、答案反推)难以检测。对任何满分选手,第一个问题都该是「它是不是见过题」,而不是「它是不是变强了」。

陷阱二:饱和——题目被刷穿

任何固定题库都有被刷穿的一天:GLUE 被 BERT 刷到人类水平以上(于是有了 SuperGLUE);MMLU 头部模型到 2024 年中已普遍达到 88% 上下(人类领域专家约 89.8%),区分度急剧下降。分数曲线的形状通常是:早期几年迅速爬升,接近天花板后停滞——此时分数差 1 分可能意味着能力差一个档次,也可能只是噪声

饱和之外还有「错题」问题:2024 年一篇论文人工审查了 MMLU 的 5,700 道题,估计约 6.5% 的题目存在答案错误、歧义或缺陷(病毒学子集错误率高达 57%)——意味着最高可得分本身就低于 100%,高分与满分之间的差距有一部分是题库的锅。

饱和的直接后果是「分数通胀」:所有人的分数都好看,但分数不再携带信息。应对办法只有两个:不断推出更难的新题库(GPQA、HumanEval+ 这类加难版应运而生),或转向无法穷举的开放式评测(第 5 章的智能体基准)。

陷阱三:Goodhart 定律——当度量变成目标

当一个度量成为目标时,它就不再是一个好的度量。 —— Goodhart 定律(以经济学家 Charles Goodhart 命名)

这条 1975 年提出的定律在 LLM 时代精准应验:只要排行榜重要,就有人针对排行榜优化,而非针对真实能力优化

  • 针对性微调:拿基准的训练集去微调模型,考什么练什么——不是变聪明,是变「熟练」;
  • 专门数据混入预训练:把 MMLU 风格题目大量混入预训练语料;
  • 评测配置的艺术:自报分数用最优提示词、最优采样温度、开满推理预算;
  • 竞技场同样被操纵:有组织投票、营销号引导用户偏好。

Simon Willison 的「鹈鹕骑自行车」测试给出了教科书般的案例:一个玩笑式的非正式测试,头一年竟与模型真实水平高度相关,而 21 个月后这种相关性基本被切断(见 Kimi K3 与鹈鹕基准测试的启示)。任何固定评测的价值都会随时间衰减——不是模型变差了,是「刷分产业」赶上了。

陷阱的组合拳:发布周的真相

实际看一次模型发布,三种陷阱往往同时出现:自报的 MMLU 分数可能来自轻微针对性优化(Goodhart)、题库本身已在饱和期(区分度低)、而某个亮眼的新基准可能已被污染(背题)。所以「发布会上全面领先」与「实测一般」完全可以同时为真。

一句话总结

基准有三类固有陷阱:数据污染让模型背题而非解题;固定题库必然饱和、分数失去区分度;Goodhart 定律指出当分数成为目标,刷分行为会让指标失效。读任何分数都要先问:题见过吗?题库还新鲜吗?分数经过针对性优化吗?

来源

  • Goodhart 定律:Charles Goodhart 1975 年货币政策文章提出「当度量成为目标,它就不再是好度量」——已核实(维基百科 Goodhart’s law 条目)
  • MMLU 饱和:2024 年中头部模型约 88%、人类专家约 89.8%——已核实(维基百科 MMLU 条目);MMLU 错题研究(约 6.5% 题目有误、病毒学子集 57%)——已核实(arXiv 2406.04127,维基百科 MMLU 条目引述)
  • GLUE 被超越后推出 SuperGLUE:GLUE 2018 年提出、SuperGLUE 约一年后(2019)提出——已核实(arXiv 1804.07461 / 1905.00537 摘要)
  • GPT-4 技术报告含官方污染评估——已核实(维基百科 GPT-4 条目;报告本身见 AI 论文精读:GPT-4 技术报告
  • 鹈鹕测试相关性衰减的「21 个月」——已核实(Kimi K3 与鹈鹕基准测试的启示,Simon Willison 原文)

相关笔记