第 4 章:基准的陷阱——污染、饱和与 Goodhart 定律
考卷制度发明后的第二天,作弊就发明了。基准测试同理:分数一旦被用来排名、宣传、融资,就有人有动力让分数失真。这一章讲三类陷阱——它们不是边缘漏洞,而是任何基准的生命周期里必然出现的阶段。
陷阱一:数据污染——模型「背过题」
LLM 在互联网规模的文本上训练,而基准题目就发布在互联网上。当训练语料混入了考题和答案,模型可能不是「推理出」答案,而是「回忆出」答案——就像学生在考试前偷到了原卷。
污染的传播路径:
- 题库发布在 GitHub、arXiv、HuggingFace,爬虫无差别抓取;
- 网友把题目和解答写进博客、论坛,污染进一步扩散;
- 训练数据规模以万亿 token 计,事后排查几乎不可能穷尽。
GPT-4 技术报告公开承认了这一点,并专门做了污染评估(见 AI 论文精读:GPT-4 技术报告)。检测污染的方法通常是「n-gram 重叠」:检查考题与训练语料的字面重合度。但更高明的污染(改写、翻译、答案反推)难以检测。对任何满分选手,第一个问题都该是「它是不是见过题」,而不是「它是不是变强了」。
陷阱二:饱和——题目被刷穿
任何固定题库都有被刷穿的一天:GLUE 被 BERT 刷到人类水平以上(于是有了 SuperGLUE);MMLU 头部模型到 2024 年中已普遍达到 88% 上下(人类领域专家约 89.8%),区分度急剧下降。分数曲线的形状通常是:早期几年迅速爬升,接近天花板后停滞——此时分数差 1 分可能意味着能力差一个档次,也可能只是噪声。
饱和之外还有「错题」问题:2024 年一篇论文人工审查了 MMLU 的 5,700 道题,估计约 6.5% 的题目存在答案错误、歧义或缺陷(病毒学子集错误率高达 57%)——意味着最高可得分本身就低于 100%,高分与满分之间的差距有一部分是题库的锅。
饱和的直接后果是「分数通胀」:所有人的分数都好看,但分数不再携带信息。应对办法只有两个:不断推出更难的新题库(GPQA、HumanEval+ 这类加难版应运而生),或转向无法穷举的开放式评测(第 5 章的智能体基准)。
陷阱三:Goodhart 定律——当度量变成目标
当一个度量成为目标时,它就不再是一个好的度量。 —— Goodhart 定律(以经济学家 Charles Goodhart 命名)
这条 1975 年提出的定律在 LLM 时代精准应验:只要排行榜重要,就有人针对排行榜优化,而非针对真实能力优化。
- 针对性微调:拿基准的训练集去微调模型,考什么练什么——不是变聪明,是变「熟练」;
- 专门数据混入预训练:把 MMLU 风格题目大量混入预训练语料;
- 评测配置的艺术:自报分数用最优提示词、最优采样温度、开满推理预算;
- 竞技场同样被操纵:有组织投票、营销号引导用户偏好。
Simon Willison 的「鹈鹕骑自行车」测试给出了教科书般的案例:一个玩笑式的非正式测试,头一年竟与模型真实水平高度相关,而 21 个月后这种相关性基本被切断(见 Kimi K3 与鹈鹕基准测试的启示)。任何固定评测的价值都会随时间衰减——不是模型变差了,是「刷分产业」赶上了。
陷阱的组合拳:发布周的真相
实际看一次模型发布,三种陷阱往往同时出现:自报的 MMLU 分数可能来自轻微针对性优化(Goodhart)、题库本身已在饱和期(区分度低)、而某个亮眼的新基准可能已被污染(背题)。所以「发布会上全面领先」与「实测一般」完全可以同时为真。
一句话总结
基准有三类固有陷阱:数据污染让模型背题而非解题;固定题库必然饱和、分数失去区分度;Goodhart 定律指出当分数成为目标,刷分行为会让指标失效。读任何分数都要先问:题见过吗?题库还新鲜吗?分数经过针对性优化吗?
来源
- Goodhart 定律:Charles Goodhart 1975 年货币政策文章提出「当度量成为目标,它就不再是好度量」——已核实(维基百科 Goodhart’s law 条目)
- MMLU 饱和:2024 年中头部模型约 88%、人类专家约 89.8%——已核实(维基百科 MMLU 条目);MMLU 错题研究(约 6.5% 题目有误、病毒学子集 57%)——已核实(arXiv 2406.04127,维基百科 MMLU 条目引述)
- GLUE 被超越后推出 SuperGLUE:GLUE 2018 年提出、SuperGLUE 约一年后(2019)提出——已核实(arXiv 1804.07461 / 1905.00537 摘要)
- GPT-4 技术报告含官方污染评估——已核实(维基百科 GPT-4 条目;报告本身见 AI 论文精读:GPT-4 技术报告)
- 鹈鹕测试相关性衰减的「21 个月」——已核实(Kimi K3 与鹈鹕基准测试的启示,Simon Willison 原文)
相关笔记
- AI 论文精读:GPT-4 技术报告 — 官方污染评估的公开案例
- Kimi K3 与鹈鹕基准测试的启示 — 非正式基准相关性衰减的实证
- 第 5 章:智能体与效率基准 — 对抗饱和的开放式评测
- GLM-5.2 vs Claude Opus:亲手跑了一次 3D 游戏构建对比 — 自报分数与实测落差的例子