第 2 章:考试式基准——用考卷丈量知识与能力
如果说评测 LLM 是给黑箱出考卷,那这一章就是出题的艺术:考什么、怎么算分、怎么防止作弊。这一代「考卷」各有分工——有的考知识广度,有的考博士级难题,有的考写代码。理解它们,就理解了厂商对比表里那一串缩写的真实含义。
知识广度:MMLU——五万道题的大通识
MMLU(Massive Multitask Language Understanding,大规模多任务语言理解)由 Hendrycks 等人 2020 年 9 月发布,是 LLM 时代最著名的「通识考卷」:覆盖 57 个学科(数学、历史、法律、医学、计算机……),共 15,908 道四选一选择题。
为什么选择题?因为判分零成本、完全客观:模型输出 A/B/C/D,和标准答案比对即可,不需要人类阅卷。代价是形式受限:选择题测得出「知道不知道」,测不出「表达好不好」「推理过程对不对」。
MMLU 的地位类似 SAT:不是终点,但是几乎所有模型发布都会报的默认科目。发布时的成绩单是:最强模型 GPT-3 只有 43.9%(四选一蒙也蒙得到 25%),而人类领域专家约 89.8%。GPT-4 发布时(2023 年 3 月)拿到 86.4%,到了 2024 年中,头部模型普遍达到 88% 上下——逼近人类专家水平,区分度随之下降。这是第 4 章要讲的「饱和」问题。
博士级难题:GPQA——人做不对才叫难
GPQA(Graduate-Level Google-Proof Q&A,研究生级、Google 搜不到答案的问答)2023 年 11 月推出,共 448 道研究生水平的物理、化学、生物多选题,由相关领域博士出题并互相校验。它的筛选标准很特别:非专家的普通人即使可以上网查资料 30 分钟,准确率也只有 34%——保证题目不是靠检索就能解决的;出题博士本人的准确率是 65%,当时最强的 GPT-4 基线只有 39%。
GPQA 的价值在于区分「前沿模型」和「好模型」:普通模型在这里分数惨淡,只有真正具备深层推理能力的模型才能拿高分。2025 年后「推理模型」的军备竞赛(见 番外:工程魔法)很大程度上就是在 GPQA 这类难题上拉开差距。
写代码:HumanEval——跑得通才算对
HumanEval(OpenAI,2021)只有 164 道 Python 题,却是最经典的代码基准。它的特别之处:判分方式是执行验证,不是字符串比对。
题目:给定字符串 s,返回一个去重后的字符串(保持首次出现顺序)
答案:def dedup(s): ...
判分:把函数塞进测试用例实际运行,全部测试通过才得分
代码题必须真正跑通,这让「蒙答案」几乎不可能。配套的指标 pass@k 表示:让模型生成 k 个候选答案,只要有一个通过测试即算解决——k 越大,越衡量模型的上限;pass@1 则衡量「一次就对的概率」。选择 k 直接影响分数含义,读榜时必须注意。
数学与推理:MATH 与 ARC
- MATH(2021):12,500 道竞赛级数学题,要求给出完整解答而非选项。数学题无法蒙对,是最「诚实」的能力测量之一,也是后来「推理模型」的主战场。
- ARC(Abstraction and Reasoning Corpus,抽象推理语料,2019):纯图形推理——给出若干「输入→输出」的彩色方格示例,推断变换规则。它贴近流体智力的定义,对人类小孩容易,对 LLM 却长期困难,是「通用智能」讨论中的常客。
考试式基准的共同局限
所有「考卷」都共享一个问题:题目是死的、答案是公开的。一旦考题泄露进训练数据(数据污染),模型可能不是「做对」而是「背对」——这是第 4 章的核心议题。另一个问题是形式单一:选择题测不出对话体验,代码题测不出真实工程能力。这些空白由第 3 章的竞技场和第 5 章的智能体基准填补。
一句话总结
考试式基准用客观判分丈量具体能力:MMLU 考通识广度,GPQA 考博士级难题,HumanEval 用执行验证考代码(pass@k 衡量一次性与上限),MATH 与 ARC 考数学与抽象推理。它们客观可复现,但题目固定、答案公开,易受污染与饱和困扰。
来源
- MMLU:2020 年 9 月 7 日由 Hendrycks 等发布,15,908 道四选一、57 个学科——已核实(维基百科 MMLU 条目);发布时 GPT-3 175B 得分 43.9%、人类专家约 89.8%、2024 年中头部模型约 88%——已核实(同上)
- GPT-4 发布时 MMLU 86.4%:出自 GPT-4 技术报告(常识级数字,原报告未在本次审查中直接复核)
- GPQA:448 道题、非专家上网 34%、博士专家 65%、GPT-4 基线 39%、2023 年 11 月——已核实(arXiv 2311.12022 摘要)
- HumanEval:OpenAI Codex 论文 2021 年提出,以 docstring 生成程序、按功能正确性判分——已核实(arXiv 2107.03374 摘要);「164 道 Python 题」为常识级数字,论文摘要未直接列出
- MATH:12,500 道竞赛数学题、含分步解答——已核实(arXiv 2103.03874 摘要)
- ARC:Chollet 2019 年提出,以图形变换任务测抽象推理——已核实(arXiv 1911.01547)
相关笔记
- 本项目的下一站:竞技场与人类偏好
- LLM 是什么 — 理解「做题」在概率续写框架下的含义
- AI 论文精读:GPT-4 技术报告 — MMLU 等基准在 GPT-4 发布中的角色
- GPT-5.4 vs GLM-5:开源终于追上闭源 AI 了吗? — 厂商对比表中的基准实战