第 1 章:为什么需要评测——给黑箱打分

上一章:无(这是本项目的开篇)| 回到 学习主页 | 下一章:考试式基准

你刚买了一部新手机,怎么知道它好不好?看宣传页——每家都自称「史上最强」。那怎么真正知道?跑分、实测、拆机看做工。手机能拆,LLM 不能拆:几千亿参数的一个统计黑箱,没人能「打开看看」它到底懂不懂物理、会不会推理。于是评测成了唯一的窗口:向模型提问,看它怎么答

黑箱:为什么不能靠「感觉」判断

LLM 的本质是参数化的概率函数(见 LLM 是什么):几百层 Transformer 里存储着从海量文本中压缩出的统计规律。参数值是学出来的,不是人写的——没有任何一行代码写着「巴黎是法国首都」,这句话的「知识」散布在成千上万个浮点数里。

这意味着两件事:

  • 不可检视:你不能读参数判断模型懂不懂微积分,只能问它微积分题。
  • 不可信任直觉:模型是概率采样,同一个问题问两遍答案可能不同;试几个问题感觉「聪明」,可能只是撞上了它熟悉的题型。

所以「感觉不错」不是评测——它不可重复、不可比较、容易被营销话术带偏。评测要做的第一件事,就是把「好不好」变成可重复的测量

宣传不可信:每场发布会都「全面领先」

浏览近两年的模型发布:每家实验室的发布博客都有一张 benchmark 对比表,而每张表里自家模型都是第一名。这不是巧合,是选择偏差:

  • 只展示自己领先的基准,落后的一律不出现;
  • 拿「旧版对手」对比(对手的新模型还没跑过);
  • 用不同配置对比(自己开满「推理模式」,对手用默认配置);
  • 自报的数据不公开复现细节。

GPT-4 技术报告是这一矛盾的缩影:全文几十页都在讲评测结果,却不公布参数量、架构、训练数据——能力全靠一张张考试卷背书(见 AI 论文精读:GPT-4 技术报告)。这也说明评测有多重要:它是前沿实验室唯一愿意对外提供的「证据」。

Note

当宣传口径互相矛盾时,唯一可靠的裁判是独立、可复现的测量。这就是 benchmark(基准测试)存在的意义。

从 NLP 传统到 LLM 时代:评测的进化

用统一考卷评估模型不是 LLM 的发明。早在深度学习之前,自然语言处理(NLP)社区就建立过共享评测集:

  • GLUE(2018):9 个语言理解任务(情感分类、句子相似度、蕴含推理等)打包成一个排行榜,模型必须同时做好多类任务才算强;
  • SuperGLUE(2019):GLUE 被 BERT 迅速刷到人类水平以上后推出的「加难版」,保留了更有区分度的任务。

GPT-3 时代(2020)出现了一个转折:模型大到一个境界后,零样本/少样本直接做题就能拿高分——不再需要针对每个任务微调。评测从「NLP 模型的期末考」变成了「通用智能的丈量尺」,考题也随之升级(下一章)。

一个类比:汽车碰撞测试

评测 LLM 很像汽车碰撞测试:

  • 你不能靠拆车判断安全性,只能让车去撞;
  • 单一指标(最高时速)不够,需要一套标准化场景(正面碰撞、侧撞、翻滚);
  • 测试机构必须独立——车企自报的碰撞数据没人信;
  • 测试方法会过时:当年测 64 km/h 正面碰撞,今天车都过关了,就得加难度。

LLM benchmark 遵循同一逻辑:标准化题目、独立第三方、持续升级难度。

一句话总结

LLM 是不可拆解的概率黑箱,好坏只能靠外部测量;厂商自报数据充满选择偏差,因此需要标准化、可重复、独立执行的基准测试。评测从 NLP 时代的 GLUE/SuperGLUE 演化而来,在 LLM 时代升级为衡量「通用智能」的丈量尺。

来源

  • GLUE 2018 年提出,多任务打包、单一分数汇总——已核实(arXiv 1804.07461 摘要);SuperGLUE 于约一年后(2019)推出——已核实(arXiv 1905.00537 摘要);GLUE 含 9 个语言理解任务为常识级数字,未逐条复核
  • GPT-4 技术报告不公布参数量、架构与训练数据——已核实(维基百科 GPT-4 条目:OpenAI revealed neither the weights nor the technical details)
  • GPT-4 2023 年 3 月 14 日发布——已核实(维基百科 GPT-4 条目)

相关笔记