第 6 章:如何读榜与自测——在噪声中做决定
前五章讲了各种基准与陷阱,现在回答最初的问题:面对一张排行榜,怎么读?面对一堆候选模型,怎么选? 答案是两条:会读榜,更要会自测。
读榜方法论:五个问题
1. 数据是谁报的? 厂商自报(发布会对比表)默认打折——选择性展示、配置不对等是常态。优先看第三方独立评测:LMSYS Chatbot Arena、Artificial Analysis、独立的论文复现。
2. 分数差是否显著? 先看置信区间。两个模型 Elo 相差 3 分而区间宽 10 分——排名差异无意义(见 第 3 章)。同理,MMLU 差 1% 在饱和区基本是噪声。
3. 题目是否还新鲜? 题库发布时间越久、越流行,污染与刷分风险越高(见 第 4 章)。新基准比老基准更可信,但也更少数据点。
4. 基准是否匹配你的场景? 这是最常被跳过的一步:
| 你的用途 | 更该看的基准 |
|---|---|
| 日常对话助手 | Chatbot Arena(偏好) |
| 写代码、修 bug | SWE-bench Verified、PinchBench 编码类 |
| 研究/难题推理 | GPQA、前沿数学基准 |
| 预算敏感 | 价格 + 智能指数 + token 效率 |
| 长文档处理 | 长上下文专门评测 |
5. 趋势比单点重要。 一个模型连续几个月在多类独立评测中都强,比任何单张表格可信。
自测:鹈鹕测试的教训
Simon Willison 的「鹈鹕骑自行车」是一个玩笑测试——让模型画一只骑自行车的鹈鹕 SVG。它从来不算严谨基准,却持续带来价值(见 Kimi K3 与鹈鹕基准测试的启示):
- 强制亲自动手:跑一次自己的提示词,才知道模型真实接入是否顺畅;
- 暴露意外特性:K3 那次测试意外暴露了隐藏系统提示词、单一推理力度、超高推理 token 消耗——这些在厂商对比表里都不会写;
- 可复现、可分享:固定提示词让不同模型、同一模型不同版本的结果可以直接对比。
方法论可以放大:挑 5–10 个你真实场景里的代表性任务(写你常写的代码、处理你常处理的文本),固定提示词,在新模型上一一跑过。这比任何第三方排行榜都更接近「对我有没有用」的答案。
Note
自测的局限:样本太小,一次结果可能只是运气。自测的价值在于「发现问题」和「验证手感」,不在精确排名。
组合拳:一个实用的选型流程
- 粗筛:看第三方排行榜(Arena + 智能指数),选出场景匹配的 2–3 个候选;
- 查证:看候选是否在独立评测(论文复现、SWE-bench Verified)里也强;
- 自测:用你的固定任务集跑一遍,记录分数、token 消耗与体感;
- 记账:把价格代入你的真实用量,算月成本;
- 定期复查:模型迭代很快,每季度重跑一次第 3 步。
一句话总结
读榜五问:谁报的数据、分差是否显著、题库是否新鲜、基准是否匹配场景、趋势是否稳定;自测用固定任务集亲手验证——排行榜负责粗筛,自己的测试负责最终决策。基准是证据而非答案,选模型没有一劳永逸。
来源
- 本章的选型方法论为综合建议,不涉及需核验的事实性数字;引用的案例与数字均出自本知识库已核实笔记:
- 鹈鹕测试的细节(K3 的 95 输入 token、13,241 推理 token、隐藏系统提示词线索)——已核实(Kimi K3 与鹈鹕基准测试的启示,Simon Willison 原文)
- PinchBench 的任务规模与三重评分——已核实(PinchBench 笔记)
- 「读榜五问」与「选型流程」为本文综合整理,非引用外部结论
相关笔记
- Kimi K3 与鹈鹕基准测试的启示 — 自测方法论的原型案例
- PinchBench — 可本地跑通的自测工具之一
- LLM — 选型前的模型全景
- 第 1 章:为什么需要评测 — 回到本项目的出发点