第 6 章:如何读榜与自测——在噪声中做决定

上一章:智能体与效率基准 | 回到 学习主页 | 下一章:无(本项目终章)

前五章讲了各种基准与陷阱,现在回答最初的问题:面对一张排行榜,怎么读?面对一堆候选模型,怎么选? 答案是两条:会读榜,更要会自测。

读榜方法论:五个问题

1. 数据是谁报的? 厂商自报(发布会对比表)默认打折——选择性展示、配置不对等是常态。优先看第三方独立评测:LMSYS Chatbot Arena、Artificial Analysis、独立的论文复现。

2. 分数差是否显著? 先看置信区间。两个模型 Elo 相差 3 分而区间宽 10 分——排名差异无意义(见 第 3 章)。同理,MMLU 差 1% 在饱和区基本是噪声。

3. 题目是否还新鲜? 题库发布时间越久、越流行,污染与刷分风险越高(见 第 4 章)。新基准比老基准更可信,但也更少数据点。

4. 基准是否匹配你的场景? 这是最常被跳过的一步:

你的用途更该看的基准
日常对话助手Chatbot Arena(偏好)
写代码、修 bugSWE-bench Verified、PinchBench 编码类
研究/难题推理GPQA、前沿数学基准
预算敏感价格 + 智能指数 + token 效率
长文档处理长上下文专门评测

5. 趋势比单点重要。 一个模型连续几个月在多类独立评测中都强,比任何单张表格可信。

自测:鹈鹕测试的教训

Simon Willison 的「鹈鹕骑自行车」是一个玩笑测试——让模型画一只骑自行车的鹈鹕 SVG。它从来不算严谨基准,却持续带来价值(见 Kimi K3 与鹈鹕基准测试的启示):

  • 强制亲自动手:跑一次自己的提示词,才知道模型真实接入是否顺畅;
  • 暴露意外特性:K3 那次测试意外暴露了隐藏系统提示词、单一推理力度、超高推理 token 消耗——这些在厂商对比表里都不会写;
  • 可复现、可分享:固定提示词让不同模型、同一模型不同版本的结果可以直接对比。

方法论可以放大:挑 5–10 个你真实场景里的代表性任务(写你常写的代码、处理你常处理的文本),固定提示词,在新模型上一一跑过。这比任何第三方排行榜都更接近「对我有没有用」的答案。

Note

自测的局限:样本太小,一次结果可能只是运气。自测的价值在于「发现问题」和「验证手感」,不在精确排名。

组合拳:一个实用的选型流程

  1. 粗筛:看第三方排行榜(Arena + 智能指数),选出场景匹配的 2–3 个候选;
  2. 查证:看候选是否在独立评测(论文复现、SWE-bench Verified)里也强;
  3. 自测:用你的固定任务集跑一遍,记录分数、token 消耗与体感;
  4. 记账:把价格代入你的真实用量,算月成本;
  5. 定期复查:模型迭代很快,每季度重跑一次第 3 步。

一句话总结

读榜五问:谁报的数据、分差是否显著、题库是否新鲜、基准是否匹配场景、趋势是否稳定;自测用固定任务集亲手验证——排行榜负责粗筛,自己的测试负责最终决策。基准是证据而非答案,选模型没有一劳永逸。

来源

  • 本章的选型方法论为综合建议,不涉及需核验的事实性数字;引用的案例与数字均出自本知识库已核实笔记:
  • 鹈鹕测试的细节(K3 的 95 输入 token、13,241 推理 token、隐藏系统提示词线索)——已核实(Kimi K3 与鹈鹕基准测试的启示,Simon Willison 原文)
  • PinchBench 的任务规模与三重评分——已核实(PinchBench 笔记)
  • 「读榜五问」与「选型流程」为本文综合整理,非引用外部结论

相关笔记