第 3 章:竞技场与人类偏好——让用户当裁判

上一章:考试式基准 | 回到 学习主页 | 下一章:基准的陷阱

考卷能测「知不知道」,但回答不了更日常的问题:哪个模型用起来更舒服? 哪个解释更清楚、拒绝得更得体、回答更讨喜?这类问题没有标准答案——于是评测界发明了另一种办法:让真人来投票。

Chatbot Arena:匿名对战

Chatbot Arena(聊天机器人竞技场)由 LMSYS 团队(加州大学伯克利分校)于 2023 年 4 月推出。规则简单:

  1. 你输入一个任意问题;
  2. 系统把它发给两个匿名模型(名字隐藏);
  3. 你投票给更好的回答(可平局);
  4. 赢的模型涨分,输的掉分。

匿名是关键:不让品牌光环(或偏见)影响判断——先看回答质量,再揭晓是谁答的。成千上万用户的真实问题 + 海量投票,让排行榜反映「日常使用场景下的综合受欢迎度」。

投票的数据结构是两两对比:每次只有两个模型较劲,不存在「绝对分数」。要把几百万次两两对比汇总成一条排行榜,需要一个古老的数学工具。

Elo:从国际象棋借来的排名算法

Elo 评分系统由物理学家 Arpád Elo 为国际象棋设计(1960 年代),核心思想:每场比赛后,胜者从败者身上「赢走」与预期差成比例的分数。

模型 A(Elo 1200)击败模型 B(Elo 1100):
预期 A 胜率约 64%(分差 100 对应的理论胜率)
A 实际赢了 → A +约 11 分,B -约 11 分
若 B 爆冷赢 → B +约 21 分(超出预期的胜利奖励更多)

对 LLM 投票,数学框架换成了它的统计近亲 Bradley-Terry 模型:假设每个模型有一个「实力值」,两者对战时实力高者胜率更高。用所有投票数据反推出每个模型的实力值,就是排行榜上的 Elo 分。分差有意义、绝对值没有:1200 和 1300 的差距是「约 64% 胜率」,但「总分 1300」本身不说明任何绝对水平。

置信区间:排名不是精确值

几百万次投票看起来很多,但分到几百个模型头上,每个模型可能只有几千场对局——统计噪声不可忽略。因此 Areno 排行榜给每个分数配一个置信区间(confidence interval):Elo 不是 1250,而是「约 1245–1255(95% 置信)」。

读榜时这条规则最重要:两个模型分数差小于区间宽度时,排名没有意义。排名第 8 和第 12 的模型可能实力无差异,只是投票波动。厂商发布会最爱挑有利的区间读,看客要自己会看。

Note

相同的 Elo 思路也被商业评测沿用。Artificial Analysis 的「智能指数」(见 DeepSeek V4 Flash 0731 — 智能、性能与价格分析)同样以盲测对比和 Elo 为基础,把价格、速度与智能放在同一张表里。

竞技场同样有被操纵的记录:2025 年 4 月 Meta 的 Llama 4 Maverick 被发现在 Arena 上跑的是与公开发布版本不同的「特调版」,排名虚高(The Verge 报道后 Arena 更新了规则);学术研究也证明数百张有组织的投票就能扭曲排名。偏好评测不等于无法操纵。

为什么偏好能测出考卷测不到的东西

考试式基准测「能力」,竞技场测「受欢迎度」,两者经常不一致,而不一致处正是信息

  • 表达风格:同样正确的答案,一个啰嗦一个清晰——投票捕捉得到,选择题捕捉不到;
  • 拒绝行为:该拒绝时礼貌拒绝 vs 过度拒绝——没有标准答案,只能靠偏好;
  • 对话体验:追问、澄清、语气——MMLU 完全无视这些维度;
  • 日常真实任务:用户问的都是自己真正关心的问题,而非学术考题。

代价同样明显:投票有主观性、易被流行趋势影响、结果无法直接复现、且「受欢迎」不等于「正确」——一个自信流畅地胡说八道的模型可能拿到不错的票数。

一句话总结

Chatbot Arena 让用户匿名投票两两对比模型,用国际象棋 Elo 的数学(Bradley-Terry 模型)把海量对比汇总成排行榜,每个分数带置信区间。偏好评测捕捉考试测不到的风格、拒绝与对话体验,但主观、不可复现,且「受欢迎」不等于「正确」。

来源

  • Chatbot Arena 2023 年 4 月 24 日上线,创始人 Chiang、Angelopoulos、Stoica(UC Berkeley),匿名双模型投票机制——已核实(维基百科 LMArena 条目)
  • Elo 系统由 Arpád Elo 为国际象棋设计、1960 年起被美国国际象棋联合会采用,是 Bradley-Terry 模型的特殊情形——已核实(维基百科 Elo rating system 条目)
  • 「分差 100 对应约 64% 胜率」及示例加减分为 Elo 公式的直接计算(K 因子取 32 时的近似值)
  • Arena 被操纵案例:Llama 4 Maverick 特调版刷榜(The Verge,2025-04);数百张操纵投票可扭曲排名(Fast Company,2025-02)——已核实(维基百科 LMArena 条目引用的两篇报道)

相关笔记