第 5 章:智能体与效率基准——从「答题」到「干活」

上一章:基准的陷阱 | 回到 学习主页 | 下一章:如何读榜与自测

选择题可以背,代码题可以刷,但**「把这个真实项目的 bug 修掉」「把这封邮件得体地回掉」**——这类任务没有标准答案,也无法靠背题解决。当 LLM 从「答题机器」进化为「干活代理」(agent),评测也必须跟着进化。

SWE-bench:修真实的 GitHub issue

SWE-bench(普林斯顿,2023)是智能体基准的里程碑:从 12 个流行 Python 开源项目(如 Django、SymPy)收集 2,294 个真实的 GitHub issue,每个 issue 附带对应的修复代码和测试。

评测流程像一场小型入职考核:

  1. 给模型一个代码仓库 + 一个 issue 描述;
  2. 模型在仓库里改代码(可以调用工具、运行测试);
  3. 用 issue 关联的隐藏测试验证修复是否真的解决了问题;
  4. 通过才得分。

与 HumanEval 的本质区别:题目是真实的工程问题、空间是整个仓库(几万行代码)、允许模型自主使用工具迭代。难度一目了然:论文发布时最强的 Claude 2 也只能解决 1.96% 的 issue。后来推出的 SWE-bench Verified 由人工重审筛掉了原版中含糊的 issue,是当前最受认可的编码 agent 基准。2025 年后「编码 agent」的军备竞赛(Claude Code、各类编程助手)几乎都在这一族基准上排座次。

PinchBench:完整 Agent 环境下的综合任务

SWE-bench 只测写代码。真实工作远不止于此:回邮件、查日历、做表格、读日志。PinchBench 的思路是把评测对象从「模型」换成「装了模型的 agent 系统」——用 50+ 个跨类别真实任务(办公、研究、写作、编码、数据分析)测量模型在完整工作环境里的表现。

它的两个设计特别值得注意(详见 PinchBench 笔记):

  • 三重评分:能自动判分的用代码判分(文件是否存在、JSON 是否正确);主观任务用 LLM 裁判(LLM-as-judge)按评分标准打分;两者结合的混合模式按权重合并;
  • 效率同测:不只问「做对了吗」,还问「花了多少 token、多少钱」——score_per_1k_tokens(每千 token 得分)和 score_per_dollar(每美元得分)把成本纳入成绩单。

LLM 当裁判:开放式任务的评分方案

开放式任务(「这封邮件写得得体吗?」)没有标准答案,人类人工阅卷太贵,于是评测界发明了 LLM-as-judge:用一个能力较强的模型按评分标准给候选模型的输出打分。

它解决了一个真问题(开放式任务终于可以规模化评测),也带来一个新问题:裁判本身有偏好和偏差——裁判可能偏爱冗长回答、偏爱自己风格的输出。缓解手段包括多裁判交叉打分、裁判与选手配对平衡、以及混合评分(代码校验 + LLM 裁判互相制衡)。PinchBench 的 hybrid 模式就是这种思路的落地。

效率:分数一样,账单差十倍

传统评测只问「对不对」。但同样对的模型,一个每次回答烧掉 2 万 token、另一个只用 2 千——对用户而言差异巨大。于是效率维度进入评测:

Artificial Analysis 的「智能指数」正是把智能(Elo 式盲测)、价格、速度合为一张三维坐标,让「性价比」这个直觉变得可测量。

一句话总结

新一代基准把评测从「答题」升级为「干活」:SWE-bench 用真实 GitHub issue 和隐藏测试考编码 agent,PinchBench 用跨类别真实任务和 LLM 裁判考完整工作表现,同时把 token 效率与成本纳入成绩单——分数之外,账单同样重要。

来源

  • SWE-bench:2023 年 10 月发布,2,294 个问题、12 个 Python 仓库、真实 GitHub issue + PR,论文时最佳模型 Claude 2 仅 1.96%——已核实(arXiv 2310.06770 摘要)
  • SWE-bench Verified 由人工重审筛除含糊 issue:待验证(官方站点 swebench.com 口径,本次审查未能直接访问;「约 500 题」的常见说法未直接核实)
  • PinchBench 三重评分与效率指标(score_per_1k_tokens / score_per_dollar):已核实(PinchBench 笔记,基于项目源码分析)
  • LLM-as-judge 的偏差问题(偏爱冗长、偏好自身风格)与混合评分制衡:行业共识性结论,未逐条核实——待验证
  • Artificial Analysis 智能指数含盲测与价格/速度维度、单模型评估成本 237.07 美元——已核实(DeepSeek V4 Flash 0731 — 智能、性能与价格分析 笔记)

相关笔记