第 5 章:智能体与效率基准——从「答题」到「干活」
选择题可以背,代码题可以刷,但**「把这个真实项目的 bug 修掉」「把这封邮件得体地回掉」**——这类任务没有标准答案,也无法靠背题解决。当 LLM 从「答题机器」进化为「干活代理」(agent),评测也必须跟着进化。
SWE-bench:修真实的 GitHub issue
SWE-bench(普林斯顿,2023)是智能体基准的里程碑:从 12 个流行 Python 开源项目(如 Django、SymPy)收集 2,294 个真实的 GitHub issue,每个 issue 附带对应的修复代码和测试。
评测流程像一场小型入职考核:
- 给模型一个代码仓库 + 一个 issue 描述;
- 模型在仓库里改代码(可以调用工具、运行测试);
- 用 issue 关联的隐藏测试验证修复是否真的解决了问题;
- 通过才得分。
与 HumanEval 的本质区别:题目是真实的工程问题、空间是整个仓库(几万行代码)、允许模型自主使用工具迭代。难度一目了然:论文发布时最强的 Claude 2 也只能解决 1.96% 的 issue。后来推出的 SWE-bench Verified 由人工重审筛掉了原版中含糊的 issue,是当前最受认可的编码 agent 基准。2025 年后「编码 agent」的军备竞赛(Claude Code、各类编程助手)几乎都在这一族基准上排座次。
PinchBench:完整 Agent 环境下的综合任务
SWE-bench 只测写代码。真实工作远不止于此:回邮件、查日历、做表格、读日志。PinchBench 的思路是把评测对象从「模型」换成「装了模型的 agent 系统」——用 50+ 个跨类别真实任务(办公、研究、写作、编码、数据分析)测量模型在完整工作环境里的表现。
它的两个设计特别值得注意(详见 PinchBench 笔记):
- 三重评分:能自动判分的用代码判分(文件是否存在、JSON 是否正确);主观任务用 LLM 裁判(LLM-as-judge)按评分标准打分;两者结合的混合模式按权重合并;
- 效率同测:不只问「做对了吗」,还问「花了多少 token、多少钱」——
score_per_1k_tokens(每千 token 得分)和score_per_dollar(每美元得分)把成本纳入成绩单。
LLM 当裁判:开放式任务的评分方案
开放式任务(「这封邮件写得得体吗?」)没有标准答案,人类人工阅卷太贵,于是评测界发明了 LLM-as-judge:用一个能力较强的模型按评分标准给候选模型的输出打分。
它解决了一个真问题(开放式任务终于可以规模化评测),也带来一个新问题:裁判本身有偏好和偏差——裁判可能偏爱冗长回答、偏爱自己风格的输出。缓解手段包括多裁判交叉打分、裁判与选手配对平衡、以及混合评分(代码校验 + LLM 裁判互相制衡)。PinchBench 的 hybrid 模式就是这种思路的落地。
效率:分数一样,账单差十倍
传统评测只问「对不对」。但同样对的模型,一个每次回答烧掉 2 万 token、另一个只用 2 千——对用户而言差异巨大。于是效率维度进入评测:
- token 效率:每个任务消耗多少 token(推理模型尤其值得盯:见 Kimi K3 与鹈鹕基准测试的启示 中 K3 一个简单 SVG 任务烧掉 1.6 万 token 的例子);
- 成本:跑完整套评测要花多少钱——DeepSeek V4 Flash 0731 — 智能、性能与价格分析 里 Artificial Analysis 的智能指数评估单模型成本就有据可查;
- 速度:首 token 延迟与吞吐,直接决定对话体验。
Artificial Analysis 的「智能指数」正是把智能(Elo 式盲测)、价格、速度合为一张三维坐标,让「性价比」这个直觉变得可测量。
一句话总结
新一代基准把评测从「答题」升级为「干活」:SWE-bench 用真实 GitHub issue 和隐藏测试考编码 agent,PinchBench 用跨类别真实任务和 LLM 裁判考完整工作表现,同时把 token 效率与成本纳入成绩单——分数之外,账单同样重要。
来源
- SWE-bench:2023 年 10 月发布,2,294 个问题、12 个 Python 仓库、真实 GitHub issue + PR,论文时最佳模型 Claude 2 仅 1.96%——已核实(arXiv 2310.06770 摘要)
- SWE-bench Verified 由人工重审筛除含糊 issue:待验证(官方站点 swebench.com 口径,本次审查未能直接访问;「约 500 题」的常见说法未直接核实)
- PinchBench 三重评分与效率指标(score_per_1k_tokens / score_per_dollar):已核实(PinchBench 笔记,基于项目源码分析)
- LLM-as-judge 的偏差问题(偏爱冗长、偏好自身风格)与混合评分制衡:行业共识性结论,未逐条核实——待验证
- Artificial Analysis 智能指数含盲测与价格/速度维度、单模型评估成本 237.07 美元——已核实(DeepSeek V4 Flash 0731 — 智能、性能与价格分析 笔记)
相关笔记
- PinchBench — 本知识库中完整的智能体基准实例解析
- Kimi K3 与鹈鹕基准测试的启示 — 推理 token 消耗的直观案例
- DeepSeek V4 Flash 0731 — 智能、性能与价格分析 — 智能指数与效率指标的实例
- 番外:工程魔法 — KV Cache、量化等影响「速度与成本」的工程手段
- 第 6 章:如何读榜与自测 — 综合使用这些基准的方法