概述

GLM-5.2 刚刚发布,这是开源模型能力的又一次进步。互联网立刻炸了锅,很难分辨哪些是真实力、哪些是炒作。

所以我们拿它和 Claude Opus 4.8 做了一次正面交锋:同样的 one-shot prompt,用原生 WebGL 从零构建一个 3D 平台游戏。以下是我们在跑完测试、深挖基准数据和评估各方反馈后的判断。

我们不打算把主力从 Opus 切走。 在我们的测试中,Opus 更快,产出的游戏更干净、更正确,而且它能检查自己的视觉输出——纯文本的 GLM-5.2 做不到这一点。但 GLM-5.2 应该在武器库里占有一席之地:它是一个真正有能力、价格仅为其零头的模型,而且因为是开源权重,它永远可用。闭源模型随时可能在毫无预警的情况下退役或受限(Fable 是最近的例子);能下载到本地的权重,谁也拿不走。

你可以现在就玩两个游戏,或者获取源码:

两个都是浏览器游戏,完全从零编写,没有使用任何游戏引擎或 Three.js 之类的 3D 渲染库。3D 模型来自 Kenney 的免费 CC0 资产包。

以下是两次运行的对比数据:

指标GLM-5.2(Pi/OpenRouter)Opus(Claude Code)
实际构建时间1h 10m 40s33m 30s
输出 Token131,000216,809
峰值上下文窗口占用1M 的 16%1M 的 19%
工具调用次数128153
成本$5.39(实际账单)~$21.92(按官方定价估算)

GLM-5.2 成本仅为 Opus 的零头。Opus 用一半时间完成,产出的游戏也更干净。

纸面上,基准测试将 GLM-5.2 排在顶级闭源模型之后不远处,而网络上的讨论既有真实信号也有水军痕迹。我们下面逐一分析,先从游戏开始。

GLM-5.2 是什么

GLM-5.2 是智谱 AI(Z.ai)最新的旗舰模型。MIT 许可开源权重,可以下载、自己部署,或通过智谱 API 调用。

它专为长时间跨度的任务设计——那些持续数小时的多步骤编程 Agent 工作。配备 1M token 上下文窗口和两档思考强度(High 和 Max),在速度和能力之间取舍。

注意:GLM-5.2 是纯文本模型,不支持多模态。它不能”看”图片,所以依赖截图或图表的工作流仍然需要 Claude Opus。

智谱官方将其定位在 Claude Opus 4.7 和 4.8 之间,在相近的 token 用量下。以下是他们的发布公告供参考:

定价与获取

因为开源权重,GLM-5.2 很便宜。通过 API 调用价格仅为 Opus 的零头,有硬件的话甚至可以免费自己跑。

每百万 Token 定价(供应商文档):

输入缓存读取输出
Claude Opus 4.8$5$0.50$25
GLM-5.2$1.4$0.26$4.4

在输出 token 上,GLM-5.2 的价格不到 Opus 的五分之一。

权重托管在 Hugging Face 和 ModelScope,MIT 许可,无地区限制。可以通过 vLLM、SGLang 或 Transformers 等框架本地部署。

我们的手感测试:从零构建 3D 游戏

为了穿透各种主观感受,我们给了 Opus 4.8 和 GLM-5.2 完全相同的 one-shot prompt:用原生 WebGL 从零构建一个 3D 平台游戏,不使用任何游戏引擎或 3D 库。

为什么选这个任务

模型可以零样本产出一个漂亮的落地页,而社区已经不把这种测试当回事了。但原生 WebGL 3D 平台游戏不是写一个漂亮文件就能糊弄过去的。它有真实的结构:GLB 模型解析器、矩阵和向量数学、GLSL 着色器、骨骼蒙皮动画、固定时间步长循环、碰撞检测、跟随摄像机。

这种结构同时测试了人们争论的两个方面。在多个步骤中维持分层、多文件构建是 Agent 能力的部分,也是 GLM-5.2 应该强的地方。而把引擎内部细节搞对——那些看起来正常但静悄悄地出错的细节——是推理和品味的部分,Opus 应该在这里领先。

我们把 3D 资产打包在本地,所以测试的是引擎和渲染,而不是 harness 能不能下载模型文件。美术资产是人工制作的——Kenney 的 CC0 平台游戏套件,两个 Agent 拿到的文件完全一致。

每个模型需要构建什么

要完成任务,每个模型需要构建:

  • 一个原生 WebGL 的 3D 引擎和渲染器,不用 Three.js 或任何库;
  • 一个加载器,用于加载提供的 3D 角色和场景模型;
  • 一个可以在竞技场中奔跑跳跃的角色,包含重力和碰撞;
  • 一个跟随摄像机和键盘控制;
  • 整个项目能在浏览器中一键运行。

两者几乎手工完成了全部:GLB 二进制解析器、矩阵和四元数数学、带 GLSL 蒙皮着色器的 WebGL2 渲染器,以及子步进 AABB 碰撞检测防止角色穿透平台。

两者拿到相同的 prompt、相同的资产,只允许一次尝试,不给提示。Opus 4.8 用 extended thinking high 模式,GLM-5.2 用 thinking high(GLM-5.2 还有一个更高的 Max 档我们没有使用)。你可以自行深入查看两次运行:

耗时与成本

Opus 4.8 在 Claude Code 中构建;GLM-5.2 在 Pi 上通过 OpenRouter 构建。

并排缩时回放显示完整构建过程被压缩:Opus 在约一半的墙上时间里完成工作,GLM-5.2 耗时更长但花费少得多。详细数字见文章开头的对比表。

试玩两款游戏

我们把两个游戏从头玩到尾。以下是各自的体验。

两款游戏是同类型的:第三人称 3D 平台游戏,操作方式相同。WASD 或方向键移动,空格跳跃,Shift 冲刺,鼠标拖拽旋转摄像机视角,滚轮缩放。目标也一样:收集平台上的金币,到达终点旗帜,避开尖刺陷阱,掉出世界回到起点。

GLM-5.2

GLM-5.2 的游戏看起来有些粗糙。从游玩过程来看:

  • 整体观感不太好;
  • 角色缺少部分材质;
  • 尖刺陷阱不会杀死角色;
  • 到达旗帜没有任何反应,没有胜利条件。

所以它并不出色。但它做对了一件事:弹簧。

你可以跳到弹簧上弹到下一个平台。

Opus

Opus 的游戏更干净,玩起来也不错。从游玩过程来看:

  • 摄像机和控制器运行正常;
  • 尖刺陷阱会杀死玩家,逻辑是正确的。但它被放在关卡边缘而非必经之路上,需要特意走过去才会碰到;
  • 整体观感好,可以到达旗帜获胜,有真正的胜利条件。

动画流畅,纹理贴图正确。

每个模型如何检查自己的工作

两个模型都被要求完成前验证自己的工作。Agent 验证的常见方式是截图查看成品,检查是否有损坏或缺失。Opus 在会话中正是这样做的。

GLM-5.2 在这里遇到了问题,因为它不能”看”图片。它不支持多模态。所以它退而求其次用了变通方案:写脚本来读取原始像素数据,检查颜色是否大致符合预期。

为什么 GLM-5.2 的自检漏掉了 bug

因为看不到自己保存的截图,GLM-5.2 试图通过采样像素来验证画面。以下是它最终报告中的一段,描述它如何”分析”保存的图片:

final_start/overview/flag.png 色彩分析结果:草绿色、泥土棕色、金币金色、旗帜红色、角色偏蓝、半兰伯特光照、无黑色

它期望的颜色都在,于是确认游戏完成并停止。但从它自己保存的最终截图可以看到:角色是缺少纹理的灰色平面,调试覆盖层仍然挂在场景上。一个能真正”看”截图的 Agent 很可能发现这两个问题并回头修复。

在需要视觉结果的任务上,理解图像的能力给了模型一个真正的优势。

Opus 如何检查自己的工作

Opus 是多模态的,可以直接读取截图。它的 harness 渲染游戏并捕获了一帧,Opus 在验证时检查了这张图片。以下是它会话中的记录:

最终场景渲染正确:带草地的方块和棕色泥土侧面、向上延伸的阶梯、金色/银色金币和宝石、右侧岛上的蓝色尖刺方块危险物、顶部的红色目标旗帜、角色站在起点广场上、记分 HUD。光照和着色正确,几何体干净。

因为能看见画面,Opus 注意到了遗留在屏幕上的调试输出并清除了它们。

Bug

两个游戏都有 bug。以下是各自的故障。

GLM-5.2

GLM-5.2 的 bug 频繁且明显,有好几个是基础性问题:

  • 角色面朝错误方向:移动方向是正确的,但角色模型自始至终是反着的;
  • 纹理缺失和头部消失:角色渲染为平坦灰色而非带纹理,而且当摄像机移动时头部会消失。Kenney 模型使用的是独立文件中共享的调色板而非内嵌,GLM-5.2 的渲染器从未加载这个文件,于是退回到默认颜色。Opus 加载了调色板,角色呈现出应有的纹理;
  • 死亡尖刺不生效:角色直接落在尖刺上,什么都没发生。没有死亡,没有重置。

Opus

Opus 的 bug 更少且更细微,属于边缘情况而非基础功能损坏:

  • 站在虚空中:角色可以悬停在平台旁的半空中不掉落。这是 coyote-time 的宽限期(刚踏出边缘后仍可跳跃的短暂窗口),调得有点过于慷慨——一个打磨特性稍微做过头,而非基础功能损坏;
  • 过早获胜:角色离旗帜还很远就触发了胜利条件。

测试揭示了什么

两个模型都构建了一个可运行的 3D 游戏,这本身已经很了不起——就在一年前这还无法想象。但差异是真实的。

Opus 更快(一半时间),更干净(纹理、动画、胜利条件全都对),而且能有效地检查自己的视觉输出。GLM-5.2 交出了一个粗糙但功能更多的游戏——弹簧机制是 Opus 没有实现的巧思——成本仅为 Opus 的零头,且使用了一个远不如 Claude Code 优化得好的 Agent harness。

缺少多模态能力是 GLM-5.2 最大的实际短板。在一个视觉输出是关键的任务中,只能读文本的模型在每个环节都处于劣势:构建、调试、自检。

基准测试

在跑自己的测试之外,我们还考察了第三方基准测试的现状。以下是各模型在几个编码和 Agent 基准测试中的对比。这里只包括我们能够确认其基准框架对等运行的测试。

SWE-bench Pro(Scale AI)

SWE-bench Pro 在真实仓库中测试修复真实 bug,通常需要跨多个文件修改。任务文件通过专业软件工程师交叉验证确保有唯一的正确修复方案。

模型分数报告链接
Claude Opus 4.854.0%链接
GLM-5.224.1%链接

差距很大。Opus 在 SWE-bench Pro 上几乎是 GLM-5.2 的 2.2 倍。

DeepSWE

DeepSWE 是由 DataCurve 管理的 Agent 软件工程基准测试,在无网络连接的沙箱容器中运行。每个任务是一个独立的 Docker 容器,Agent 从 README 开始,必须找出要修复什么以及如何修复。

模型分数
Claude Opus 4.863.7%
GLM-5.237.8%

NL2Repo

NL2Repo 要求根据单份书面规格说明构建完整的、可运行的代码仓库。

模型分数
Claude Opus 4.857.2%
GLM-5.226.7%

ProgramBench

ProgramBench 给基准测试增加了一层难度:模型只获得已编译的二进制文件和文档,没有源码也没有规格说明。它必须重建整个程序。

模型分数
Claude Opus 4.863.3%
GLM-5.245.0%

Terminal Bench 2.1

Terminal Bench 通过真实终端完成任务。下表中两行分别使用固定 harness(Terminus-2)和每个模型的最佳 harness。

模型Terminus-2 分数最佳 harness 分数
Claude Opus 4.863.0%65.9%
GLM-5.241.4%44.2%

SWE-Marathon

SWE-Marathon 包含二十个超长跨度工程任务,每个任务需要运行数小时。

模型分数
Claude Opus 4.849.1%
GLM-5.28.3%

Opus 在 SWE-Marathon 上的优势是所有基准测试中最大的,接近 6 倍。

MCP-Atlas

MCP-Atlas 测试工具使用能力,在真实 MCP 服务器上运行,每个任务需要多次工具调用。

模型分数
Claude Opus 4.869.6%
GLM-5.242.2%

Tool-Decathlon

Tool-Decathlon 测试跨多个真实应用的长时间跨度任务,每个需要一系列长的工具调用链。

模型分数
Claude Opus 4.863.1%
GLM-5.210.1%

差距再次很大。GLM-5.2 在长工具调用链上明显吃力。

人们的评价

基准测试和我们自己的测试是一回事,网上的反应是另一回事。很多讨论来自没有过往记录账号的炒作,所以我们只关注判断力经得起时间检验的人和机构。

Simon Willison:“很可能是最强大的纯文本开源权重 LLM”

Simon Willison 多年来几乎报道过每个值得关注的模型发布。他称 GLM-5.2 “很可能是最强大的纯文本开源权重 LLM”。

他的标准测试是让模型生成一个骑自行车的鹈鹕 SVG。GLM-5.2 返回了一个完全动画化且没有任何损坏的版本,他称之为”非常令人印象深刻”。

第二个测试——一只骑滑板车的负鼠——表现却比 GLM-5.1 之前的某个版本更差。所以它很强,但并非全面碾压。

Artificial Analysis:顶级开源模型,但吃 Token

独立基准测试组织 Artificial Analysis 将 GLM-5.2 评为 Intelligence Index 上的领先开源权重模型。得分 51,领先于 MiniMax-M3、DeepSeek V4 Pro 和 Kimi K2.6,并且在其成本-智能前沿曲线上处于同级别最便宜模型的位置。

他们指出的问题与我们的发现一致:它吃 Token。每个任务大约使用 43k 输出 token,大部分是推理 token,超过了他们测量的任何其他领先开源模型。

Nathan Lambert:开源与闭源的差距正在缩小

Nathan Lambert 在 Allen Institute for AI 以追踪开源权重模型为业。考察 GLM-5.2 在 LMArena 排行榜上的位置后,他认为”你可以说他们的 Agent 比 Gemini 的还好”,并称其为 MIT 许可开源模型的”了不起的成就”。

他的更广泛观点是:中国实验室用少得多的算力达到了这些分数,不应被轻视,即使美国顶级模型总体上仍然领先。这与我们的测试相符——Opus 领先,但 GLM-5.2 比其价格和开放性所暗示的要更接近。

结论

那么,炒作是真的吗?基本是的。

GLM-5.2 是一个真正强大的开源模型,价格仅是 Opus 的零头。对于大量工作场景,这个组合很难被击败。但它不是 Opus。在我们的测试中,Opus 更快,产出的游戏更干净、更正确,而且能够通过”看”来检查自己的工作。GLM-5.2 便宜得多,但更粗糙,且是纯文本的。

当成本和开放性重要、且工作内容主要是文本和逻辑时,用 GLM-5.2。当正确性、打磨程度和视觉判断重要、且你愿意为此付费时,用 Opus。但无论如何要把 GLM-5.2 留在武器库里:它是少有的、没有哪个供应商能从你手中夺走的前沿级别模型。