GPT-5.4 vs GLM-5:开源终于追上闭源 AI 了吗?

原文:https://www.freecodecamp.org/news/gpt-5-4-vs-glm-5-is-open-source-finally-matching-proprietary-ai/


概述

2026年3月27日,智谱 AI(Zhipu AI)悄悄推送了其开源权重模型系列的更新。他们声称 GLM-5.1 在编程基准测试中达到了 Claude Opus 4.6 的 94.6% 性能。相比六周前发布的 GLM-5,这是 28% 的提升。

开源的故事并没有放缓,它正在加速。

然而,大多数庆祝这些头条新闻的团队却无法运行他们所庆祝的模型。自行托管 GLM-5 需要约 1,490GB 内存

开源与闭源 AI 之间的差距在基准测试上已经缩小,但”开放”和”可访问”不是同一个词。将它们视为同义词是当今团队可能犯下的最昂贵的错误。

以下内容将探讨重要的基准测试、新闻稿遗漏的基础设施现实,以及为需要交付产品的团队提供的决策框架。

本次对比的两个核心模型是:

  • GPT-5.4:OpenAI 最强大的前沿专业模型,2026年3月5日发布
  • GLM-5:中国智谱 AI 发布的 7440 亿参数开源权重模型,2026年2月11日发布

GPT-5.4 代表了闭源 AI 的当前天花板:一个将编程和推理统一为单一系统的模型,拥有 100 万 token 上下文窗口、原生计算机使用能力,以及 OpenAI 完整平台的支持。

GLM-5 代表了不同的东西:第一个突破 Intelligence Index 50 分的开源权重模型,完全使用国产中国硬件训练,以 MIT 许可证免费可用。

现在的问题从哪个模型在某个排行榜上得分更高,转变为它们之间的差距对做出真实基础设施决策的团队意味着什么。


GLM-5 的成就

GLM-5 是一个 7440 亿参数的模型,每次前向传播激活 400 亿参数。它采用稀疏 MoE 架构,在 28.5 万亿 token 上训练。

该模型于 2026年2月11日由智谱 AI 发布,这是一家清华大学衍生的公司,已在香港 IPO,上一轮融资筹集了 5.58 亿美元。许可证是 MIT,意味着可以无限制地商业使用。

Artificial Analysis Intelligence Index v4.0 是一个独立基准,聚合了 10 项评估,涵盖智能体任务、编程、科学推理和通用知识。

与单一任务基准不同,它旨在衡量模型在人们实际付费让 AI 完成的工作类型中的整体能力。分数经过标准化,即使最好的前沿模型也只在 50-57 分左右,保持它们之间有意义的区分度。

GLM-5 在该指数上得分 50,这是任何开源权重模型首次突破该阈值。GLM-4.7 得分 42。这 8 分的跃升来自智能体性能的改进和幻觉率降低 56 个百分点。

Arena(原 LMArena) 上,这个由 UC Berkeley 发起的人类偏好基准测试中,GLM-5 在发布时在 Text Arena 和 Code Arena 中都排名第一(在开源模型中),整体与 Claude Opus 4.5 和 Gemini 3 Pro 持平。这是人类偏好,而非自动化基准测试。

SWE-bench Verified:77.8%,开源模型最高分。唯一得分更高的是 Claude Opus 4.6(80.8%)和 GPT-5.2(80.0%)。在启用工具的 Humanity’s Last Exam 上,GLM-5 得分 50.4,超过 GPT-5.2 的 45.5。

所以 GLM-5 确实具有竞争力。但具体在什么方面?Intelligence Index 差距讲述了一部分故事。其余部分存在于 GPT-5.4 仍然领先的特定基准测试中。


GPT-5.4 仍然领先的地方

差距并非虚构。在 Artificial Analysis Intelligence Index 上,GPT-5.4 得分 57,GLM-5 得分 50,与 Gemini 3.1 Pro Preview 并列 427 个模型中的第一名。

Terminal-Bench 是差距最明显的地方。它衡量模型在实际 shell 环境中执行真实终端任务的能力:文件编辑、Git 操作、构建系统、CI/CD 管道和系统调试。

与测试模型能否在隔离环境中编写代码的基准不同,Terminal-Bench 评估模型能否像开发者一样操作计算机。

根据 OpenAI 的 API 文档GPT-5.4 得分 75.1%,比下一个闭源模型领先 9.7 个百分点。如果你的团队做 DevOps、基础设施即代码或 CI/CD 调试,这个基准直接映射到你的实际工作。

上下文窗口是另一个差异化因素。GPT-5.4 处理 105 万 token,而 GLM-5 限制在 20 万。对于需要跨大型代码库规划或综合多文档研究的智能体工作流,这不是规格差异,而是能力差异。

原生计算机使用是另一个优势。这意味着模型可以直接通过截图、鼠标命令和键盘输入与桌面软件交互,无需单独的插件或包装器。

GPT-5.4 是 OpenAI 首个内置此功能的通用模型,而 GLM-5 是纯文本,无图像输入。如果你正在构建与 UI 交互或需要多模态推理的智能体,你无法为此使用 GLM-5。

OpenAI 还声称通过称为 tool search 的功能,在工具密集型工作流中减少了 47% 的 token,如果你按 token 付费,这是真实的效率提升。

在定价方面,GPT-5.4 的 250 美元/百万输入 token 和 1500 美元/百万输出 token 比 GLM-5 的 API 贵 4.2 倍。但长上下文定价在超过 272,000 token 时翻倍至 500 美元/百万输入 token,如果你运行大上下文智能体,这是你会感受到的税费。

基准数字没有捕捉到一个更深层次的问题,它最可能绊倒那些急于采用开源的团队。


“开放”不等于”可访问”

MIT 许可证是真实的,权重是可下载的,但以原生 BF16 精度运行 GLM-5 需要约 1,490GB 内存。FP8 模型的推荐生产设置是 8 张 H200 GPU,每张 141GB 内存。那是一个 GPU 集群,不是单工作站上能启动的东西。

以美元计算,一张二手或租赁的 H100 运行成本为 15,000-25,000 美元。8 张 H200 不是初创公司的采购。对于大多数真实使用量,自行托管 GLM-5 的基础设施成本与直接调用 OpenAI API 相当或更高。

有一条量化路径。量化是一种通过以较低数值精度表示权重来减少模型内存占用的技术 — 例如,从 16 位压缩到 2 位值。它使大型模型能在较小硬件上运行,但会牺牲一些准确性。

Unsloth 的 2 位 GGUF 将内存使用减少到 241GB,可以放入 Mac 的 256GB 统一内存中。但量化会降低模型质量。那个 77.8% 的 SWE-bench 分数是针对全精度模型的,你从量化本地部署获得的数字会更低。

诚实的替代方案是使用托管的 GLM-5 API。DeepInfra 收费 0.80 美元/百万输入 token,Novita 收费 1.00 美元/百万输入 token。你可以在没有硬件的情况下获得模型,但这样你就不是自行托管了。你只是在用更便宜的 API,而数据主权、隐私和供应商锁定的论点都烟消云散了。

“开源权重”在 2026 年越来越意味着对拥有 GPU 集群的企业开放、对拥有云积分的研究人员开放、对愿意接受量化质量权衡的团队开放。它并不意味着对想要避免 API 账单的中位数开发者开放。

悖论是真实的:开放权重,但非开放访问。这并不意味着选择是不可能的。它只是意味着选择必须是诚实的。


正确的问题不是哪个模型获胜

GLM-5 via APIGPT-5.4自行托管 GLM-5
最适合成本敏感,上下文低于 200K终端、计算机使用、长上下文有现有 GPU 基础设施的受监管环境
定价$0.80/百万输入 (DeepInfra)$2.50/百万输入仅硬件成本
上下文窗口200K tokens105万 tokens200K tokens
图像输入
数据主权
需要自行托管

正确的模型完全取决于你的团队试图优化什么。

使用 GLM-5 via API 当:

  • 成本效率是主要约束
  • 数据驻留对中国来源模型不是关注点
  • 你的工作流不需要多模态或图像输入
  • 上下文需求保持在 20 万 token 以下
  • 你想实验开源权重研究或为其做贡献

GLM-5 API 很便宜,如果每美元 token 是你的主导变量,它很难被击败。

使用 GPT-5.4 当:

  • 你的工作流是终端密集型或涉及计算机使用
  • 超过 20 万 token 的长上下文连贯性很重要
  • 你需要多模态输入
  • 你的团队已经嵌入 OpenAI 生态系统
  • 大规模响应一致性是不可妥协的

你支付的溢价是真实的,但对于某些工作负载,一致性和能力证明了它的价值。

考虑自行托管 GLM-5 仅当:

  • 你的组织已有 GPU 集群基础设施或预算来构建一个
  • 数据主权关注是记录和具体的,而非假设的
  • 你有 ML 基础设施能力来管理部署、更新和监控

自行托管一个 7440 亿参数的模型不是一个周末项目。

盈亏平衡数学值得计算。 通过 DeepInfra 约 0.80 美元/百万 token,一个团队每月需要处理超过 10 亿 token,自行托管在 15,000 美元 H100 硬件上才开始回本。大多数团队达不到那个量级,而达到的团队可能已经拥有基础设施。


这一刻意味着什么

基准差距已经缩小。这是真实的、重大的、历史性的。2023 年底开源与闭源模型之间的 MMLU 差距为 17.5 分,现在实际上为零。GLM-5 在 Intelligence Index 上得分 50,是第一个做到这一点的开源权重模型,这是一个真正的里程碑。

但差距缩小的方式与差距缩小的事实同样重要。它是通过架构创新如 DSA 稀疏注意力、MoE 效率、异步强化学习 缩小的,而非通过民主化的计算能力。

缩小差距的模型仍然很大,以完整保真度部署仍然昂贵,仍然由具有重要机构支持的中国实验室主导。

闭源的护城河不再是因为他们拥有更好的模型。现在它是更好的平台、更好的生态系统、更好的上下文窗口、更好的企业支持,以及不需要 GPU 集群的部署路径。这是一条更窄的护城河,但它仍然是一条护城河。

2026 年的问题不是选择开源还是闭源。而是你支付的溢价换来了什么,以及这对你的特定工作流是否值得。对于某些团队,答案会翻转。对于许多团队,还不会。

大多数阅读本文的团队不会做数学计算。他们会看到”开源”就假设它意味着更便宜。他们会看到”GLM-5 在基准测试上与 GPT-5.4 匹配”就假设他们可以无权衡地互换使用。

这些假设就是你最终得到不知道如何操作的 50,000 美元 GPU 集群,或因为你的量化模型无法处理长上下文而导致生产中断的原因。

基准所说的与模型在你实际环境中所做的之间的差距,就是工程判断存在的地方。如果你将判断外包给头条新闻,你不是在省钱。你只是将成本推迟到它以事件形式出现。


总结

维度GLM-5GPT-5.4
参数规模7440 亿 (400 亿激活)未公开
Intelligence Index5057
SWE-bench77.8%~80%
上下文窗口200K105万
图像输入
计算机使用
API 价格$0.80/百万输入$2.50/百万输入
自托管成本~$120,000+ (8x H200)不可自托管
许可证MIT闭源
最佳场景成本敏感、短上下文复杂任务、长上下文、多模态

核心洞察:

  1. 开源模型在基准测试上已追上闭源,但部署成本仍是主要障碍
  2. “开放权重” ≠ “开放访问” — 大多数开发者无法自行托管 GLM-5
  3. 选择应基于实际工作流需求,而非头条新闻
  4. 对于大多数团队,API 调用仍是更实际的选择