GLM-5.2 评测(2026):开放权重依旧稳健,但性价比已被 GLM-5.3 Flash 取代
GLM-5.2 评测详解 GLM-5.3 Flash 的性能、价格、上下文、开放权重和 Claude Code 支持,对照最新基准测试与 Coding Plan 成本,并为新部署、自托管和迁移给出明确建议:日常大批量任务优先 Flash,复杂编程选择完整 GLM-5.3,GLM-5.2 留给兼容和稳定自托管。

这篇 GLM-5.2 评测关注的仍是一款拥有 7530 亿参数、采用 MIT 许可证的开放权重编程模型,但它已不再是自家产品线中的性价比首选。GLM-5.3 Flash目前的标价是每百万输入 token $0.15、每百万输出 token $0.50;相比之下,Cloudflare 的 GLM-5.2 端点分别为 $1.40 和 $4.40。Flash 还带来了原生视觉能力,以及 Cloudflare 上 1,048,576 token 的上下文窗口。
GLM-5.2 评测结论
除非必须兼容现有部署,或需要精确复现旧评测,否则不建议再用 GLM-5.2 启动新的托管工作负载。对于成本敏感的智能体和多模态任务,GLM-5.3 Flash 是更合理的默认选择;如果最高编程性能比 token 成本更重要,完整规格的 GLM-5.3 更合适。如今,GLM-5.2 最有价值的定位是一条稳定、可自托管的基线。
这个结论比本文最初发布时更明确。GLM-5.2 依然兼具宽松的权重许可、长上下文和可靠的编程能力,但 Z.ai 已推出两款后继模型。现在要做的通常已不是在 GLM-5.2 与昂贵闭源模型之间二选一,而是在 Flash 和完整规格 GLM-5.3 之间选择;只有当迁移风险高于节省的成本时,才值得保留 GLM-5.2。

自 2026 年 8 月 30 日起,Cloudflare AI Search 已支持 GLM-5.3 Flash,并将其作为原生 Workers AI 生成模型,别名为 @cf/zai-org/glm-5.3-flash,上下文窗口为 1,048,576 token。这意味着 Flash 不仅能通过 Z.ai 或 Coding Plan 使用,也已进入托管式检索与生成技术栈。具体配置及其成本影响,可参阅详解 Cloudflare AI Search 与 GLM-5.3 Flash。
已有的 GLM-5.2 自托管部署,不必仅仅因为新版本出现就立即迁移。但对于新的托管部署,价格差距大到无法忽视:Flash 的输出标价低 88.6%,而且能原生处理 GLM-5.2 不支持的图像、视频和文件。
GLM-5.2 到底是什么模型?
Z.ai 于 2026 年 6 月 16 日发布 GLM-5.2,并将它定位为长周期工程模型。其官方模型卡列出了 7530 亿参数、文本输入与输出、开放权重,以及 SGLang、vLLM、KTransformers、xLLM 和 Transformers 等本地部署方案。Z.ai 直连模型支持 100 万 token 上下文和最高 128K 输出 token;Cloudflare 托管的 GLM-5.2 端点规格不同,上下文上限为 262,144 token。
初版最受关注的架构特性是 IndexShare。Z.ai 的 GLM-5.2 发布页面称,每 4 个稀疏注意力层共用一个轻量级索引器,在 100 万 token 上下文下,每 token 计算量可降低 2.9 倍。简单来说,面对超长提示词时,模型不必在每一层重复一部分代价高昂的检索工作,因此服务长时间运行的代码仓库会话所需成本更低。
GLM-5.3 是它在编程方向上的直接后继型号。Z.ai 表示,GLM-5.3 与 GLM-5.2 采用同一基础模型,性能提升来自额外的后训练。GLM-5.3 Flash 则是基于全新底座的另一条分支:总参数 3200 亿、激活参数 180 亿,采用稀疏注意力与线性注意力混合架构,并使用 30 万亿 token 的多模态语料训练。其当前文档列出的输入类型包括视频、图像、文本和文件,输出为文本,上下文为 100 万 token,最高输出为 128K token。
对实际业务而言,更小的激活规模才是关键变化。Z.ai 报告称,与完整规格 GLM-5.3 相比,它的注意力计算量减少 3.0 倍,键值缓存缩小 4.4 倍。单次请求占用的计算与内存更少,才让大幅降低 token 价格成为可能。Flash 并不是换了名字的 GLM-5.2:它改变了推理服务的成本结构,还为编程闭环增加了原生视觉反馈。
GLM-5.2 和 GLM-5.3 Flash 均继续采用 MIT 许可证,可以商用、修改和自托管。因此,它们依旧属于开放权重模型的重要选项,不过托管服务以及运行这种规模模型所需的硬件仍然要花钱。
如何客观看待 GLM-5.2 基准测试?
GLM-5.2 最初的基准成绩如今只能作为历史基线,不能代表当前排名。在 6 月的发布材料中,Z.ai 报告 GLM-5.2 在 FrontierSWE 上落后 Claude Opus 4.8 约 1 分,在 PostTrainBench 上排在 Opus 4.8 之后,并在 SWE-Marathon 上落后 13 分。对开放权重模型而言,这些结果当时很强,但它们反映的只是 6 月的产品阵容和 Z.ai 选择展示的任务。

新一轮对比改变了推荐结论。在 Z.ai 发布的 GLM-5.3 Flash 评测中,Terminal Bench 2.1 得分为 84.3,对比 GLM-5.2 的 81.0;DeepSWE v1.1 为 63.4 对 46.2;AutomationBench v1.0.6 为 48.8 对 26.2。在最大推理强度、使用 Claude Code 2.1.207 运行的 Z.ai Code Bench v1.0 中,Flash 得分 29.0,Opus 4.8 为 29.5。
这些数据有参考价值,但仍由厂商发布。公开基准在编程和智能体任务上指向同一个趋势,而私有 Code Bench 则由 Z.ai 控制。稳妥的结论是:在 Z.ai 公布的工作负载上,Flash 胜过 GLM-5.2;在 Z.ai 自有的编程评测中,它也接近 Opus 4.8。但这些结果并不能证明 Flash 在写作、分析、指令遵循或每一个生产代码仓库中都能匹敌 Opus。
GLM-5.2 价格:实际成本是多少?
按当前在线价格,为新的托管工作负载选择 GLM-5.2 已很难自圆其说。以下费率已于 2026 年 8 月 30 日对照 Z.ai 当前价格页和 Cloudflare 当前 Workers AI 价格核验。
Flash 促销仅适用于 Z.ai API,将于新加坡时间(UTC+8)2026 年 9 月 9 日 24:00 结束。Cloudflare 执行标准价格:输入 $0.15、缓存输入 $0.03、输出 $0.50。规划 Cloudflare 部署预算时,不要把 Z.ai 的临时折扣计算在内。
以输入 100 万 token、输出 100 万 token 的简单工作负载为例,GLM-5.2 或完整规格 GLM-5.3 的成本是 $5.80;Flash 按标准价计算为 $0.65,低 88.8%;Z.ai 促销期间为 $0.325,低 94.4%。真实任务的输入输出比例会变化,但选择逻辑不会变:GLM-5.2 和 GLM-5.3 位于同一价格档,Flash 则便宜得多。

GLM Coding Plan 也已有调整。Lite 仍为每月 $18,年付时折合每月 $12.60,目前公布的额度是每周 10,000 credits。Pro 每月 $80,年付时折合每月 $56,可用量为 Lite 的 6 倍;Max 每月 $168,年付时折合每月 $117.60,可用量为 Lite 的 14 倍。页面列出了 20 多款智能体工具,包括 Claude Code 和 ZCode,并继续提供 npx @z_ai/coding-helper 配置命令。
所有 Coding Plan 用户均可使用 GLM-5.3 Flash,其可用额度是完整规格 GLM-5.3 的 3 倍。套餐选择因此更直接:如果每周工作量不超过 10,000 credits,就先从 Lite 开始,需要更多容量时再升级。若要比较这套套餐与前沿模型订阅,Claude Code 价格指南更有参考价值。只有当完整规格 GLM-5.3 更强的编程能力值得消耗更多额度时,才应在套餐中选择它。
GLM-5.2 免费吗?
在 MIT 许可证下,权重可免费下载和使用。Hugging Face 托管了 GLM-5.2 权重,Z.ai 也列出了支持的本地推理框架。GLM-5.3 Flash同样如此。
但算力并不免费。GLM-5.2 有 7530 亿参数,Flash 的总参数为 3200 亿;无论自托管哪一款,都需要真正的基础设施,不是用笔记本电脑就能走的捷径。托管版 GLM-5.2 的价格是每百万输入 token $1.40、每百万输出 token $4.40;Flash 标准价为 $0.15 和 $0.50,另有上文提到的 Z.ai 临时折扣。
Cloudflare AI Search 还有一层区别。公开测试期间,AI Search 在已公布的限额内免费:Workers Free 每月包含 20,000 次查询、每天可抓取 500 个页面,但 Workers AI 生成和 AI Gateway 使用量另行计费。搜索层免费,不等于生成 token 免费。
GLM-5.2、GPT 和 Claude:谁更适合编程?
如今,有意义的问题已不是 GLM-5.2 能否偶尔接近 GPT 或 Claude,而是:开放权重、可预测的 token 成本和原生多模态输入,是否值得你接受一个更年轻的生态。GLM-5.3 Flash 让这三方面的优势都更有说服力。
与 GPT 和 Claude 相比,GLM 家族最明确的优势是控制权和成本。权重可以自托管,而 Flash 能显著降低持续输出的费用。如果用户想要的是一个能同时处理写作、分析和编程的成熟助手,而非针对特定工作负载选模型,那么闭源前沿模型的选择逻辑依然更简单。
只看编程,也不要把 6 月的 FrontierSWE 结果解读成普遍结论。GLM-5.2 在一项历史基准中只落后 Opus 4.8 约 1 分,从来不等于它在所有场景下能力相当。Flash 改善了成本与能力组合,完整规格 GLM-5.3 则以与 GLM-5.2 相同的 API 价格主攻最困难的编程任务。更换生产工作流前若想获得更全面的比较,前沿编程模型指南仍是更好的起点。Kimi K3 评测则介绍了另一款开放权重替代方案,其成本与性能取舍有所不同。
谁适合继续用 GLM-5.2,谁应该跳过?
如果现有自托管技术栈运行稳定、评测必须保持可复现,或依赖项已固定到 GLM-5.2 的行为,就继续使用它。新版本发布,并不会让一套正常工作的部署突然变错。
新的大批量智能体任务、视觉编程、文档处理或 Cloudflare AI Search 生成任务,应该选择 GLM-5.3 Flash。它的 token 标价接近 GLM-5.2 的九分之一,支持视觉和文件输入,并在 Cloudflare 上提供更大的上下文窗口。如果复杂编程能力比吞吐量更重要,则选择完整规格 GLM-5.3;它的 API 价格与 GLM-5.2 不变,因此几乎没有理由以同样费率启动新的付费 GLM-5.2 编程工作负载。
如果任务量很小,模型成本可以忽略;或者更换模型所增加的验证工作超过每月节省的费用,那就不必迁移。厂商基准不能取代来自你自己代码仓库的代表性任务。
下一步很明确:先用 GLM-5.3 Flash 跑一个真实的代码仓库任务,记录输出 token、耗时以及必须修正的内容,再用完整规格 GLM-5.3 重复一次。如果 Flash 达到你的质量标准,就把它设为日常默认,将完整模型留给需要升级处理的任务。若使用 Cloudflare AI Search,则选择 @cf/zai-org/glm-5.3-flash 作为生成模型,首次对比时保持检索部分不变。
GLM-5.2 是中国模型吗?
是。Z.ai 的公司历史显示,ZhipuAI 于 2019 年基于 Tsinghua University 的技术创立。GLM-5.2 和 GLM-5.3 Flash 的权重都采用 MIT 许可证,因此,对数据存储位置有严格要求的团队可以评估自托管,无需将提示词发送到托管端点。
GLM-5.2 免费吗?
采用 MIT 许可证的权重可免费下载和使用。托管推理则需要付费:当前价格显示,GLM-5.2 每百万 token 的输入费用为 $1.40,输出费用为 $4.40。硬件和运维也意味着自托管会产生实际成本。
GLM-5.2 编程能力比 GPT 更强吗?
不能一概而论。Z.ai 在 6 月发布的数据表明,GLM-5.2 在部分长周期编程基准上接近顶级闭源模型;但在 Z.ai 后续公布的编程评测中,GLM-5.3 和 GLM-5.3 Flash 已经超越它。GLM-5.2 目前最有力的卖点是开放权重和兼容性,而不是最新的性能领先地位。
GLM-5.2 能与 Claude Code 搭配使用吗?
可以。GLM Coding Plan支持 Claude Code 和 20 多款智能体工具。所有套餐用户现在都能使用 GLM-5.3 Flash,而且其可用额度是完整规格 GLM-5.3 的 3 倍,因此更适合作为日常任务的首选测试模型。
是否应该把 GLM-5.2 放进现有技术栈,通常取决于编程智能体的连接方式。我把如何在不破坏工作流的前提下,将智能体切换到更便宜模型的操作步骤整理成了一份免费的 Claude Code 与 Codex 配置清单。订阅 newsletter即可领取,并获取每周值得切换模型的精选解读。
2026年9月3日







