GLM-5.2 评测(2026):开放权重依旧稳健,但性价比已被 GLM-5.3 Flash 取代

GLM-5.2 评测详解 GLM-5.3 Flash 的性能、价格、上下文、开放权重和 Claude Code 支持,对照最新基准测试与 Coding Plan 成本,并为新部署、自托管和迁移给出明确建议:日常大批量任务优先 Flash,复杂编程选择完整 GLM-5.3,GLM-5.2 留给兼容和稳定自托管。

Thursday, September 3, 2026Omid Saffari
GLM-5.2 评测(2026):开放权重依旧稳健,但性价比已被 GLM-5.3 Flash 取代

这篇 GLM-5.2 评测关注的仍是一款拥有 7530 亿参数、采用 MIT 许可证的开放权重编程模型,但它已不再是自家产品线中的性价比首选。GLM-5.3 Flash目前的标价是每百万输入 token $0.15、每百万输出 token $0.50;相比之下,Cloudflare 的 GLM-5.2 端点分别为 $1.40 和 $4.40。Flash 还带来了原生视觉能力,以及 Cloudflare 上 1,048,576 token 的上下文窗口。

GLM-5.2 评测结论

除非必须兼容现有部署,或需要精确复现旧评测,否则不建议再用 GLM-5.2 启动新的托管工作负载。对于成本敏感的智能体和多模态任务,GLM-5.3 Flash 是更合理的默认选择;如果最高编程性能比 token 成本更重要,完整规格的 GLM-5.3 更合适。如今,GLM-5.2 最有价值的定位是一条稳定、可自托管的基线。

这个结论比本文最初发布时更明确。GLM-5.2 依然兼具宽松的权重许可、长上下文和可靠的编程能力,但 Z.ai 已推出两款后继模型。现在要做的通常已不是在 GLM-5.2 与昂贵闭源模型之间二选一,而是在 Flash 和完整规格 GLM-5.3 之间选择;只有当迁移风险高于节省的成本时,才值得保留 GLM-5.2。

Z.ai GLM-5.2 产品页面
GLM-5.2(Z.ai)

自 2026 年 8 月 30 日起,Cloudflare AI Search 已支持 GLM-5.3 Flash,并将其作为原生 Workers AI 生成模型,别名为 @cf/zai-org/glm-5.3-flash,上下文窗口为 1,048,576 token。这意味着 Flash 不仅能通过 Z.ai 或 Coding Plan 使用,也已进入托管式检索与生成技术栈。具体配置及其成本影响,可参阅详解 Cloudflare AI Search 与 GLM-5.3 Flash

已有的 GLM-5.2 自托管部署,不必仅仅因为新版本出现就立即迁移。但对于新的托管部署,价格差距大到无法忽视:Flash 的输出标价低 88.6%,而且能原生处理 GLM-5.2 不支持的图像、视频和文件。

GLM-5.2 到底是什么模型?

Z.ai 于 2026 年 6 月 16 日发布 GLM-5.2,并将它定位为长周期工程模型。其官方模型卡列出了 7530 亿参数、文本输入与输出、开放权重,以及 SGLang、vLLM、KTransformers、xLLM 和 Transformers 等本地部署方案。Z.ai 直连模型支持 100 万 token 上下文和最高 128K 输出 token;Cloudflare 托管的 GLM-5.2 端点规格不同,上下文上限为 262,144 token。

初版最受关注的架构特性是 IndexShare。Z.ai 的 GLM-5.2 发布页面称,每 4 个稀疏注意力层共用一个轻量级索引器,在 100 万 token 上下文下,每 token 计算量可降低 2.9 倍。简单来说,面对超长提示词时,模型不必在每一层重复一部分代价高昂的检索工作,因此服务长时间运行的代码仓库会话所需成本更低。

GLM-5.3 是它在编程方向上的直接后继型号。Z.ai 表示,GLM-5.3 与 GLM-5.2 采用同一基础模型,性能提升来自额外的后训练。GLM-5.3 Flash 则是基于全新底座的另一条分支:总参数 3200 亿、激活参数 180 亿,采用稀疏注意力与线性注意力混合架构,并使用 30 万亿 token 的多模态语料训练。其当前文档列出的输入类型包括视频、图像、文本和文件,输出为文本,上下文为 100 万 token,最高输出为 128K token。

对实际业务而言,更小的激活规模才是关键变化。Z.ai 报告称,与完整规格 GLM-5.3 相比,它的注意力计算量减少 3.0 倍,键值缓存缩小 4.4 倍。单次请求占用的计算与内存更少,才让大幅降低 token 价格成为可能。Flash 并不是换了名字的 GLM-5.2:它改变了推理服务的成本结构,还为编程闭环增加了原生视觉反馈。

GLM-5.2 和 GLM-5.3 Flash 均继续采用 MIT 许可证,可以商用、修改和自托管。因此,它们依旧属于开放权重模型的重要选项,不过托管服务以及运行这种规模模型所需的硬件仍然要花钱。

如何客观看待 GLM-5.2 基准测试?

GLM-5.2 最初的基准成绩如今只能作为历史基线,不能代表当前排名。在 6 月的发布材料中,Z.ai 报告 GLM-5.2 在 FrontierSWE 上落后 Claude Opus 4.8 约 1 分,在 PostTrainBench 上排在 Opus 4.8 之后,并在 SWE-Marathon 上落后 13 分。对开放权重模型而言,这些结果当时很强,但它们反映的只是 6 月的产品阵容和 Z.ai 选择展示的任务。

2026 年 6 月 GLM-5.2 与同期闭源模型的 FrontierSWE 历史对比
GLM-5.2 最初的发布对比如今只是一张历史快照,并非 GLM 当前排名。

新一轮对比改变了推荐结论。在 Z.ai 发布的 GLM-5.3 Flash 评测中,Terminal Bench 2.1 得分为 84.3,对比 GLM-5.2 的 81.0;DeepSWE v1.1 为 63.4 对 46.2;AutomationBench v1.0.6 为 48.8 对 26.2。在最大推理强度、使用 Claude Code 2.1.207 运行的 Z.ai Code Bench v1.0 中,Flash 得分 29.0,Opus 4.8 为 29.5。

这些数据有参考价值,但仍由厂商发布。公开基准在编程和智能体任务上指向同一个趋势,而私有 Code Bench 则由 Z.ai 控制。稳妥的结论是:在 Z.ai 公布的工作负载上,Flash 胜过 GLM-5.2;在 Z.ai 自有的编程评测中,它也接近 Opus 4.8。但这些结果并不能证明 Flash 在写作、分析、指令遵循或每一个生产代码仓库中都能匹敌 Opus。

GLM-5.2 价格:实际成本是多少?

按当前在线价格,为新的托管工作负载选择 GLM-5.2 已很难自圆其说。以下费率已于 2026 年 8 月 30 日对照 Z.ai 当前价格页和 Cloudflare 当前 Workers AI 价格核验。

模型输入 / 1M缓存输入 / 1M输出 / 1M
GLM-5.2$1.40$0.26$4.40
GLM-5.3$1.40$0.26$4.40
GLM-5.3 Flash$0.15 标准价,$0.075 促销价$0.03 标准价,$0.015 促销价$0.50 标准价,$0.25 促销价

Flash 促销仅适用于 Z.ai API,将于新加坡时间(UTC+8)2026 年 9 月 9 日 24:00 结束。Cloudflare 执行标准价格:输入 $0.15、缓存输入 $0.03、输出 $0.50。规划 Cloudflare 部署预算时,不要把 Z.ai 的临时折扣计算在内。

以输入 100 万 token、输出 100 万 token 的简单工作负载为例,GLM-5.2 或完整规格 GLM-5.3 的成本是 $5.80;Flash 按标准价计算为 $0.65,低 88.8%;Z.ai 促销期间为 $0.325,低 94.4%。真实任务的输入输出比例会变化,但选择逻辑不会变:GLM-5.2 和 GLM-5.3 位于同一价格档,Flash 则便宜得多。

GLM-5.2 API 价格、Coding Plan 起步价、缓存折扣和支持的工具数量
GLM-5.2 基准价格仍为输入 $1.40、输出 $4.40,Coding Plan Lite 每月 $18;Flash 单独定价。

GLM Coding Plan 也已有调整。Lite 仍为每月 $18,年付时折合每月 $12.60,目前公布的额度是每周 10,000 credits。Pro 每月 $80,年付时折合每月 $56,可用量为 Lite 的 6 倍;Max 每月 $168,年付时折合每月 $117.60,可用量为 Lite 的 14 倍。页面列出了 20 多款智能体工具,包括 Claude Code 和 ZCode,并继续提供 npx @z_ai/coding-helper 配置命令。

所有 Coding Plan 用户均可使用 GLM-5.3 Flash,其可用额度是完整规格 GLM-5.3 的 3 倍。套餐选择因此更直接:如果每周工作量不超过 10,000 credits,就先从 Lite 开始,需要更多容量时再升级。若要比较这套套餐与前沿模型订阅,Claude Code 价格指南更有参考价值。只有当完整规格 GLM-5.3 更强的编程能力值得消耗更多额度时,才应在套餐中选择它。

GLM-5.2 免费吗?

在 MIT 许可证下,权重可免费下载和使用。Hugging Face 托管了 GLM-5.2 权重,Z.ai 也列出了支持的本地推理框架。GLM-5.3 Flash同样如此。

但算力并不免费。GLM-5.2 有 7530 亿参数,Flash 的总参数为 3200 亿;无论自托管哪一款,都需要真正的基础设施,不是用笔记本电脑就能走的捷径。托管版 GLM-5.2 的价格是每百万输入 token $1.40、每百万输出 token $4.40;Flash 标准价为 $0.15 和 $0.50,另有上文提到的 Z.ai 临时折扣。

Cloudflare AI Search 还有一层区别。公开测试期间,AI Search 在已公布的限额内免费:Workers Free 每月包含 20,000 次查询、每天可抓取 500 个页面,但 Workers AI 生成和 AI Gateway 使用量另行计费。搜索层免费,不等于生成 token 免费。

GLM-5.2、GPT 和 Claude:谁更适合编程?

如今,有意义的问题已不是 GLM-5.2 能否偶尔接近 GPT 或 Claude,而是:开放权重、可预测的 token 成本和原生多模态输入,是否值得你接受一个更年轻的生态。GLM-5.3 Flash 让这三方面的优势都更有说服力。

决策因素GLM-5.2GLM-5.3 Flash
Cloudflare 输入 / 1M$1.40$0.15
Cloudflare 输出 / 1M$4.40$0.50
Cloudflare 上下文262,1441,048,576
原生输入文本文本、图像、视频、文件
许可证MITMIT

与 GPT 和 Claude 相比,GLM 家族最明确的优势是控制权和成本。权重可以自托管,而 Flash 能显著降低持续输出的费用。如果用户想要的是一个能同时处理写作、分析和编程的成熟助手,而非针对特定工作负载选模型,那么闭源前沿模型的选择逻辑依然更简单。

只看编程,也不要把 6 月的 FrontierSWE 结果解读成普遍结论。GLM-5.2 在一项历史基准中只落后 Opus 4.8 约 1 分,从来不等于它在所有场景下能力相当。Flash 改善了成本与能力组合,完整规格 GLM-5.3 则以与 GLM-5.2 相同的 API 价格主攻最困难的编程任务。更换生产工作流前若想获得更全面的比较,前沿编程模型指南仍是更好的起点。Kimi K3 评测则介绍了另一款开放权重替代方案,其成本与性能取舍有所不同。

谁适合继续用 GLM-5.2,谁应该跳过?

如果现有自托管技术栈运行稳定、评测必须保持可复现,或依赖项已固定到 GLM-5.2 的行为,就继续使用它。新版本发布,并不会让一套正常工作的部署突然变错。

新的大批量智能体任务、视觉编程、文档处理或 Cloudflare AI Search 生成任务,应该选择 GLM-5.3 Flash。它的 token 标价接近 GLM-5.2 的九分之一,支持视觉和文件输入,并在 Cloudflare 上提供更大的上下文窗口。如果复杂编程能力比吞吐量更重要,则选择完整规格 GLM-5.3;它的 API 价格与 GLM-5.2 不变,因此几乎没有理由以同样费率启动新的付费 GLM-5.2 编程工作负载。

如果任务量很小,模型成本可以忽略;或者更换模型所增加的验证工作超过每月节省的费用,那就不必迁移。厂商基准不能取代来自你自己代码仓库的代表性任务。

下一步很明确:先用 GLM-5.3 Flash 跑一个真实的代码仓库任务,记录输出 token、耗时以及必须修正的内容,再用完整规格 GLM-5.3 重复一次。如果 Flash 达到你的质量标准,就把它设为日常默认,将完整模型留给需要升级处理的任务。若使用 Cloudflare AI Search,则选择 @cf/zai-org/glm-5.3-flash 作为生成模型,首次对比时保持检索部分不变。

GLM-5.2 是中国模型吗?

是。Z.ai 的公司历史显示,ZhipuAI 于 2019 年基于 Tsinghua University 的技术创立。GLM-5.2 和 GLM-5.3 Flash 的权重都采用 MIT 许可证,因此,对数据存储位置有严格要求的团队可以评估自托管,无需将提示词发送到托管端点。

GLM-5.2 免费吗?

采用 MIT 许可证的权重可免费下载和使用。托管推理则需要付费:当前价格显示,GLM-5.2 每百万 token 的输入费用为 $1.40,输出费用为 $4.40。硬件和运维也意味着自托管会产生实际成本。

GLM-5.2 编程能力比 GPT 更强吗?

不能一概而论。Z.ai 在 6 月发布的数据表明,GLM-5.2 在部分长周期编程基准上接近顶级闭源模型;但在 Z.ai 后续公布的编程评测中,GLM-5.3 和 GLM-5.3 Flash 已经超越它。GLM-5.2 目前最有力的卖点是开放权重和兼容性,而不是最新的性能领先地位。

GLM-5.2 能与 Claude Code 搭配使用吗?

可以。GLM Coding Plan支持 Claude Code 和 20 多款智能体工具。所有套餐用户现在都能使用 GLM-5.3 Flash,而且其可用额度是完整规格 GLM-5.3 的 3 倍,因此更适合作为日常任务的首选测试模型。

是否应该把 GLM-5.2 放进现有技术栈,通常取决于编程智能体的连接方式。我把如何在不破坏工作流的前提下,将智能体切换到更便宜模型的操作步骤整理成了一份免费的 Claude Code 与 Codex 配置清单。订阅 newsletter即可领取,并获取每周值得切换模型的精选解读。

最近更新
2026年9月3日
分类
AI

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

GPT-6 Sol 对比 Luna:先用 Luna,难题再上 Sol

GPT-6 Sol 对比 Luna:先用 Luna,难题再上 Sol

GPT-6 Sol 对比 Luna:完整拆解两者20×的 token 价差、共同的上下文窗口与工具能力,以及 OpenAI 公布的编程成绩;同时给出从 Luna 起步、何时升级到 Sol 的可验证决策规则,帮助技术团队结合任务难度、验收率、复核时间与失败成本,选出总成本更低、真正适合生产环境的模型。2026年9月23日AI
GPT-6 Luna 免费吗?桌面端、Codex 与 API 费用全解析

GPT-6 Luna 免费吗?桌面端、Codex 与 API 费用全解析

GPT-6 Luna 免费吗?本文拆清 Free 与 Go 桌面端免费权限、普通 Chat 与 Codex 的开放范围、API 每百万 token 的实际价格,以及 OpenAI 尚未公布的使用限额,帮助开发者和团队判断该试用、升级套餐还是单独开通 API 计费,避免把免费试用误当成不限量权益。2026年9月22日AI
MiMo V2.6 教程:从 Studio 验证到 API 上线

MiMo V2.6 教程:从 Studio 验证到 API 上线

MiMo V2.6 教程:从 AI Studio 验证任务,到选择按量付费或 Token Plan 密钥、配置 OpenAI 兼容 API,再到比较 Flash、Pro 与 UltraSpeed。附 Python 请求、价格测算、七个业务工作流和按顺序排错的方法,帮助团队在接入真实数据前完成安全评估。2026年9月22日AI
MiMo V2.6 Pro 对比 Flash:价格、性能与部署选择

MiMo V2.6 Pro 对比 Flash:价格、性能与部署选择

MiMo V2.6 Pro 对比 Flash 怎么选?本文对照实时 API 价格、编程与智能体基准、缓存成本和 UltraSpeed,并给出三任务验收框架,帮助创业者、CTO 和技术负责人按单次验收通过成本决定何时用 Flash、何时升级 Pro,避免为缺乏实测价值的质量与速度溢价买单。2026年9月22日AI
MiMo V2.6 免费吗?限免入口、API 价格与 MIT 权重详解

MiMo V2.6 免费吗?限免入口、API 价格与 MIT 权重详解

MiMo V2.6 免费吗?本文拆解 OpenCode 一周限免、Xiaomi API 的 Flash、Pro 与 UltraSpeed 价格、标注 MIT 的模型权重实际成本和免费通道的数据使用风险,并用标准化工作负载算清不同方案的付费差距,帮助开发者判断何时试用、何时转向付费 API,以及自托管是否值得。2026年9月22日AI
Grok 4.7 对比 Grok 4.6:谁更强,是否值得升级?

Grok 4.7 对比 Grok 4.6:谁更强,是否值得升级?

Grok 4.7 对比 Grok 4.6:两者标准 API 价格相同,真正差别在复杂编程、知识工作和迁移风险。本文拆解 xAI 基准、上下文窗口、推理档位与长上下文成本,并给出三项任务的同条件测试方法,帮助团队判断哪些工作负载值得升级、哪些应继续留在稳定的 Grok 4.6 流程,避免只看发布分数做决定。2026年9月21日AI
AI Agent 如何钻规则空子:一场生产事故的完整复盘

AI Agent 如何钻规则空子:一场生产事故的完整复盘

一个自动化编辑系统通过了全部检查,却在 8 天内把 50 篇文章带向几乎无人需要的手工图样软件。本文基于发布台账、研究账单和 Google Search Console 记录,复盘 AI Agent 如何把代理指标误当目标,并拆解无产出许可、范围围栏、主题上限与人工审批如何阻止系统持续跑偏。2026年9月21日AI
Step 5 Preview 价格详解:API 与 Step Plan 怎么选

Step 5 Preview 价格详解:API 与 Step Plan 怎么选

Step 5 Preview 价格怎么计算?本文拆解标准 API 的输入、缓存与输出费率,对比 Step Plan 四档订阅、Credits 有效期、Base URL 计费路径,以及 100 次调用的成本测算,帮你识别扣错账户的风险,并按真实工作负载在订阅与按量付费之间做出更稳妥的选择。2026年9月21日AI
订阅通讯

每周日,一封信。写运转中的系统,不写热评。

每周一期。无垃圾邮件。随时退订。