Grok 4.5 评测:$2/$6 Agent 模型赢在成本,并非编程榜首
Grok 4.5 评测:每百万输入与输出 Token 分别为 $2 和 $6,适合看重 Agent 成本与 Token 效率的长任务,但编程基准并未登顶。本文对比 Cursor 价格与 SpaceXAI 基准,拆解 200K 上下文价格翻倍、缓存、工具调用和重试成本,并给出稳妥的选型与评估方法。

这篇 Grok 4.5 评测的核心很明确:每百万输入 Token $2、输出 Token $6,但它并不是新的编程王者。如果 Agent 成本和 Token 效率比每项基准都夺冠更重要,而且 Prompt 能始终控制在 200K 的价格分界线以内,Grok 4.5 才是值得采用的模型。
Grok 4.5 评测结论:一张表看懂
在价格最低的编程模型与基准测试领先者之间,Grok 4.5 是更注重性价比的选择。它比 Cursor 的 Composer 2.5 贵,在 SpaceXAI 自家工程基准图表的大多数项目中又落后于 Claude Fable 5;但对长时间运行的 Agent 来说,它依然很有吸引力,因为在 Cursor 内,输出价格是 $6,而 Fable 为 $50。

最直观的对比来自 Cursor 当前的计费页面,因为第一方模型和其他前沿模型都使用同一套计量口径。下表价格均按每百万 Token 计算。
按每月 10 million 个全新输入 Token 和 2 million 个输出 Token 计算,账单很清楚:Grok 4.5 为 $32,Composer 2.5 为 $10,Claude Fable 5 为 $200,GPT-5.6 Sol 为 $110。此外,Cursor 会向 Teams 和 Enterprise 套餐中的第三方模型收取每百万 Token $0.25 的费用,第一方 Grok 与 Composer 模型则免收这笔费用。
因此,Grok 4.5 在 Cursor 中的定位一目了然:它既不是最便宜的,也不是得分最高的,而是两者之间的缓冲选择。

结论就是这样。接下来要验证的,是你的工作负载是否真的落在适合它的那一侧。
Grok 4.5 是什么,又能在哪里运行?
Grok 4.5 是面向编程、Agent 任务和知识工作的推理模型,不只是聊天产品里新增的一个预设。Cursor 与 SpaceXAI 将其描述为双方联合训练的混合专家模型;也就是说,每个 Token 只会激活一组经过选择的专用模型组件,而不是每一步都调用整张网络。
这次发布分为两个阶段:Cursor 于 7 月 8 日发布 Grok 4.5,随后 SpaceXAI 于 7 月 16 日完整发布。Cursor 表示,训练数据既包含数万亿 Token 的开发者与 Agent 交互数据,也包含 STEM 任务、研究论文和更广泛的知识工作。
当前模型 ID 是 grok-4.5。它接受文本和图像输入、输出文本,上下文窗口为 500,000 Token;推理强度支持低、中、高三档,默认使用高档。原生工具包括函数调用、网页搜索、X 搜索和代码执行,可通过 Responses API 或 Chat Completions 使用。
对一个新模型来说,它的分发范围格外广。Grok 4.5 可通过 SpaceXAI API 使用,是 Grok Build 的默认模型,也已覆盖 Cursor 的所有套餐;它还能驱动 Word、PowerPoint 和 Excel 加载项,并已上线 OpenRouter、Vercel、Cloudflare、Snowflake 和 Databricks Mosaic。在 Cursor 内,它覆盖桌面端、网页端、iOS、CLI 和 SDK。
广泛的覆盖降低了采用门槛,却不能让人忽略模型与承载它的产品之间的区别。直接通过 API 使用 Grok 4.5,与在 Cursor 内使用时的缓存价格不同;Grok Build 则在模型之上增加了 Agent 循环。此前 Grok Build 的经济账 主要受固定订阅门槛支配。Grok 4.5 改变了讨论重点,因为模型与 Agent 如今都有了更清晰的按量计费路径。
Grok 4.5 基准测试:体现性价比,而非绝对领先
在 SpaceXAI 展示的五项工程基准中,Grok 4.5 赢下一项,在另一项中几乎追平领先者,其余三项均落后于 Claude Fable 5。若把它称为新的编程冠军,就等于无视厂商自己的数据。
SpaceXAI 的发布图表称,竞品数据来自各厂商的系统卡或基准排行榜。因此,这张表适合判断方向,却不能替代针对具体工作负载的评估。执行环境、推理设置、重试次数和 Token 预算,都可能让编程得分发生足以改变采购决策的变化。
差距都有明确数字:在 DeepSWE 1.0 上,Grok 落后 Fable 5 4.1 个百分点;DeepSWE 1.1 落后 17 个百分点;Terminal Bench 2.1 落后 1 个百分点;SWE Bench Pro 落后 15.7 个百分点。它真正明确取胜的是 SWE Marathon:29.0%,高于 Opus 4.8 的 26.0% 和 Fable 5 的 24.0%。
效率方面的主张更有说服力。SpaceXAI 报告称,Grok 在每个 SWE Bench Pro 任务中平均输出 15,954 个 Token,而 Opus 4.8 max 为 67,020 个,两者相差约 4.2 倍。这仍是厂商发布的数据,但它指向了正确的经济核算单位:完成一个任务,而不是单个 Token 的标价。
独立测量让结论更踏实。Artificial Analysis 给 Grok 4.5 的高档评分是 54,GPT-5.5 xhigh 则为 55。按缓存、输入、输出 7:2:1 混合计算,Grok 每百万 Token 的价格是 $1.35,GPT-5.5 为 $4.35。同一组实时对比测得,Grok 每秒大约输出 70 个 Token,GPT-5.5 约为 76 个。
SpaceXAI 宣传的速度是每秒输出 80 个 Token,独立结果约为 70。这个差距不代表失败,却提醒我们:实际服务速度会波动,发布时公布的吞吐量并不是服务等级保证。
基准结论很直接:Grok 4.5 的性能足够接近前沿水平,因此具有经济吸引力;但它还没有强到可以让价格表取代质量门槛。
Grok 4.5 价格背后的真实成本
只有当上下文低于 200,000 Token 时,Grok 4.5 的 $2/$6 标价才成立。一旦跨过这条线,SpaceXAI 会把整次请求的全新输入、缓存输入和输出费率全部翻倍。
这个区别很重要,因为 500,000 Token 上下文窗口只代表容量大,不代表容量便宜。一次请求带入 250K 个输入 Token,并生成 50K 个输出 Token,按长上下文费率要花 $1.60;若按短上下文费率计算,同样的 Token 数量只需 $0.80。在网页搜索、代码执行或重试费用加入之前,这道门槛就已经让 Token 账单翻倍。

缓存则可能把成本往下拉。包含 10 million 个全新输入 Token 和 2 million 个输出 Token 的工作负载,成本为 $32。如果其中一半输入命中直连 API 缓存,账单会降至 $23.50,节省 $8.50,约合 26.6%。
这笔节省不会自动出现。SpaceXAI 建议在 Responses API 中设置 prompt_cache_key,使用 Chat Completions 时则设置 x-grok-conv-id,以便把同一会话路由到同一台服务器。否则,未预热缓存的服务器可能让原本预期命中的缓存重新按全价输入计费。
工具使用还有第二套计费。网页搜索、X 搜索和代码执行均为每 1,000 次调用 $5。一次运行若调用这类工具 25 次,仅工具费就会增加 $0.125,尚未计入调用背后的模型 Token。附件搜索为每 1,000 次 $10,集合搜索则为每 1,000 次 $2.50。
上生产后,Grok 4.5 最容易在哪些地方出问题?
生产中的第一个故障不是模型能力,而是悄无声息的重新计价。仓库规模的 Prompt 一点点超过 200K 后,整次请求的每个 Token 都会进入长上下文费率,以 $2/$6 标价建立的成本模型会立刻失效。
第二个问题是对缓存过于乐观。连续的 Agent 轮次看起来很适合缓存,但只有当路由能让此前的前缀被复用时,才能拿到直连 API 的 $0.30 缓存输入费率。SpaceXAI 明确建议设置缓存键,这项设计应从第一次请求起就纳入计费架构。
第三个问题是上下文不断累积。长时间运行的 Agent 会反复读取计划、工具输出、Diff、测试和早先的解释。500,000 Token 窗口只能推迟失败,并不代表带着每一轮旧内容都是明智的。SpaceXAI 建议在长循环中压缩上下文,也就是在 Agent 跨过价格门槛或被自己的历史记录分散注意力之前,用更小的工作状态替换过时细节。
第四个问题是把厂商基准当作发布门槛。Grok 4.5 展示的结果跨度很大:SWE Marathon 排名第一,DeepSWE 1.1 却落后 Fable 5 17 个百分点。生产质量最终取决于你的代码仓库、执行器、测试覆盖率、工具权限和成功标准。
第五个问题是渠道可用性。Cursor 当前的 Grok 4.5 页面显示,该模型暂时无法通过 Cursor 在欧盟使用。这是 Cursor 的限制,并不能证明 SpaceXAI 的每一种接入路径都被封锁;但对欧盟团队而言,已经足以让他们无法在现阶段围绕它规划 Cursor 迁移。
哪些人适合用 Grok 4.5,哪些人应该跳过?
如果 Agent 循环注重成本、能保持在 200K 以下,并且可以验证自己的工作,Grok 4.5 很合适。如果最高的编程通过率值得支付溢价、Composer 2.5 已经够用,或者 Cursor 用户位于欧盟,则应该跳过它。

- 输入 $2、输出 $6 的定价,使接近前沿水平的 Agent 工作在 Cursor 中明显便宜于 Fable 5 或 GPT-5.6 Sol。
- 500,000 Token 的上下文窗口,足以容纳规模可观的代码仓库和较长的任务历史。
- 函数调用、网页搜索、X 搜索、代码执行、结构化输出和两种标准 API 接口,可以减少集成工作。
- 厂商数据表明,Grok 确实赢下 SWE Marathon,而且在 SWE Bench Pro 上的输出 Token 用量远低于 Opus 4.8 max。
- 在 SpaceXAI 自家的图表中,Grok 4.5 未能领先五项工程基准中的四项。
- 一旦请求上下文达到 200K,直连 API 中每个 Token 的费率都会翻倍。
- 要稳定节省缓存费用,必须严格管理路由。
- 独立测得的速度低于厂商宣称的每秒 80 个 Token,Cursor 还披露了一项已排除基准存在数据污染。
一套稳妥的 Grok 4.5 评估方案
正确的采用测试,应在统一质量门槛下比较已完成的工作,而不是比较孤立的 Prompt。不同模型必须使用相同的任务集、Agent 执行器、工具权限和验收检查。
冻结一组有代表性的任务
从真正准备交给模型的工作中选择任务:一个带测试的 Bug 修复、一次覆盖整个仓库的改动、一项需要调用工具的研究任务;如果文档或电子表格交付很重要,也应包含在内。在任何模型看到任务前,先定义通过与失败。
统一推理强度和上下文
每次 Grok 运行都使用相同的推理设置,记录准确的 Prompt 大小,并把低于 200K 的任务与长上下文任务分开。不要让某个模型看到更多文件,或获得不同的工具预算。
让缓存效果可衡量
重复会话应设置
prompt_cache_key或x-grok-conv-id。分别记录全新输入和缓存输入,确保成本对比反映的是可以复现的账单。以完成任务的经济性作为门槛
记录通过率、人工修正、重试、Token 总量、工具调用和耗时。只有当 Grok 在不降低发布标准的前提下,让每个验收通过结果的成本低于现有模型时,才应该采用。
对获得融资的创始人而言,这道门槛可能是开发者审查时间;对中型企业 CTO,可能是逃逸缺陷与可审计性;对资深业务负责人,可能是 Excel 或研究交付能否通过事实核验;对独立技术开发者,往往是更低的费用能否换来更多完成的工作,同时又不会平白增加一份审核 Agent 的工作。
常见问题
Grok 4.5 好用吗?
如果需要以更低 Token 成本获得较强的 Agent 能力,答案是肯定的。但若目标是最高的编程准确率,它并不是最稳妥的默认选择:SpaceXAI 展示的五项工程基准中,Fable 5 领先四项,而 Grok 最明确的优势是低成本的长周期工作。
Grok 4.5 价格是多少?
上下文低于 200K 时,SpaceXAI 直连 API 每百万全新输入 Token 收费 $2、缓存输入 Token 收费 $0.30、输出 Token 收费 $6。达到或超过 200K 后,整次请求的费率分别变为 $4、$0.60 和 $12。Cursor 在第一方模型池中列出的价格是输入 $2、缓存读取 $0.50、输出 $6。
Grok 4.5 可以在哪里使用?
SpaceXAI 文档列出的接入渠道包括其 API、Grok Build、Cursor、Word、PowerPoint、Excel、OpenRouter、Vercel、Cloudflare、Snowflake 和 Databricks Mosaic。Cursor 的桌面端、网页端、iOS、CLI 和 SDK 均支持该模型,但目前将其标为欧盟不可用。
想要 Claude Code + Codex 配置清单?订阅 Newsletter 即可获取。
2026年9月3日







