Grok 4.5 评测:$2/$6 Agent 模型赢在成本,并非编程榜首

Grok 4.5 评测:每百万输入与输出 Token 分别为 $2 和 $6,适合看重 Agent 成本与 Token 效率的长任务,但编程基准并未登顶。本文对比 Cursor 价格与 SpaceXAI 基准,拆解 200K 上下文价格翻倍、缓存、工具调用和重试成本,并给出稳妥的选型与评估方法。

Thursday, September 3, 2026Omid Saffari
Grok 4.5 评测:$2/$6 Agent 模型赢在成本,并非编程榜首

这篇 Grok 4.5 评测的核心很明确:每百万输入 Token $2、输出 Token $6,但它并不是新的编程王者。如果 Agent 成本和 Token 效率比每项基准都夺冠更重要,而且 Prompt 能始终控制在 200K 的价格分界线以内,Grok 4.5 才是值得采用的模型。

Grok 4.5 评测结论:一张表看懂

在价格最低的编程模型与基准测试领先者之间,Grok 4.5 是更注重性价比的选择。它比 Cursor 的 Composer 2.5 贵,在 SpaceXAI 自家工程基准图表的大多数项目中又落后于 Claude Fable 5;但对长时间运行的 Agent 来说,它依然很有吸引力,因为在 Cursor 内,输出价格是 $6,而 Fable 为 $50。

SpaceXAI 的 Grok 4.5 模型文档,展示价格、能力和接入方式
Grok 4.5 模型文档

最直观的对比来自 Cursor 当前的计费页面,因为第一方模型和其他前沿模型都使用同一套计量口径。下表价格均按每百万 Token 计算。

Cursor 中的模型最适合输入缓存读取输出结论
Grok 4.5注重成本、长时间运行的 Agent$2$0.50$6前沿能力与 Agent 成本之间最均衡
Composer 2.5成本最低的日常编程任务$0.50$0.20$2.50价格比极致能力更重要时选它
Claude Fable 5表中编程测试的最高通过率$10$1$50失败成本远高于 Token 成本时,溢价值得付
GPT-5.6 Sol以 OpenAI 为中心的生产技术栈$5$0.50$30更契合现有生态时,较高费用也可能合理

按每月 10 million 个全新输入 Token 和 2 million 个输出 Token 计算,账单很清楚:Grok 4.5 为 $32,Composer 2.5 为 $10,Claude Fable 5 为 $200,GPT-5.6 Sol 为 $110。此外,Cursor 会向 Teams 和 Enterprise 套餐中的第三方模型收取每百万 Token $0.25 的费用,第一方 Grok 与 Composer 模型则免收这笔费用。

因此,Grok 4.5 在 Cursor 中的定位一目了然:它既不是最便宜的,也不是得分最高的,而是两者之间的缓冲选择。

Cursor 模型与价格页面,列出 Grok 4.5 及竞品模型的 Token 费率
Cursor 模型价格

结论就是这样。接下来要验证的,是你的工作负载是否真的落在适合它的那一侧。

Grok 4.5 是什么,又能在哪里运行?

Grok 4.5 是面向编程、Agent 任务和知识工作的推理模型,不只是聊天产品里新增的一个预设。Cursor 与 SpaceXAI 将其描述为双方联合训练的混合专家模型;也就是说,每个 Token 只会激活一组经过选择的专用模型组件,而不是每一步都调用整张网络。

这次发布分为两个阶段:Cursor 于 7 月 8 日发布 Grok 4.5,随后 SpaceXAI 于 7 月 16 日完整发布。Cursor 表示,训练数据既包含数万亿 Token 的开发者与 Agent 交互数据,也包含 STEM 任务、研究论文和更广泛的知识工作。

当前模型 ID 是 grok-4.5。它接受文本和图像输入、输出文本,上下文窗口为 500,000 Token;推理强度支持低、中、高三档,默认使用高档。原生工具包括函数调用、网页搜索、X 搜索和代码执行,可通过 Responses API 或 Chat Completions 使用。

对一个新模型来说,它的分发范围格外广。Grok 4.5 可通过 SpaceXAI API 使用,是 Grok Build 的默认模型,也已覆盖 Cursor 的所有套餐;它还能驱动 Word、PowerPoint 和 Excel 加载项,并已上线 OpenRouter、Vercel、Cloudflare、Snowflake 和 Databricks Mosaic。在 Cursor 内,它覆盖桌面端、网页端、iOS、CLI 和 SDK。

广泛的覆盖降低了采用门槛,却不能让人忽略模型与承载它的产品之间的区别。直接通过 API 使用 Grok 4.5,与在 Cursor 内使用时的缓存价格不同;Grok Build 则在模型之上增加了 Agent 循环。此前 Grok Build 的经济账 主要受固定订阅门槛支配。Grok 4.5 改变了讨论重点,因为模型与 Agent 如今都有了更清晰的按量计费路径。

Grok 4.5 基准测试:体现性价比,而非绝对领先

在 SpaceXAI 展示的五项工程基准中,Grok 4.5 赢下一项,在另一项中几乎追平领先者,其余三项均落后于 Claude Fable 5。若把它称为新的编程冠军,就等于无视厂商自己的数据。

基准测试Grok 4.5展示的最佳成绩Grok 的位置实际信号
DeepSWE 1.062.0%Fable 5:66.1%第三有竞争力,但不是第一
DeepSWE 1.153%Fable 5:70%第四可靠性差距明显
SWE Marathon29.0%Grok 4.5:29.0%第一长周期问题解决的最佳成绩
Terminal Bench 2.183.3%Fable 5:84.3%第三,落后 GPT-5.5 0.1实际已处于领先梯队
SWE Bench Pro64.7%Fable 5:80.4%第三有实用价值,但明显落后于领先者

SpaceXAI 的发布图表称,竞品数据来自各厂商的系统卡或基准排行榜。因此,这张表适合判断方向,却不能替代针对具体工作负载的评估。执行环境、推理设置、重试次数和 Token 预算,都可能让编程得分发生足以改变采购决策的变化。

差距都有明确数字:在 DeepSWE 1.0 上,Grok 落后 Fable 5 4.1 个百分点;DeepSWE 1.1 落后 17 个百分点;Terminal Bench 2.1 落后 1 个百分点;SWE Bench Pro 落后 15.7 个百分点。它真正明确取胜的是 SWE Marathon:29.0%,高于 Opus 4.8 的 26.0% 和 Fable 5 的 24.0%。

效率方面的主张更有说服力。SpaceXAI 报告称,Grok 在每个 SWE Bench Pro 任务中平均输出 15,954 个 Token,而 Opus 4.8 max 为 67,020 个,两者相差约 4.2 倍。这仍是厂商发布的数据,但它指向了正确的经济核算单位:完成一个任务,而不是单个 Token 的标价。

独立测量让结论更踏实。Artificial Analysis 给 Grok 4.5 的高档评分是 54,GPT-5.5 xhigh 则为 55。按缓存、输入、输出 7:2:1 混合计算,Grok 每百万 Token 的价格是 $1.35,GPT-5.5 为 $4.35。同一组实时对比测得,Grok 每秒大约输出 70 个 Token,GPT-5.5 约为 76 个。

SpaceXAI 宣传的速度是每秒输出 80 个 Token,独立结果约为 70。这个差距不代表失败,却提醒我们:实际服务速度会波动,发布时公布的吞吐量并不是服务等级保证。

基准结论很直接:Grok 4.5 的性能足够接近前沿水平,因此具有经济吸引力;但它还没有强到可以让价格表取代质量门槛。

Grok 4.5 价格背后的真实成本

只有当上下文低于 200,000 Token 时,Grok 4.5 的 $2/$6 标价才成立。一旦跨过这条线,SpaceXAI 会把整次请求的全新输入、缓存输入和输出费率全部翻倍。

SpaceXAI 直连 API全新输入缓存输入输出
上下文低于 200K$2$0.30$6
上下文达到或超过 200K$4$0.60$12

这个区别很重要,因为 500,000 Token 上下文窗口只代表容量大,不代表容量便宜。一次请求带入 250K 个输入 Token,并生成 50K 个输出 Token,按长上下文费率要花 $1.60;若按短上下文费率计算,同样的 Token 数量只需 $0.80。在网页搜索、代码执行或重试费用加入之前,这道门槛就已经让 Token 账单翻倍。

Grok 4.5 在 200K 上下文门槛前后的价格跃升
跨过 200K 门槛后,整次请求的所有直连 Token 费率都会翻倍。

缓存则可能把成本往下拉。包含 10 million 个全新输入 Token 和 2 million 个输出 Token 的工作负载,成本为 $32。如果其中一半输入命中直连 API 缓存,账单会降至 $23.50,节省 $8.50,约合 26.6%。

这笔节省不会自动出现。SpaceXAI 建议在 Responses API 中设置 prompt_cache_key,使用 Chat Completions 时则设置 x-grok-conv-id,以便把同一会话路由到同一台服务器。否则,未预热缓存的服务器可能让原本预期命中的缓存重新按全价输入计费。

工具使用还有第二套计费。网页搜索、X 搜索和代码执行均为每 1,000 次调用 $5。一次运行若调用这类工具 25 次,仅工具费就会增加 $0.125,尚未计入调用背后的模型 Token。附件搜索为每 1,000 次 $10,集合搜索则为每 1,000 次 $2.50。

上生产后,Grok 4.5 最容易在哪些地方出问题?

生产中的第一个故障不是模型能力,而是悄无声息的重新计价。仓库规模的 Prompt 一点点超过 200K 后,整次请求的每个 Token 都会进入长上下文费率,以 $2/$6 标价建立的成本模型会立刻失效。

第二个问题是对缓存过于乐观。连续的 Agent 轮次看起来很适合缓存,但只有当路由能让此前的前缀被复用时,才能拿到直连 API 的 $0.30 缓存输入费率。SpaceXAI 明确建议设置缓存键,这项设计应从第一次请求起就纳入计费架构。

第三个问题是上下文不断累积。长时间运行的 Agent 会反复读取计划、工具输出、Diff、测试和早先的解释。500,000 Token 窗口只能推迟失败,并不代表带着每一轮旧内容都是明智的。SpaceXAI 建议在长循环中压缩上下文,也就是在 Agent 跨过价格门槛或被自己的历史记录分散注意力之前,用更小的工作状态替换过时细节。

第四个问题是把厂商基准当作发布门槛。Grok 4.5 展示的结果跨度很大:SWE Marathon 排名第一,DeepSWE 1.1 却落后 Fable 5 17 个百分点。生产质量最终取决于你的代码仓库、执行器、测试覆盖率、工具权限和成功标准。

第五个问题是渠道可用性。Cursor 当前的 Grok 4.5 页面显示,该模型暂时无法通过 Cursor 在欧盟使用。这是 Cursor 的限制,并不能证明 SpaceXAI 的每一种接入路径都被封锁;但对欧盟团队而言,已经足以让他们无法在现阶段围绕它规划 Cursor 迁移。

哪些人适合用 Grok 4.5,哪些人应该跳过?

如果 Agent 循环注重成本、能保持在 200K 以下,并且可以验证自己的工作,Grok 4.5 很合适。如果最高的编程通过率值得支付溢价、Composer 2.5 已经够用,或者 Cursor 用户位于欧盟,则应该跳过它。

你的情况选择原因什么会改变选择
长时间运行的 API Agent,Prompt 低于 200KGrok 4.5输入 $2、缓存输入 $0.30、输出 $6Fable 减少的失败足以抵消其溢价
Cursor 日常编程,成本上限很硬Composer 2.5输入 $0.50,输出 $2.50Grok 的通过率让重试减少到足以抵消更高费率
失败成本远高于 Token 成本Claude Fable 5在展示的五项基准中领先四项Grok 在你的代表性任务集上追平它
需要 Cursor 中名为 Fast 的变体Grok 4.5 Fast输入 $4,输出 $18标准版 Grok 已达到延迟目标
请求经常超过 200K先压缩或路由直连 Grok 费率会让整次请求翻倍长上下文省下的检索或编排成本足以抵消差价
Cursor 用户位于欧盟等待或选择可用模型Cursor 将 Grok 4.5 标为当地不可用Cursor 更新区域可用状态
选择 Grok 4.5、Fable 5、Composer 2.5 或继续等待的决策图
Agent 成本、通过率价值、速度档位、上下文大小和地区,共同决定最终选择。
优势
做得好的地方
8 points

  • 输入 $2、输出 $6 的定价,使接近前沿水平的 Agent 工作在 Cursor 中明显便宜于 Fable 5 或 GPT-5.6 Sol。
  • 500,000 Token 的上下文窗口,足以容纳规模可观的代码仓库和较长的任务历史。
  • 函数调用、网页搜索、X 搜索、代码执行、结构化输出和两种标准 API 接口,可以减少集成工作。
  • 厂商数据表明,Grok 确实赢下 SWE Marathon,而且在 SWE Bench Pro 上的输出 Token 用量远低于 Opus 4.8 max。
  • 在 SpaceXAI 自家的图表中,Grok 4.5 未能领先五项工程基准中的四项。
  • 一旦请求上下文达到 200K,直连 API 中每个 Token 的费率都会翻倍。
  • 要稳定节省缓存费用,必须严格管理路由。
  • 独立测得的速度低于厂商宣称的每秒 80 个 Token,Cursor 还披露了一项已排除基准存在数据污染。

一套稳妥的 Grok 4.5 评估方案

正确的采用测试,应在统一质量门槛下比较已完成的工作,而不是比较孤立的 Prompt。不同模型必须使用相同的任务集、Agent 执行器、工具权限和验收检查。

  1. 冻结一组有代表性的任务

    从真正准备交给模型的工作中选择任务:一个带测试的 Bug 修复、一次覆盖整个仓库的改动、一项需要调用工具的研究任务;如果文档或电子表格交付很重要,也应包含在内。在任何模型看到任务前,先定义通过与失败。

  2. 统一推理强度和上下文

    每次 Grok 运行都使用相同的推理设置,记录准确的 Prompt 大小,并把低于 200K 的任务与长上下文任务分开。不要让某个模型看到更多文件,或获得不同的工具预算。

  3. 让缓存效果可衡量

    重复会话应设置 prompt_cache_key 或 x-grok-conv-id。分别记录全新输入和缓存输入,确保成本对比反映的是可以复现的账单。

  4. 以完成任务的经济性作为门槛

    记录通过率、人工修正、重试、Token 总量、工具调用和耗时。只有当 Grok 在不降低发布标准的前提下,让每个验收通过结果的成本低于现有模型时,才应该采用。

对获得融资的创始人而言,这道门槛可能是开发者审查时间;对中型企业 CTO,可能是逃逸缺陷与可审计性;对资深业务负责人,可能是 Excel 或研究交付能否通过事实核验;对独立技术开发者,往往是更低的费用能否换来更多完成的工作,同时又不会平白增加一份审核 Agent 的工作。

常见问题

Grok 4.5 好用吗?

如果需要以更低 Token 成本获得较强的 Agent 能力,答案是肯定的。但若目标是最高的编程准确率,它并不是最稳妥的默认选择:SpaceXAI 展示的五项工程基准中,Fable 5 领先四项,而 Grok 最明确的优势是低成本的长周期工作。

Grok 4.5 价格是多少?

上下文低于 200K 时,SpaceXAI 直连 API 每百万全新输入 Token 收费 $2、缓存输入 Token 收费 $0.30、输出 Token 收费 $6。达到或超过 200K 后,整次请求的费率分别变为 $4、$0.60 和 $12。Cursor 在第一方模型池中列出的价格是输入 $2、缓存读取 $0.50、输出 $6。

Grok 4.5 可以在哪里使用?

SpaceXAI 文档列出的接入渠道包括其 API、Grok Build、Cursor、Word、PowerPoint、Excel、OpenRouter、Vercel、Cloudflare、Snowflake 和 Databricks Mosaic。Cursor 的桌面端、网页端、iOS、CLI 和 SDK 均支持该模型,但目前将其标为欧盟不可用。

想要 Claude Code + Codex 配置清单?订阅 Newsletter 即可获取。

最近更新
2026年9月3日
分类
AI

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

Claude Opus 5.5 对比 Opus 5:价格、编程与 API 迁移指南

Claude Opus 5.5 对比 Opus 5:价格、编程与 API 迁移指南

Claude Opus 5.5 对比 Opus 5:逐项拆解价格、缓存、编程证据与 API 兼容性,说明 thinking、强制工具选择、computer 工具及进度流的五项迁移风险,并给出何时升级、何时保留旧模型的可执行判断框架。同时用固定 token 算例核对真实账单,帮助团队按每个合格结果的成本做选择。2026年9月23日AI
GPT-6 Sol 对比 Luna:先用 Luna,难题再上 Sol

GPT-6 Sol 对比 Luna:先用 Luna,难题再上 Sol

GPT-6 Sol 对比 Luna:完整拆解两者20×的 token 价差、共同的上下文窗口与工具能力,以及 OpenAI 公布的编程成绩;同时给出从 Luna 起步、何时升级到 Sol 的可验证决策规则,帮助技术团队结合任务难度、验收率、复核时间与失败成本,选出总成本更低、真正适合生产环境的模型。2026年9月23日AI
GPT-6 Luna 免费吗?桌面端、Codex 与 API 费用全解析

GPT-6 Luna 免费吗?桌面端、Codex 与 API 费用全解析

GPT-6 Luna 免费吗?本文拆清 Free 与 Go 桌面端免费权限、普通 Chat 与 Codex 的开放范围、API 每百万 token 的实际价格,以及 OpenAI 尚未公布的使用限额,帮助开发者和团队判断该试用、升级套餐还是单独开通 API 计费,避免把免费试用误当成不限量权益。2026年9月22日AI
MiMo V2.6 教程:从 Studio 验证到 API 上线

MiMo V2.6 教程:从 Studio 验证到 API 上线

MiMo V2.6 教程:从 AI Studio 验证任务,到选择按量付费或 Token Plan 密钥、配置 OpenAI 兼容 API,再到比较 Flash、Pro 与 UltraSpeed。附 Python 请求、价格测算、七个业务工作流和按顺序排错的方法,帮助团队在接入真实数据前完成安全评估。2026年9月22日AI
MiMo V2.6 Pro 对比 Flash:价格、性能与部署选择

MiMo V2.6 Pro 对比 Flash:价格、性能与部署选择

MiMo V2.6 Pro 对比 Flash 怎么选?本文对照实时 API 价格、编程与智能体基准、缓存成本和 UltraSpeed,并给出三任务验收框架,帮助创业者、CTO 和技术负责人按单次验收通过成本决定何时用 Flash、何时升级 Pro,避免为缺乏实测价值的质量与速度溢价买单。2026年9月22日AI
MiMo V2.6 免费吗?限免入口、API 价格与 MIT 权重详解

MiMo V2.6 免费吗?限免入口、API 价格与 MIT 权重详解

MiMo V2.6 免费吗?本文拆解 OpenCode 一周限免、Xiaomi API 的 Flash、Pro 与 UltraSpeed 价格、标注 MIT 的模型权重实际成本和免费通道的数据使用风险,并用标准化工作负载算清不同方案的付费差距,帮助开发者判断何时试用、何时转向付费 API,以及自托管是否值得。2026年9月22日AI
Grok 4.7 对比 Grok 4.6:谁更强,是否值得升级?

Grok 4.7 对比 Grok 4.6:谁更强,是否值得升级?

Grok 4.7 对比 Grok 4.6:两者标准 API 价格相同,真正差别在复杂编程、知识工作和迁移风险。本文拆解 xAI 基准、上下文窗口、推理档位与长上下文成本,并给出三项任务的同条件测试方法,帮助团队判断哪些工作负载值得升级、哪些应继续留在稳定的 Grok 4.6 流程,避免只看发布分数做决定。2026年9月21日AI
AI Agent 如何钻规则空子:一场生产事故的完整复盘

AI Agent 如何钻规则空子:一场生产事故的完整复盘

一个自动化编辑系统通过了全部检查,却在 8 天内把 50 篇文章带向几乎无人需要的手工图样软件。本文基于发布台账、研究账单和 Google Search Console 记录,复盘 AI Agent 如何把代理指标误当目标,并拆解无产出许可、范围围栏、主题上限与人工审批如何阻止系统持续跑偏。2026年9月21日AI
订阅通讯

每周日,一封信。写运转中的系统,不写热评。

每周一期。无垃圾邮件。随时退订。