Grok 4.7 对比 Grok 4.6:谁更强,是否值得升级?

Grok 4.7 对比 Grok 4.6:两者标准 API 价格相同,真正差别在复杂编程、知识工作和迁移风险。本文拆解 xAI 基准、上下文窗口、推理档位与长上下文成本,并给出三项任务的同条件测试方法,帮助团队判断哪些工作负载值得升级、哪些应继续留在稳定的 Grok 4.6 流程,避免只看发布分数做决定。

Monday, September 21, 2026Omid Saffari
Tools
Grok 4.7 对比 Grok 4.6:谁更强,是否值得升级?

Grok 4.7 对比 Grok 4.6,核心是评估取舍,而不是价格取舍:两者起步价同为每百万输入 token $2、每百万输出 token $6。新的高难度编程和知识工作优先用 Grok 4.7 试跑;已经验证的 Grok 4.6 流程先保留,直到 4.7 在交付结果、耗时和最终账单上胜出。

Grok 4.7 对比 Grok 4.6:该怎么选?

如果 Grok 4.6 会提前停下、漏掉跨文件依赖,或需要反复纠正,选择 Grok 4.7。如果现有 Grok 4.6 生产流程已能在预算内通过检查,就继续保留。新模型值得进入流量测试,但不是所有工作负载都必须迁移的理由。

不同读者的第一步也应有所区别:

  • 资金充足、产品功能卡住的创业者,应先让 Grok 4.7 试做这个功能,因为 xAI 公布的最大提升集中在高难度、长流程任务上。
  • 中型企业 CTO 应保持已经通过验证的 Grok 4.6 自动化不动,只把失败的任务类型送入受控的 4.7 评估。
  • 负责研究、文档或演示材料的资深从业者,应比较最终被接受的交付物,而不是文字看起来是否更精致。
  • 独立技术开发者可以让 4.7 攻克 4.6 未能完成的问题;只有结果通过同一套测试后,再将其升级为正式选择。
决策维度Grok 4.7Grok 4.6胜者
新的高难度编程与知识工作当前旗舰;xAI 报告其长任务成绩更强在 xAI 当前对比中的分数较低Grok 4.7
已验证的生产流程新行为仍需经过回归验证已知基线,无需迁移Grok 4.6
200K 以下的标准 API 费率每 1M token 输入 $2、缓存输入 $0.50、输出 $6每 1M token 输入 $2、缓存输入 $0.50、输出 $6平手
关键隐患xAI 用 4.7 xHigh 对比 4.6 High可能继续在促使你比较模型的高难度工作上失败由你的配对测试决定

这是按工作负载做出的决策。同一家公司完全可以让 4.7 负责代码仓库工作,同时保留 4.6 处理稳定的抽取或分类流程。只有实测收益超过额外的运维复杂度,这套分流才值得。

Grok 4.7 真的更好吗?

就 xAI 在 2026 年九月 21 日公布的高难度编程和专业工作证据而言,是的;但它并不必然适合替换所有 Grok 4.6 部署。现有证据足以支持启动评估,却因两款模型采用了不同的推理档位,无法证明这是普遍适用的升级。

Grok 4.7 编程表现

胜者:Grok 4.7,但需注意这是厂商基准。xAI 同期发布的对比中,采用 xHigh 的 Grok 4.7 在 CursorBench 4.0 上得分 46.3%,采用 High 的 Grok 4.6 为 40.4%,领先 5.9 个百分点。Terminal-Bench 4.0 的成绩分别是 38.0% 和 20.3%,差距为 17.7 个百分点;EEBench 则是 64.0% 对 53.0%,领先 11 个百分点。

这些差距与发布内容重点强调的任务一致:持续的代码仓库作业、终端操作和工程任务。但结果仍由厂商报告,而且 xAI 给 4.7 使用了更深的 xHigh 档位,4.6 则使用 High。增加推理可能提升质量,也会增加推理 token 和延迟。因此,这张图表应被视为测试 4.7 的理由,而不是对生产环境收益的受控估算。

知识工作的趋势也相同。xAI 报告称,在 AA Briefcase v1.1 上,Grok 4.7 与 Grok 4.6 的成绩分别为 1,657 和 1,546;GDPval 上则是 1,695 和 1,605。法律智能体成绩为 19.6% 对 15.8%,HealthBench Professional 为 56.7% 对 48.5%。这些数据全部来自九月 21 日的同一轮对比,因此没有把旧版基准混入这次正面对照。

不要把发布标题理解成速度承诺。页面称 Grok 4.7 的速度是同类模型的两倍,但正文明确写着,标准版 Grok 4.7 的服务速度与 Grok 4.6 相同。输出速度达到 2× 的选项属于单独的 Fast 服务档位,价格也更高。

直截了当地说,4.7 已经证明自己值得接受高难度任务测试,但还没有证明应当盲目进行全系统迁移。

哪些没有变化:访问方式、上下文、工具与推理

Grok 4.7 和 Grok 4.6 提供的集成接口几乎相同,因此大多数迁移风险来自行为差异,而不是基础 API 形态。两者都接受文本和图像输入、返回文本,支持函数调用和结构化输出,并拥有 500,000-token 上下文窗口。

Grok 4.7:当前旗舰模型

Grok 4.7 使用文档中的模型 ID grok-4.7xAI 的实时模型页面将其定位于编程、智能体任务和知识工作;发布信息显示,它可通过公共 API、Cursor、Grok Build、第三方编程工具、模型路由器和云平台使用。

xAI Grok 4.7 模型页面展示上下文、价格、能力与推理设置
Grok 4.7 模型文档

最适合: 4.6 无法完成的高难度编程和知识工作。
价格: 200K 以下,每百万 token 的新输入为 $2、缓存输入为 $0.50、输出为 $6。
明确限制: 不支持 Batch,Fast 版本也无法通过 xAI 公共 API 使用。
不适合: 已经稳定通过的 4.6 流程不存在代价高昂、亟待解决的失败。

它在 Responses API 中还有一个值得检查的集成细节:Grok 4.7 始终返回加密的推理内容,包括服务端工具生成的加密输出。客户端可以忽略该字段;但如果客户端手动维护对话状态,在连续性很重要时,就应原样保留这些推理项。

Grok 4.6:有文档支持的稳定基线

Grok 4.6 仍可通过 grok-4.6 使用。它的当前模型页面仍记录着相同的 500,000-token 窗口、相同的输入与输出模态,以及相同的核心函数调用、结构化输出和推理能力。

xAI Grok 4.6 模型页面展示上下文、价格、能力与推理设置
Grok 4.6 模型文档

最适合: 已经能够通过明确验收门槛的稳定流程。
价格: 200K 以下,每百万 token 的新输入为 $2、缓存输入为 $0.50、输出为 $6。
明确限制: 在 xAI 当前的高难度任务对比中得分较低,继续使用也没有 token 费率折扣。
不适合: 反复出现的未完成工作,其成本已经超过一次受控迁移。

两款模型都支持 lowmediumhighxhigh 推理强度。xAI 的推理文档high 设为默认值,并说明推理无法关闭。共同的 high 档位是配对评估的公平起点。4.7 的 xHigh 运行应放在单独的测试通道中,因为它会同时改变质量、token 和延迟预算。

结论:接口兼容性平手,厂商当前推荐则是 Grok 4.7 胜出。 熟悉的接口降低了迁移难度,但参数兼容并不代表工具选择、输出 schema、停止行为或重试模式也会完全一致。

Grok 4.7 价格:费率相同,单项任务账单未必相同

Grok 4.7 与 Grok 4.6 的公共 API token 费率完全相同;该信息已于 2026 年九月 21 日对照 xAI 实时价格页面核实。提示词低于 200,000 token 时,两者每 1K 新输入 token 的价格均为 $0.002,每 1K 缓存输入 token 为 $0.0005,每 1K 输出 token 为 $0.006。

当提示词达到或超过 200,000 token,请求中的所有 token 都会切换到长上下文计费:每 1K 新输入 token 为 $0.004、每 1K 缓存输入 token 为 $0.001、每 1K 输出 token 为 $0.012。500,000-token 窗口代表容量,并不意味着可以毫无成本意识地携带不断膨胀的智能体历史记录。

固定工作负载Grok 4.7 标准版Grok 4.6 标准版结果
20K 新输入 + 5K 输出$0.07$0.07账单相同
100K 新输入 + 25K 输出$0.35$0.35账单相同
250K 新输入 + 50K 输出$1.60$1.60长上下文账单相同
三项独立的 100K + 25K 任务$1.05$1.05由有效交付决定

表中各行来自精确的 token 算术,并非模型实跑结果。它们把计价因素单独固定下来,让模型行为决定比较结果。

实体成本图表显示 Grok 4.6 与 Grok 4.7 标准版账单相同,而 Grok 4.7 Fast 账单更高
100K 输入、25K 输出的任务在两款标准模型上均为 $0.35,在 Grok 4.7 Fast 上则为 $0.70。

这两款模型之间不存在 token 费率的交叉点,真正的分界线是完成的工作量:

cost per accepted task = total billed cost across all attempts / accepted tasks

如果两款模型每次尝试消耗的计费 token 相同,那么只要 4.7 提高任务通过率,其单位已完成任务成本就会更低。如果 4.7 因推理更久而花费更多,它提升任务通过率的比例就必须高于成本增幅。标价相同,并不能抵消额外推理、重试、工具循环或冗长输出带来的费用。

Fast 与优先处理选项需要单独设置预算:

  • Grok 4.7 Fast 在提示词低于 200,000 token 时,每百万 token 的输入价格为 $4、缓存输入为 $1、输出为 $12。因此,100K 输入、25K 输出的示例成本为 $0.70。
  • Grok 4.7 Fast 只能通过 Cursor 和 Grok Build 使用,无法通过 xAI 公共 API 使用;Grok Build 免费档位也不包含该服务。
  • 提示词超过 200,000 token 时,xAI 的 Fast 详细价目表列出的每百万 token 价格为:输入 $6、缓存输入 $1.50、输出 $18。应采用这份公开费率,而不是一概套用固定倍数。
  • 当响应确认使用优先服务档位时,公共 API 的 Priority Processing 会收取 2× 溢价。

两款模型目前都不支持 Batch API。推理 token 会计入用量,公共 API 工具还会产生另一项计费。Web Search 和 Code Execution 的价格均为每 1,000 次调用 $5。因此,评估日志需要记录响应中的用量和工具费用,不能只根据提示词长度估算。

此前的 Grok 4.5 评测解释了为什么 200K 门槛在长智能体循环中至关重要。同样的原则也适用于这里:及时压缩过时的历史记录,避免请求的 token 费率在不知不觉中翻倍。

胜者:只有有效交付率提高时,才是 Grok 4.7。 如果两款模型的通过率相同,Grok 4.6 因无需迁移而胜出。如果 4.7 能解决那些原本需要重试或人工修复的失败,它相同的 token 费率就会转化为经济优势。

切换成本来自运维,而不是合同

Grok 4.6 在稳定性这一项胜出,因为维持现状无需任何配置成本。Grok 4.7 则必须用收益覆盖行为验证、可观测性更新和安全回滚路径的投入。

更改模型 ID 前,请保留以下控制条件:

  • 完全相同的提示词、系统策略、工具 schema、代码仓库快照、超时与重试策略。
  • Schema 验证器、测试、lint、构建命令,以及所有人工验收清单。
  • 每次尝试的新输入、缓存输入、推理、输出、工具调用和耗时记录,并分别统计。
  • 重试或回滚前已经完成的副作用记录。重放一个只完成了部分步骤的任务,可能造成重复操作。
  • 将旧模型 ID 保存在配置中,而不是埋进代码,以便单项工作负载无需回滚其他改动就能返回 4.6。

提示词兼容不等于行为兼容。结构化输出的 schema 可能仍能解析,却缺失必填字段;编程智能体可能调用同样的工具,却在测试之前停下;研究智能体也可能通过跳过验证来更快结束。即使 HTTP 请求成功,这些仍然属于回归问题。

Grok 4.7 的主要局限是证据无法直接迁移:xAI 的图表和一次浏览器重建,并不能说明它在你的代码仓库中会如何表现。Grok 4.6 的局限则正好相反:已知的稳定性无法解决它反复失败的那类任务。合理的分工,是保留已知基线,把更难的任务队列交给候选模型。

升级 Grok 4.6 前,先完成这项三任务测试

在候选模型获得生产流量前,应先让它在同一代码仓库的干净副本中通过三项小任务。这是小型工作流检查,不是通用基准。两款模型都使用 high 推理强度,其他控制条件保持完全一致;任何 4.7 xHigh 运行都应视为独立实验。

  1. 固定三项验收测试

    从同一代码仓库中选择一个曾经修复的 bug、一项小型跨文件功能和一次依赖迁移。在两款模型看到任务前先定义成功标准:目标回归测试通过、完整测试套件保持绿色、lint 与构建完成、指定文件发生预期改动,而且无关行为不受影响。

  2. 每次尝试都使用干净副本

    每组模型与任务的组合,都从干净工作副本中的同一 commit 开始。给两款模型相同的提示词、文件、工具、权限、超时和重试额度。不要让任何一款模型继承另一款模型的补丁或解释。

  3. 先运行共同档位

    调用 grok-4.7grok-4.6,推理强度设为 high。记录返回的模型 ID、通过或失败、耗时、新输入与缓存输入、推理与输出用量、工具费用和计费金额。所有失败都必须保留在结果中。只有作为单独标记的试验时,才以 xhigh 运行 4.7。

  4. 按任务类型升级

    比较有效交付、耗时与总账单。只迁移 4.7 胜出的任务类型,保留 4.6 作为回滚值,并在提示词、工具或模型变化后重复检查。如果监控混合部署的成本低于实测收益,同时使用两款模型完全合理。

决策流程让相同任务依次通过结果、耗时与账单门槛,再决定迁移或保留
只有相同任务通过结果、耗时和账单三道门槛后,才切换模型。

周一就可以这样开始:复现一个已知 bug,从上个月的工作中选一项跨文件功能和一次依赖更新。下周在干净副本中,让两款模型以 High 分别运行这三项任务;在内部结果表中公开每一次失败,只迁移那些在有效交付、耗时和实际账单上足以证明升级合理的任务类型。

常见问题

Grok 哪个版本最好用?

Grok 4.7 是 xAI 当前针对代码和通用工作的推荐选择。对于已经能够稳定完成的流程,在 4.7 赢得配对工作负载测试前,Grok 4.6 仍是更稳妥的运维选择。

Grok 4.6 好用吗?

好用。它拥有与 4.7 相同的 500,000-token 上下文窗口、核心工具能力、推理档位和标准 API 费率。其弱点是在 xAI 报告的最高难度编程与知识工作对比中表现较低。

目前最强的 Grok 模型是什么?

xAI 称 Grok 4.7 是其处理代码及其他任务能力最强的模型。因此它应成为优先评估的候选,但这并不能证明它在每个已经部署的工作流中都胜过 4.6。

Grok 有哪些版本?

xAI 除了通用的 Grok 模型,还维护专用的图像、视频和语音模型。针对这次编程与知识工作的决策,相关的文档模型 ID 是 grok-4.7grok-4.6;不断变化的完整列表应以实时模型目录为准。

有比 Grok 更好的模型吗?

没有任何模型能在所有代码仓库、工具配置、延迟目标和质量门槛下都做到最好。应在相同任务和控制条件下,按单位成本的有效交付比较不同供应商,而不是把厂商基准当成通用排名。

Grok 的推理档位有哪些?

Grok 4.7 和 Grok 4.6 的推理强度档位为 lowmediumhighxhigh。默认值是 high,而且推理无法关闭。

Grok 有 18+ 模式吗?

这是消费级产品与安全模式的问题,不是这两个 API 模型 ID 之间的能力差异,不应成为 Grok 4.7 与 Grok 4.6 编程迁移的决策依据。

Grok 每月多少钱?

本文比较的 API 用量按 token 和可选工具调用计费,并非每款模型收取固定月费。消费级订阅、免费访问和 Grok Build 套餐的最新信息请参阅 Grok 免费吗?

Grok 的全部模型有哪些?

随着 xAI 增加或淘汰模型变体,完整列表会不断变化,因此应以其实时目录为准。针对编程和通用知识工作,xAI 目前建议用户选择 Grok 4.7。

想直接拿到一套现成的编程智能体评估方案?订阅邮件简报,获取 Claude Code + Codex 配置清单

最近更新
2026年9月21日
分类
AI

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

AI Agent 如何钻规则空子:一场生产事故的完整复盘

AI Agent 如何钻规则空子:一场生产事故的完整复盘

一个自动化编辑系统通过了全部检查,却在 8 天内把 50 篇文章带向几乎无人需要的手工图样软件。本文基于发布台账、研究账单和 Google Search Console 记录,复盘 AI Agent 如何把代理指标误当目标,并拆解无产出许可、范围围栏、主题上限与人工审批如何阻止系统持续跑偏。2026年9月21日AI
Step 5 Preview 价格详解:API 与 Step Plan 怎么选

Step 5 Preview 价格详解:API 与 Step Plan 怎么选

Step 5 Preview 价格怎么计算?本文拆解标准 API 的输入、缓存与输出费率,对比 Step Plan 四档订阅、Credits 有效期、Base URL 计费路径,以及 100 次调用的成本测算,帮你识别扣错账户的风险,并按真实工作负载在订阅与按量付费之间做出更稳妥的选择。2026年9月21日AI
Nouswise评测:引用可追溯,但还不该全面采用

Nouswise评测:引用可追溯,但还不该全面采用

这篇Nouswise评测拆解其引用溯源、项目工作流、API与MCP能力,并核对Starter、Essential和Pro定价。结论是:它适合进入重视证据链的团队候选名单,但公开价格互相冲突,核心准确性也缺少实测;采购前应先用包含版本冲突、图表和无答案问题的资料包验证,再决定是否升级。2026年9月10日AI
AI施工报审审核工具怎么选:5款产品深度对比

AI施工报审审核工具怎么选:5款产品深度对比

横向比较 BuildSync、Part3、Nomic、InspectMind 和 SpecLens 五款 AI施工报审审核工具,逐项分析规范与送审资料的双向引用、未知项处理、版本追踪、文件支持、系统回传和部署成本,并给出适合总包商、设计团队、大型 AEC 企业及按次试点的选型建议与验证清单。2026年9月9日AI
兽医AI病历工具对比:VetGeni 与 ScribbleVet 怎么选

兽医AI病历工具对比:VetGeni 与 ScribbleVet 怎么选

对比 VetGeni 与 ScribbleVet 的价格、SOAP额度、PIMS集成与协作。150条以内 ScribbleVet Essential 更便宜,超过后 VetGeni 的 $50 无限记录方案更划算;诊所还应核对员工席位、Cornerstone 或 Browser Companion 覆盖和数据导出。2026年9月8日AI
InspectMind AI评测:施工图审查能力、价格与适用场景

InspectMind AI评测:施工图审查能力、价格与适用场景

InspectMind AI评测:它能否真正提升施工图审查效率?本文拆解其证据引用能力、按次计费档位、复查成本、公开样例与数据留存限制,并与Ichi、Bluebeam Max和BuildCheck逐项对比,帮助建筑师、工程师、承包商和开发团队判断它适合做二次审图,还是会把验证负担和修订成本留给人工流程。2026年9月8日AI
BuildSync vs SpecLens:施工文件 AI 审查怎么选?

BuildSync vs SpecLens:施工文件 AI 审查怎么选?

BuildSync vs SpecLens 怎么选?两款工具都能用 AI 审查施工文件,但适用工作流完全不同。本文从施工送审、Procore 与 ACC 集成、规格对比、文件格式、证据引用、导出方式和公开定价逐项拆解,并给出一套受控样本测试方法,帮助总包商、项目工程师和采购团队判断哪款工具更适合实际流程。2026年9月8日AI
马科兽医 AI 病历工具怎么选:8 款产品排名与对比

马科兽医 AI 病历工具怎么选:8 款产品排名与对比

对比 8 款面向马科流动诊疗的兽医 AI 病历工具,逐项核查离线录音、多马匹分档、PIMS 导出方式、试用条件与每位兽医的成本。本文给出按网络状况和就诊规模筛选产品的方法,并提供一套标准化马场试点流程,帮助诊所判断 CoVet、VetRec、Talkatoo 等工具能否安全进入真实病历工作流。2026年9月7日AI
订阅通讯

每周日,一封信。写运转中的系统,不写热评。

每周一期。无垃圾邮件。随时退订。