Gemini 3.6 Flash 评测:Agent 值得升级,别一刀切

Gemini 3.6 Flash 评测:每百万输出 token 降至 $7.50,Google 称输出量减少 17%。本文对比 3.5 Flash 与 Flash-Lite 的价格、基准测试、上下文窗口和迁移风险,并给出 Agent、编码及高吞吐任务的采用标准,帮你判断哪些工作负载应升级、哪些应保留在更便宜的模型上。

Thursday, September 3, 2026Omid Saffari
Gemini 3.6 Flash 评测:Agent 值得升级,别一刀切

这篇 Gemini 3.6 Flash 评测的结论很明确:作为 Gemini 3 系列的 Flash 模型,它值得用于复杂 Agent 和编码循环,但不应成为所有 Gemini 工作负载的新默认选项。Google 将每百万输出 token 的价格从 $9.00 降至 $7.50,并称其输出 token 比 3.5 Flash 少 17%;不过,简单抽取任务仍应交给输出价仅 $2.50 的 Flash-Lite。

Google 的 Gemini 3.6 Flash 模型与迁移文档
Gemini 3.6 Flash

Gemini 3.6 Flash 评测结论:升级 Agent,而非全面替换

如果工作负载需要反复执行规划、调用工具、编写代码和验证,Gemini 3.6 Flash 应当取代 3.5 Flash。但对于已经达到质量要求的常规抽取、分类或结构化解析,没有必要放弃价格更低的 Flash-Lite。

根据 Google 当前的模型指南,该模型已使用稳定 ID gemini-3.6-flash 正式开放,默认思考等级为 medium。这意味着它已经是生产选项,而不是需要押注的预览版。Gemini 3.5 Pro 延期 曾带来的选择题也随之改变:既然更强的主力模型已经上线,就没有必要继续等待 Pro。

模型状态与默认思考等级标准 API 每 1M token 价格最适合主要限制结论
Gemini 3.6 FlashGA,medium$1.50 输入,$7.50 输出多步骤 Agent、编码循环、计算机操作、多模态分析迁移改动、偶发变慢或超时、视觉样式较弱复杂 Flash 工作负载应采用
Gemini 3.5 Flash稳定版,medium$1.50 输入,$9.00 输出现有的稳定 Flash 部署每个输出 token 成本更高,而且在 Google 的对比中输出量更大仅保留为回滚基线
Gemini 3.5 Flash-LiteGA,minimal$0.30 输入,$2.50 输出大规模抽取、路由、分类、文档处理复杂 Agent 任务的能力上限较低简单的大批量任务继续使用

判断标准可以压缩成一句话:只有当 3.6 的重试率更低、输出用量更少,或人工审核后的任务通过率更高,足以胜过便宜模型时,才迁移该工作负载。 模型单价只是计价器,真正要付的是每个通过验收任务的成本。

Gemini 3 整体产品线 对消费级套餐和旗舰推理仍然重要。本文只回答一个更具体的问题:哪些 API 工作负载值得迁移到新的 Flash 模型。

变化在哪:减少循环,与降价同样重要

Gemini 3.6 Flash 同时降低了 Agent 内部会不断叠加的两项成本:每个输出 token 的单价,以及 Agent 执行任务时生成的 token 数量。

所谓 Agent 循环,就是规划、行动、检查和重试反复进行。客服 Agent 可能先查询订单,再调用退款工具、核对政策、起草回复,发现不一致后又调用另一个工具。每多一轮推理,就会增加 token、延迟,以及工具调用格式出错的机会。token 降价只省一次,循环缩短则会在每一步持续节省。

7 月 21 日的发布公告 中,Google 称 3.6 Flash 在 Artificial Analysis Index 上的输出 token 比 3.5 Flash 少 17%。Google 还表示,该模型处理多步骤任务时需要的推理步骤和工具调用更少。这是此次发布最有力的商业理由,因为它既可能降低单位价格,也可能减少实际用量。

质量提升也指向同一类用法:

基准测试测试内容Gemini 3.6 FlashGemini 3.5 Flash变化
DeepSWE v1.1长周期软件工程49%37%+12 个百分点
MLE-Bench机器学习工程63.9%49.7%+14.2 个百分点
OSWorld-Verified计算机操作83.0%78.4%+4.6 个百分点
GDM-MRCR v2 at 1M长上下文检索54.0%26.6%+27.4 个百分点

这些结果由 Google 发布,因此它们只能作为评估的理由,不能证明你的工作流会获得同等幅度的提升。不过,结果分布依然有参考价值:增幅最大的项目是持续工程任务、机器学习工作、计算机操作和超长上下文。单轮分类器不会得到同样的收益。

模型的工作方式也发生了变化。Google 文档称,它会更早编写诊断脚本,减少不必要的代码修改,并减少执行循环。当一家中型企业的 CTO 让 Agent 跨多个服务追查故障时,这种行为很有价值;但当独立开发者只要求做一个小幅 CSS 修改时,模型先检查半个项目就可能造成浪费。

成本账:理想情况下,$330 降至 $274.50

在 token 用量完全相同时,Gemini 3.6 Flash 可节省 9.1%;如果 Google 所称的输出 token 减少 17% 也适用于实际工作负载,示例中的节省比例会达到 16.8%

假设一个生产 Agent 每月使用 100M 输入 token 和 20M 输出 token:

  • Gemini 3.5 Flash 输入:100M,单价为每百万 $1.50 = $150
  • Gemini 3.5 Flash 输出:20M,单价为每百万 $9.00 = $180
  • Gemini 3.5 Flash 合计:$330

如果 3.6 Flash 的 token 用量不变,输出成本会降至 $150,总成本为 $300。再把报告中的 17% 输出量降幅计入,Agent 的输出 token 将从 20M 降到 16.6M:

  • Gemini 3.6 Flash 输入:$150
  • Gemini 3.6 Flash 输出:16.6M,单价为每百万 $7.50 = $124.50
  • Gemini 3.6 Flash 合计:$274.50
  • 相比 3.5 Flash 每月节省:$55.50,即 16.8%

这不是预测。17% 来自单项评估,能否迁移到你的场景,取决于提示词、工具、重试机制和思考设置。但这个场景值得测试,因为它把确定的降价与依赖具体工作负载的效率提升拆开了。

Gemini 3.5 Flash 迁移到 Gemini 3.6 Flash 后,在输出量相同与减少时的成本瀑布图
单价下降是确定的;第二部分节省取决于实测输出量是否下降。

Google 当前的 Gemini API 价格表 为 3.6 Flash 列出了四档用量价格。标准档为每百万 token $1.50 输入和 $7.50 输出;Batch 和 Flex 均降至 $0.75 和 $3.75;Priority 则提高到 $2.70 和 $13.50。在输出量尚未减少前,同样的 100M 输入、20M 输出工作负载按 Batch 或 Flex 标价计算为 $150

上下文缓存可将重复提示词的输入价格降至每百万缓存 token $0.15,另收每百万 token 每小时 $1.00 的存储费。若每次 Agent 运行都要附带同一份手册、schema 或政策资料,这项能力会很有价值;如果提示词几乎每次都完全不同,它就帮不上忙。

搜索 grounding 另行计费:Gemini 3 每月共享 5,000 次免费提示,之后按每 1,000 次搜索查询 $14 收费。因此,研究型 Agent 的预算必须分成模型 token 和检索两部分。把有 grounding 的调用当成只有 token 成本,会低估账单。

基准测试支持升级,但不代表“新的全能第一”

Gemini 3.6 Flash 明显强于 3.5 Flash,但 Google 自己发布的 7 月模型卡表格 并不能证明它在每项高难度任务上都是最佳模型。

基准测试Gemini 3.6 FlashGoogle 表格中表现最强的具名竞品差距说明
DeepSWE v1.149%GPT-5.6 Luna, 67%强于 3.5 Flash,但仍低于编码能力上限
Terminal-bench 2.178.0%GPT-5.6 Luna, 84.7%终端 Agent 很强,但并非领先者
MLE-Bench63.9%Claude Sonnet 5, 66.9%差距足够小,应由成本和可靠性决定
GDPVal-AA v21421 EloClaude Sonnet 5, 1607 Elo知识工作有所提升,但未达到前沿领先水平
OSWorld-Verified83.0%Gemini 3.6 Flash 在具名竞品中领先计算机操作是最清晰的竞争优势

它的定位很清楚:3.6 Flash 是一次 Flash 升级,并在计算机操作方面具备可信优势;但它并不构成理由,让所有高难度任务都离开目前表现更好的前沿模型。 如果瓶颈是代码库规模的工程任务,而非高性价比的 Agent 吞吐量,应先比较当前的编码模型选择,再决定是否统一模型。

基准测试还会把生产环境中的复杂表现压缩成一个分数。即使总体完成率很高,只要剩余失败需要长链路追踪、重复调用工具或资深人员审核,成本仍可能很高。低 token 单价的模型如果重试次数明显更多,每个通过验收任务的成本反而可能更高。更实用的计分卡应跟踪:

  • 无需人工修复即可通过验收的任务
  • 每个通过验收任务的输出 token
  • 工具调用成功率与格式错误率
  • p50 和 p95 延迟
  • 超时率与重试率
  • 每项结果所需的审核时间
优势
做得好的地方
8 points

  • 标准输出价格从每百万 token $9.00 降至 $7.50。
  • Google 称,在 Artificial Analysis Index 上,输出 token 比 3.5 Flash 少 17%。
  • 厂商公布的最大提升集中在长周期编码、机器学习工程、计算机操作和 1M 上下文检索。
  • 稳定模型 ID 已正式开放,并提供 Batch、Flex 和 Priority 选项。
  • 在 Google 自己的编码和知识工作对比中,多个前沿竞品仍然领先。
  • Google 承认模型偶尔会变慢或超时。
  • 对于视觉布局和样式,人工评估者更偏好早期模型。
  • 此次迁移弃用了熟悉的采样控制项,并会拒绝预填充的模型轮次。

真正的生产瓶颈是行为,而非上下文长度

Gemini 3.6 Flash 的上下文容量和工具能力足以支撑严肃的 Agent。真正的限制在于:面对你的工具、延迟预算和审核标准时,它的行为能否始终保持可预测。

官方的 Gemini 3.6 Flash 模型页面 标明,输入上限为 1,048,576 token,输出上限为 65,536 token。它可接收文本、图像、视频、音频和 PDF,并输出文本;同时支持缓存、代码执行、文件搜索、函数调用、搜索与 Maps grounding、结构化输出、思考、URL 上下文,以及 Preview 阶段的计算机操作。

这样的能力范围很适合获得融资的创始人:其运营 Agent 可以阅读合同、查看仪表盘、调用内部工具,再起草异常报告。它也适合资深业务人员在同一案例中审阅混合格式的 PDF、图表和会议音频。

边界同样重要:

  • 计算机操作仍处于 Preview。 对会改变客户、财务或生产状态的操作设置审批关卡。
  • 不支持图像生成、音频生成和 Live API。 实时语音或媒体生成产品需要在技术栈中加入其他模型。
  • 知识截止时间为 2026 年 3 月。 当最新事实会影响答案时,应使用搜索 grounding 或自有检索系统。
  • 幻觉仍是已知限制。 长上下文代表容量,不代表真实可靠。
  • 文档已注明偶发变慢和超时。 面向客户的工作流仍需重试、幂等机制和后备路径。
  • 视觉样式可能退步。 Google 表示,即使 3.6 生成的代码功能更完善,人工评估者在布局和样式上仍更偏好早期模型。

最后一点很容易被忽略。独立技术开发者让模型制作精致落地页时,可能得到更清晰的逻辑,却看到更弱的视觉构图。应明确给出设计规则、检查截图,不要用编码基准测试代替设计审核。

如何在不破坏生产环境的前提下迁移

迁移到 Gemini 3.6 Flash 不能只替换模型 ID。Google 的迁移指南 涉及请求控制、轮次验证以及部分函数调用处理方式的变更。

明确的破坏性变更包括:

  • 移除 temperaturetop_ptop_k。它们已经弃用并会被忽略;Google 表示,未来模型代际收到这些字段时将返回 HTTP 400。
  • thinking_budget 替换为 thinking_level,并将后者设为 mediumhigh
  • 移除 Gemini 3.x 不支持的 candidate_count
  • 移除预填充的模型轮次。请求若以非空的 model 角色轮次结尾,将返回 HTTP 400。
  • 将多轮状态统一到服务端 previous_interaction_id
  • 如果使用 generateContent,请加入 call_idname;每个 FunctionResponse 都必须包含这两项。

不要等实时流量已经切换后才发现这些改动。应把迁移作为一次受控的模型评估:

  1. 冻结一组验收样本

    选取真实且已脱敏的任务,覆盖成功案例、常见失败、长工具链、多模态输入和对超时敏感的路径。记录 3.5 Flash 的结果、输出 token、延迟、重试、工具调用和审核时间。

  2. 清理请求契约

    在修改模型 ID 前,移除已弃用的采样字段、预填充模型轮次、thinking_budgetcandidate_count,并更新多轮交互和函数响应的处理方式。

  3. 让 3.6 与 3.5 并行影子运行

    把同一批符合条件的输入同时发送给两个模型,但不允许 3.6 的结果改变外部状态。比较通过验收率和每个通过验收任务的成本,而不只是语言是否流畅。

  4. 从最安全的切片开始金丝雀测试

    把一小部分可逆工作负载路由到 gemini-3.6-flash,监控 p95 延迟、超时、格式错误的工具调用、token 用量和人工接管情况,并保留 3.5 Flash 作为即时回滚方案。

  5. 按任务类型逐步扩大

    先迁移复杂编码和 Agent 循环。简单抽取继续留在 Flash-Lite,任何未通过质量关卡的任务则继续使用原模型。最终采用混合路由完全合理。

从影子评估、金丝雀测试到带回滚机制的上线四道关卡
把 3.6 当作一次有回滚路径的量化迁移,而不是替换一个字符串。

现在谁应该采用 Gemini 3.6 Flash

使用复杂 Flash 工作负载的团队应立即评估;为简单吞吐付费的团队则应继续使用 Flash-Lite。

读者与场景选择原因采用门槛
正在交付多工具运营 Agent 的融资期创始人Gemini 3.6 Flash相比 3.5 Flash,长周期编码、计算机操作和输出成本表现更好重试更少,且每个通过验收工作流的成本更低
已部署 3.5 Flash 的中型企业 CTO3.6 金丝雀测试,同时保留 3.5 回滚模型已稳定 GA,但请求契约与延迟风险仍需实测质量持平或更好,且 p95 或超时指标不越线
进行大规模文档抽取的资深业务人员优先使用 Gemini 3.5 Flash-Lite对可预测任务而言,$0.30 输入和 $2.50 输出优于 3.6只升级确实失败的异常任务类型
使用 Agent 编码的独立技术开发者Gemini 3.6 Flash,并明确设计规则功能编码与 Agent 循环更强,但视觉样式可能较弱截图审核与测试均通过
追求最高编码基准成绩的团队对比前沿竞品Google 的表格显示,3.6 在 DeepSWE 和 Terminal-bench 上落后于多个竞品通过验收任务的增幅必须胜过价格差异

当任务会因循环减少而受益时,就应采用。若工作流对延迟敏感、重视视觉样式、已在 Flash-Lite 上稳定运行,或者依赖 3.6 仍落后的基准任务,则应等待。

清晰的架构不是押注某个最喜欢的模型,而是建立路由:Flash-Lite 处理可预测的大批量任务,3.6 Flash 处理复杂 Agent 循环,再为价值足以覆盖高额账单的失败任务提供前沿模型升级路径。

常见问题

Gemini 3.6 Flash 价格是多少?

标准付费 API 的价格为每百万输入 token $1.50、每百万输出 token $7.50,思考 token 也计入输出。Batch 和 Flex 为 $0.75 输入、$3.75 输出;Priority 为 $2.70 输入、$13.50 输出。

Gemini 3.6 Flash 是推理模型吗?

是。Gemini 3.6 Flash 支持思考,默认思考等级为 medium。Google 建议使用 mediumhigh,以替代旧的 thinking_budget 控制项。

Gemini 3.6 Flash 的上下文窗口有多大?

文档标明的输入上限为 1,048,576 token,输出上限为 65,536 token。它可接收文本、图像、视频、音频和 PDF,并输出文本。

Gemini 3.6 Flash 比 Gemini 3.5 Flash 更好吗?

对于复杂 Flash 工作负载,是的。它的每个输出 token 成本更低;Google 称输出 token 少 17%,且发布的编码、机器学习工程、计算机操作和长上下文检索分数均更高。在你自己的金丝雀测试通过验收关卡前,仍应保留 3.5 Flash 作为回滚方案。

想获取面向企业主的 AI 工具全景图?订阅 newsletter 即可领取

最近更新

2026年9月3日

分类AI

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

更多 AI 文章

查看全部 AI 文章
订阅通讯

每周日,一封信。 写运转中的系统,不写热评。

来自一组 AI 项目组合运营的构建日志、生产系统与一线笔记。

每周一期。无垃圾邮件。随时退订。