Gemini 3.6 Flash 评测:Agent 值得升级,别一刀切

Gemini 3.6 Flash 评测:每百万输出 token 降至 $7.50,Google 称输出量减少 17%。本文对比 3.5 Flash 与 Flash-Lite 的价格、基准测试、上下文窗口和迁移风险,并给出 Agent、编码及高吞吐任务的采用标准,帮你判断哪些工作负载应升级、哪些应保留在更便宜的模型上。

Thursday, September 3, 2026Omid Saffari
Gemini 3.6 Flash 评测:Agent 值得升级,别一刀切

这篇 Gemini 3.6 Flash 评测的结论很明确:作为 Gemini 3 系列的 Flash 模型,它值得用于复杂 Agent 和编码循环,但不应成为所有 Gemini 工作负载的新默认选项。Google 将每百万输出 token 的价格从 $9.00 降至 $7.50,并称其输出 token 比 3.5 Flash 少 17%;不过,简单抽取任务仍应交给输出价仅 $2.50 的 Flash-Lite。

Google 的 Gemini 3.6 Flash 模型与迁移文档
Gemini 3.6 Flash

Gemini 3.6 Flash 评测结论:升级 Agent,而非全面替换

如果工作负载需要反复执行规划、调用工具、编写代码和验证,Gemini 3.6 Flash 应当取代 3.5 Flash。但对于已经达到质量要求的常规抽取、分类或结构化解析,没有必要放弃价格更低的 Flash-Lite。

根据 Google 当前的模型指南,该模型已使用稳定 ID gemini-3.6-flash 正式开放,默认思考等级为 medium。这意味着它已经是生产选项,而不是需要押注的预览版。Gemini 3.5 Pro 延期 曾带来的选择题也随之改变:既然更强的主力模型已经上线,就没有必要继续等待 Pro。

模型状态与默认思考等级标准 API 每 1M token 价格最适合主要限制结论
Gemini 3.6 FlashGA,medium$1.50 输入,$7.50 输出多步骤 Agent、编码循环、计算机操作、多模态分析迁移改动、偶发变慢或超时、视觉样式较弱复杂 Flash 工作负载应采用
Gemini 3.5 Flash稳定版,medium$1.50 输入,$9.00 输出现有的稳定 Flash 部署每个输出 token 成本更高,而且在 Google 的对比中输出量更大仅保留为回滚基线
Gemini 3.5 Flash-LiteGA,minimal$0.30 输入,$2.50 输出大规模抽取、路由、分类、文档处理复杂 Agent 任务的能力上限较低简单的大批量任务继续使用

判断标准可以压缩成一句话:只有当 3.6 的重试率更低、输出用量更少,或人工审核后的任务通过率更高,足以胜过便宜模型时,才迁移该工作负载。 模型单价只是计价器,真正要付的是每个通过验收任务的成本。

Gemini 3 整体产品线 对消费级套餐和旗舰推理仍然重要。本文只回答一个更具体的问题:哪些 API 工作负载值得迁移到新的 Flash 模型。

变化在哪:减少循环,与降价同样重要

Gemini 3.6 Flash 同时降低了 Agent 内部会不断叠加的两项成本:每个输出 token 的单价,以及 Agent 执行任务时生成的 token 数量。

所谓 Agent 循环,就是规划、行动、检查和重试反复进行。客服 Agent 可能先查询订单,再调用退款工具、核对政策、起草回复,发现不一致后又调用另一个工具。每多一轮推理,就会增加 token、延迟,以及工具调用格式出错的机会。token 降价只省一次,循环缩短则会在每一步持续节省。

7 月 21 日的发布公告 中,Google 称 3.6 Flash 在 Artificial Analysis Index 上的输出 token 比 3.5 Flash 少 17%。Google 还表示,该模型处理多步骤任务时需要的推理步骤和工具调用更少。这是此次发布最有力的商业理由,因为它既可能降低单位价格,也可能减少实际用量。

质量提升也指向同一类用法:

基准测试测试内容Gemini 3.6 FlashGemini 3.5 Flash变化
DeepSWE v1.1长周期软件工程49%37%+12 个百分点
MLE-Bench机器学习工程63.9%49.7%+14.2 个百分点
OSWorld-Verified计算机操作83.0%78.4%+4.6 个百分点
GDM-MRCR v2 at 1M长上下文检索54.0%26.6%+27.4 个百分点

这些结果由 Google 发布,因此它们只能作为评估的理由,不能证明你的工作流会获得同等幅度的提升。不过,结果分布依然有参考价值:增幅最大的项目是持续工程任务、机器学习工作、计算机操作和超长上下文。单轮分类器不会得到同样的收益。

模型的工作方式也发生了变化。Google 文档称,它会更早编写诊断脚本,减少不必要的代码修改,并减少执行循环。当一家中型企业的 CTO 让 Agent 跨多个服务追查故障时,这种行为很有价值;但当独立开发者只要求做一个小幅 CSS 修改时,模型先检查半个项目就可能造成浪费。

成本账:理想情况下,$330 降至 $274.50

在 token 用量完全相同时,Gemini 3.6 Flash 可节省 9.1%;如果 Google 所称的输出 token 减少 17% 也适用于实际工作负载,示例中的节省比例会达到 16.8%

假设一个生产 Agent 每月使用 100M 输入 token 和 20M 输出 token:

  • Gemini 3.5 Flash 输入:100M,单价为每百万 $1.50 = $150
  • Gemini 3.5 Flash 输出:20M,单价为每百万 $9.00 = $180
  • Gemini 3.5 Flash 合计:$330

如果 3.6 Flash 的 token 用量不变,输出成本会降至 $150,总成本为 $300。再把报告中的 17% 输出量降幅计入,Agent 的输出 token 将从 20M 降到 16.6M:

  • Gemini 3.6 Flash 输入:$150
  • Gemini 3.6 Flash 输出:16.6M,单价为每百万 $7.50 = $124.50
  • Gemini 3.6 Flash 合计:$274.50
  • 相比 3.5 Flash 每月节省:$55.50,即 16.8%

这不是预测。17% 来自单项评估,能否迁移到你的场景,取决于提示词、工具、重试机制和思考设置。但这个场景值得测试,因为它把确定的降价与依赖具体工作负载的效率提升拆开了。

Gemini 3.5 Flash 迁移到 Gemini 3.6 Flash 后,在输出量相同与减少时的成本瀑布图
单价下降是确定的;第二部分节省取决于实测输出量是否下降。

Google 当前的 Gemini API 价格表 为 3.6 Flash 列出了四档用量价格。标准档为每百万 token $1.50 输入和 $7.50 输出;Batch 和 Flex 均降至 $0.75 和 $3.75;Priority 则提高到 $2.70 和 $13.50。在输出量尚未减少前,同样的 100M 输入、20M 输出工作负载按 Batch 或 Flex 标价计算为 $150

上下文缓存可将重复提示词的输入价格降至每百万缓存 token $0.15,另收每百万 token 每小时 $1.00 的存储费。若每次 Agent 运行都要附带同一份手册、schema 或政策资料,这项能力会很有价值;如果提示词几乎每次都完全不同,它就帮不上忙。

搜索 grounding 另行计费:Gemini 3 每月共享 5,000 次免费提示,之后按每 1,000 次搜索查询 $14 收费。因此,研究型 Agent 的预算必须分成模型 token 和检索两部分。把有 grounding 的调用当成只有 token 成本,会低估账单。

基准测试支持升级,但不代表“新的全能第一”

Gemini 3.6 Flash 明显强于 3.5 Flash,但 Google 自己发布的 7 月模型卡表格 并不能证明它在每项高难度任务上都是最佳模型。

基准测试Gemini 3.6 FlashGoogle 表格中表现最强的具名竞品差距说明
DeepSWE v1.149%GPT-5.6 Luna, 67%强于 3.5 Flash,但仍低于编码能力上限
Terminal-bench 2.178.0%GPT-5.6 Luna, 84.7%终端 Agent 很强,但并非领先者
MLE-Bench63.9%Claude Sonnet 5, 66.9%差距足够小,应由成本和可靠性决定
GDPVal-AA v21421 EloClaude Sonnet 5, 1607 Elo知识工作有所提升,但未达到前沿领先水平
OSWorld-Verified83.0%Gemini 3.6 Flash 在具名竞品中领先计算机操作是最清晰的竞争优势

它的定位很清楚:3.6 Flash 是一次 Flash 升级,并在计算机操作方面具备可信优势;但它并不构成理由,让所有高难度任务都离开目前表现更好的前沿模型。 如果瓶颈是代码库规模的工程任务,而非高性价比的 Agent 吞吐量,应先比较当前的编码模型选择,再决定是否统一模型。

基准测试还会把生产环境中的复杂表现压缩成一个分数。即使总体完成率很高,只要剩余失败需要长链路追踪、重复调用工具或资深人员审核,成本仍可能很高。低 token 单价的模型如果重试次数明显更多,每个通过验收任务的成本反而可能更高。更实用的计分卡应跟踪:

  • 无需人工修复即可通过验收的任务
  • 每个通过验收任务的输出 token
  • 工具调用成功率与格式错误率
  • p50 和 p95 延迟
  • 超时率与重试率
  • 每项结果所需的审核时间
优势
做得好的地方
8 points

  • 标准输出价格从每百万 token $9.00 降至 $7.50。
  • Google 称,在 Artificial Analysis Index 上,输出 token 比 3.5 Flash 少 17%。
  • 厂商公布的最大提升集中在长周期编码、机器学习工程、计算机操作和 1M 上下文检索。
  • 稳定模型 ID 已正式开放,并提供 Batch、Flex 和 Priority 选项。
  • 在 Google 自己的编码和知识工作对比中,多个前沿竞品仍然领先。
  • Google 承认模型偶尔会变慢或超时。
  • 对于视觉布局和样式,人工评估者更偏好早期模型。
  • 此次迁移弃用了熟悉的采样控制项,并会拒绝预填充的模型轮次。

真正的生产瓶颈是行为,而非上下文长度

Gemini 3.6 Flash 的上下文容量和工具能力足以支撑严肃的 Agent。真正的限制在于:面对你的工具、延迟预算和审核标准时,它的行为能否始终保持可预测。

官方的 Gemini 3.6 Flash 模型页面 标明,输入上限为 1,048,576 token,输出上限为 65,536 token。它可接收文本、图像、视频、音频和 PDF,并输出文本;同时支持缓存、代码执行、文件搜索、函数调用、搜索与 Maps grounding、结构化输出、思考、URL 上下文,以及 Preview 阶段的计算机操作。

这样的能力范围很适合获得融资的创始人:其运营 Agent 可以阅读合同、查看仪表盘、调用内部工具,再起草异常报告。它也适合资深业务人员在同一案例中审阅混合格式的 PDF、图表和会议音频。

边界同样重要:

  • 计算机操作仍处于 Preview。 对会改变客户、财务或生产状态的操作设置审批关卡。
  • 不支持图像生成、音频生成和 Live API。 实时语音或媒体生成产品需要在技术栈中加入其他模型。
  • 知识截止时间为 2026 年 3 月。 当最新事实会影响答案时,应使用搜索 grounding 或自有检索系统。
  • 幻觉仍是已知限制。 长上下文代表容量,不代表真实可靠。
  • 文档已注明偶发变慢和超时。 面向客户的工作流仍需重试、幂等机制和后备路径。
  • 视觉样式可能退步。 Google 表示,即使 3.6 生成的代码功能更完善,人工评估者在布局和样式上仍更偏好早期模型。

最后一点很容易被忽略。独立技术开发者让模型制作精致落地页时,可能得到更清晰的逻辑,却看到更弱的视觉构图。应明确给出设计规则、检查截图,不要用编码基准测试代替设计审核。

如何在不破坏生产环境的前提下迁移

迁移到 Gemini 3.6 Flash 不能只替换模型 ID。Google 的迁移指南 涉及请求控制、轮次验证以及部分函数调用处理方式的变更。

明确的破坏性变更包括:

  • 移除 temperaturetop_ptop_k。它们已经弃用并会被忽略;Google 表示,未来模型代际收到这些字段时将返回 HTTP 400。
  • thinking_budget 替换为 thinking_level,并将后者设为 mediumhigh
  • 移除 Gemini 3.x 不支持的 candidate_count
  • 移除预填充的模型轮次。请求若以非空的 model 角色轮次结尾,将返回 HTTP 400。
  • 将多轮状态统一到服务端 previous_interaction_id
  • 如果使用 generateContent,请加入 call_idname;每个 FunctionResponse 都必须包含这两项。

不要等实时流量已经切换后才发现这些改动。应把迁移作为一次受控的模型评估:

  1. 冻结一组验收样本

    选取真实且已脱敏的任务,覆盖成功案例、常见失败、长工具链、多模态输入和对超时敏感的路径。记录 3.5 Flash 的结果、输出 token、延迟、重试、工具调用和审核时间。

  2. 清理请求契约

    在修改模型 ID 前,移除已弃用的采样字段、预填充模型轮次、thinking_budgetcandidate_count,并更新多轮交互和函数响应的处理方式。

  3. 让 3.6 与 3.5 并行影子运行

    把同一批符合条件的输入同时发送给两个模型,但不允许 3.6 的结果改变外部状态。比较通过验收率和每个通过验收任务的成本,而不只是语言是否流畅。

  4. 从最安全的切片开始金丝雀测试

    把一小部分可逆工作负载路由到 gemini-3.6-flash,监控 p95 延迟、超时、格式错误的工具调用、token 用量和人工接管情况,并保留 3.5 Flash 作为即时回滚方案。

  5. 按任务类型逐步扩大

    先迁移复杂编码和 Agent 循环。简单抽取继续留在 Flash-Lite,任何未通过质量关卡的任务则继续使用原模型。最终采用混合路由完全合理。

从影子评估、金丝雀测试到带回滚机制的上线四道关卡
把 3.6 当作一次有回滚路径的量化迁移,而不是替换一个字符串。

现在谁应该采用 Gemini 3.6 Flash

使用复杂 Flash 工作负载的团队应立即评估;为简单吞吐付费的团队则应继续使用 Flash-Lite。

读者与场景选择原因采用门槛
正在交付多工具运营 Agent 的融资期创始人Gemini 3.6 Flash相比 3.5 Flash,长周期编码、计算机操作和输出成本表现更好重试更少,且每个通过验收工作流的成本更低
已部署 3.5 Flash 的中型企业 CTO3.6 金丝雀测试,同时保留 3.5 回滚模型已稳定 GA,但请求契约与延迟风险仍需实测质量持平或更好,且 p95 或超时指标不越线
进行大规模文档抽取的资深业务人员优先使用 Gemini 3.5 Flash-Lite对可预测任务而言,$0.30 输入和 $2.50 输出优于 3.6只升级确实失败的异常任务类型
使用 Agent 编码的独立技术开发者Gemini 3.6 Flash,并明确设计规则功能编码与 Agent 循环更强,但视觉样式可能较弱截图审核与测试均通过
追求最高编码基准成绩的团队对比前沿竞品Google 的表格显示,3.6 在 DeepSWE 和 Terminal-bench 上落后于多个竞品通过验收任务的增幅必须胜过价格差异

当任务会因循环减少而受益时,就应采用。若工作流对延迟敏感、重视视觉样式、已在 Flash-Lite 上稳定运行,或者依赖 3.6 仍落后的基准任务,则应等待。

清晰的架构不是押注某个最喜欢的模型,而是建立路由:Flash-Lite 处理可预测的大批量任务,3.6 Flash 处理复杂 Agent 循环,再为价值足以覆盖高额账单的失败任务提供前沿模型升级路径。

常见问题

Gemini 3.6 Flash 价格是多少?

标准付费 API 的价格为每百万输入 token $1.50、每百万输出 token $7.50,思考 token 也计入输出。Batch 和 Flex 为 $0.75 输入、$3.75 输出;Priority 为 $2.70 输入、$13.50 输出。

Gemini 3.6 Flash 是推理模型吗?

是。Gemini 3.6 Flash 支持思考,默认思考等级为 medium。Google 建议使用 mediumhigh,以替代旧的 thinking_budget 控制项。

Gemini 3.6 Flash 的上下文窗口有多大?

文档标明的输入上限为 1,048,576 token,输出上限为 65,536 token。它可接收文本、图像、视频、音频和 PDF,并输出文本。

Gemini 3.6 Flash 比 Gemini 3.5 Flash 更好吗?

对于复杂 Flash 工作负载,是的。它的每个输出 token 成本更低;Google 称输出 token 少 17%,且发布的编码、机器学习工程、计算机操作和长上下文检索分数均更高。在你自己的金丝雀测试通过验收关卡前,仍应保留 3.5 Flash 作为回滚方案。

想获取面向企业主的 AI 工具全景图?订阅 newsletter 即可领取

最近更新
2026年9月3日
分类
AI

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

Claude Opus 5.5 对比 Opus 5:价格、编程与 API 迁移指南

Claude Opus 5.5 对比 Opus 5:价格、编程与 API 迁移指南

Claude Opus 5.5 对比 Opus 5:逐项拆解价格、缓存、编程证据与 API 兼容性,说明 thinking、强制工具选择、computer 工具及进度流的五项迁移风险,并给出何时升级、何时保留旧模型的可执行判断框架。同时用固定 token 算例核对真实账单,帮助团队按每个合格结果的成本做选择。2026年9月23日AI
GPT-6 Sol 对比 Luna:先用 Luna,难题再上 Sol

GPT-6 Sol 对比 Luna:先用 Luna,难题再上 Sol

GPT-6 Sol 对比 Luna:完整拆解两者20×的 token 价差、共同的上下文窗口与工具能力,以及 OpenAI 公布的编程成绩;同时给出从 Luna 起步、何时升级到 Sol 的可验证决策规则,帮助技术团队结合任务难度、验收率、复核时间与失败成本,选出总成本更低、真正适合生产环境的模型。2026年9月23日AI
GPT-6 Luna 免费吗?桌面端、Codex 与 API 费用全解析

GPT-6 Luna 免费吗?桌面端、Codex 与 API 费用全解析

GPT-6 Luna 免费吗?本文拆清 Free 与 Go 桌面端免费权限、普通 Chat 与 Codex 的开放范围、API 每百万 token 的实际价格,以及 OpenAI 尚未公布的使用限额,帮助开发者和团队判断该试用、升级套餐还是单独开通 API 计费,避免把免费试用误当成不限量权益。2026年9月22日AI
MiMo V2.6 教程:从 Studio 验证到 API 上线

MiMo V2.6 教程:从 Studio 验证到 API 上线

MiMo V2.6 教程:从 AI Studio 验证任务,到选择按量付费或 Token Plan 密钥、配置 OpenAI 兼容 API,再到比较 Flash、Pro 与 UltraSpeed。附 Python 请求、价格测算、七个业务工作流和按顺序排错的方法,帮助团队在接入真实数据前完成安全评估。2026年9月22日AI
MiMo V2.6 Pro 对比 Flash:价格、性能与部署选择

MiMo V2.6 Pro 对比 Flash:价格、性能与部署选择

MiMo V2.6 Pro 对比 Flash 怎么选?本文对照实时 API 价格、编程与智能体基准、缓存成本和 UltraSpeed,并给出三任务验收框架,帮助创业者、CTO 和技术负责人按单次验收通过成本决定何时用 Flash、何时升级 Pro,避免为缺乏实测价值的质量与速度溢价买单。2026年9月22日AI
MiMo V2.6 免费吗?限免入口、API 价格与 MIT 权重详解

MiMo V2.6 免费吗?限免入口、API 价格与 MIT 权重详解

MiMo V2.6 免费吗?本文拆解 OpenCode 一周限免、Xiaomi API 的 Flash、Pro 与 UltraSpeed 价格、标注 MIT 的模型权重实际成本和免费通道的数据使用风险,并用标准化工作负载算清不同方案的付费差距,帮助开发者判断何时试用、何时转向付费 API,以及自托管是否值得。2026年9月22日AI
Grok 4.7 对比 Grok 4.6:谁更强,是否值得升级?

Grok 4.7 对比 Grok 4.6:谁更强,是否值得升级?

Grok 4.7 对比 Grok 4.6:两者标准 API 价格相同,真正差别在复杂编程、知识工作和迁移风险。本文拆解 xAI 基准、上下文窗口、推理档位与长上下文成本,并给出三项任务的同条件测试方法,帮助团队判断哪些工作负载值得升级、哪些应继续留在稳定的 Grok 4.6 流程,避免只看发布分数做决定。2026年9月21日AI
AI Agent 如何钻规则空子:一场生产事故的完整复盘

AI Agent 如何钻规则空子:一场生产事故的完整复盘

一个自动化编辑系统通过了全部检查,却在 8 天内把 50 篇文章带向几乎无人需要的手工图样软件。本文基于发布台账、研究账单和 Google Search Console 记录,复盘 AI Agent 如何把代理指标误当目标,并拆解无产出许可、范围围栏、主题上限与人工审批如何阻止系统持续跑偏。2026年9月21日AI
订阅通讯

每周日,一封信。写运转中的系统,不写热评。

每周一期。无垃圾邮件。随时退订。