Gemini 3.6 Flash 评测:Agent 值得升级,别一刀切
Gemini 3.6 Flash 评测:每百万输出 token 降至 $7.50,Google 称输出量减少 17%。本文对比 3.5 Flash 与 Flash-Lite 的价格、基准测试、上下文窗口和迁移风险,并给出 Agent、编码及高吞吐任务的采用标准,帮你判断哪些工作负载应升级、哪些应保留在更便宜的模型上。

这篇 Gemini 3.6 Flash 评测的结论很明确:作为 Gemini 3 系列的 Flash 模型,它值得用于复杂 Agent 和编码循环,但不应成为所有 Gemini 工作负载的新默认选项。Google 将每百万输出 token 的价格从 $9.00 降至 $7.50,并称其输出 token 比 3.5 Flash 少 17%;不过,简单抽取任务仍应交给输出价仅 $2.50 的 Flash-Lite。

Gemini 3.6 Flash 评测结论:升级 Agent,而非全面替换
如果工作负载需要反复执行规划、调用工具、编写代码和验证,Gemini 3.6 Flash 应当取代 3.5 Flash。但对于已经达到质量要求的常规抽取、分类或结构化解析,没有必要放弃价格更低的 Flash-Lite。
根据 Google 当前的模型指南,该模型已使用稳定 ID gemini-3.6-flash 正式开放,默认思考等级为 medium。这意味着它已经是生产选项,而不是需要押注的预览版。Gemini 3.5 Pro 延期 曾带来的选择题也随之改变:既然更强的主力模型已经上线,就没有必要继续等待 Pro。
判断标准可以压缩成一句话:只有当 3.6 的重试率更低、输出用量更少,或人工审核后的任务通过率更高,足以胜过便宜模型时,才迁移该工作负载。 模型单价只是计价器,真正要付的是每个通过验收任务的成本。
Gemini 3 整体产品线 对消费级套餐和旗舰推理仍然重要。本文只回答一个更具体的问题:哪些 API 工作负载值得迁移到新的 Flash 模型。
变化在哪:减少循环,与降价同样重要
Gemini 3.6 Flash 同时降低了 Agent 内部会不断叠加的两项成本:每个输出 token 的单价,以及 Agent 执行任务时生成的 token 数量。
所谓 Agent 循环,就是规划、行动、检查和重试反复进行。客服 Agent 可能先查询订单,再调用退款工具、核对政策、起草回复,发现不一致后又调用另一个工具。每多一轮推理,就会增加 token、延迟,以及工具调用格式出错的机会。token 降价只省一次,循环缩短则会在每一步持续节省。
在 7 月 21 日的发布公告 中,Google 称 3.6 Flash 在 Artificial Analysis Index 上的输出 token 比 3.5 Flash 少 17%。Google 还表示,该模型处理多步骤任务时需要的推理步骤和工具调用更少。这是此次发布最有力的商业理由,因为它既可能降低单位价格,也可能减少实际用量。
质量提升也指向同一类用法:
这些结果由 Google 发布,因此它们只能作为评估的理由,不能证明你的工作流会获得同等幅度的提升。不过,结果分布依然有参考价值:增幅最大的项目是持续工程任务、机器学习工作、计算机操作和超长上下文。单轮分类器不会得到同样的收益。
模型的工作方式也发生了变化。Google 文档称,它会更早编写诊断脚本,减少不必要的代码修改,并减少执行循环。当一家中型企业的 CTO 让 Agent 跨多个服务追查故障时,这种行为很有价值;但当独立开发者只要求做一个小幅 CSS 修改时,模型先检查半个项目就可能造成浪费。
成本账:理想情况下,$330 降至 $274.50
在 token 用量完全相同时,Gemini 3.6 Flash 可节省 9.1%;如果 Google 所称的输出 token 减少 17% 也适用于实际工作负载,示例中的节省比例会达到 16.8%。
假设一个生产 Agent 每月使用 100M 输入 token 和 20M 输出 token:
- Gemini 3.5 Flash 输入:100M,单价为每百万 $1.50 = $150
- Gemini 3.5 Flash 输出:20M,单价为每百万 $9.00 = $180
- Gemini 3.5 Flash 合计:$330
如果 3.6 Flash 的 token 用量不变,输出成本会降至 $150,总成本为 $300。再把报告中的 17% 输出量降幅计入,Agent 的输出 token 将从 20M 降到 16.6M:
- Gemini 3.6 Flash 输入:$150
- Gemini 3.6 Flash 输出:16.6M,单价为每百万 $7.50 = $124.50
- Gemini 3.6 Flash 合计:$274.50
- 相比 3.5 Flash 每月节省:$55.50,即 16.8%
这不是预测。17% 来自单项评估,能否迁移到你的场景,取决于提示词、工具、重试机制和思考设置。但这个场景值得测试,因为它把确定的降价与依赖具体工作负载的效率提升拆开了。

Google 当前的 Gemini API 价格表 为 3.6 Flash 列出了四档用量价格。标准档为每百万 token $1.50 输入和 $7.50 输出;Batch 和 Flex 均降至 $0.75 和 $3.75;Priority 则提高到 $2.70 和 $13.50。在输出量尚未减少前,同样的 100M 输入、20M 输出工作负载按 Batch 或 Flex 标价计算为 $150。
上下文缓存可将重复提示词的输入价格降至每百万缓存 token $0.15,另收每百万 token 每小时 $1.00 的存储费。若每次 Agent 运行都要附带同一份手册、schema 或政策资料,这项能力会很有价值;如果提示词几乎每次都完全不同,它就帮不上忙。
搜索 grounding 另行计费:Gemini 3 每月共享 5,000 次免费提示,之后按每 1,000 次搜索查询 $14 收费。因此,研究型 Agent 的预算必须分成模型 token 和检索两部分。把有 grounding 的调用当成只有 token 成本,会低估账单。
基准测试支持升级,但不代表“新的全能第一”
Gemini 3.6 Flash 明显强于 3.5 Flash,但 Google 自己发布的 7 月模型卡表格 并不能证明它在每项高难度任务上都是最佳模型。
它的定位很清楚:3.6 Flash 是一次 Flash 升级,并在计算机操作方面具备可信优势;但它并不构成理由,让所有高难度任务都离开目前表现更好的前沿模型。 如果瓶颈是代码库规模的工程任务,而非高性价比的 Agent 吞吐量,应先比较当前的编码模型选择,再决定是否统一模型。
基准测试还会把生产环境中的复杂表现压缩成一个分数。即使总体完成率很高,只要剩余失败需要长链路追踪、重复调用工具或资深人员审核,成本仍可能很高。低 token 单价的模型如果重试次数明显更多,每个通过验收任务的成本反而可能更高。更实用的计分卡应跟踪:
- 无需人工修复即可通过验收的任务
- 每个通过验收任务的输出 token
- 工具调用成功率与格式错误率
- p50 和 p95 延迟
- 超时率与重试率
- 每项结果所需的审核时间
- 标准输出价格从每百万 token $9.00 降至 $7.50。
- Google 称,在 Artificial Analysis Index 上,输出 token 比 3.5 Flash 少 17%。
- 厂商公布的最大提升集中在长周期编码、机器学习工程、计算机操作和 1M 上下文检索。
- 稳定模型 ID 已正式开放,并提供 Batch、Flex 和 Priority 选项。
- 在 Google 自己的编码和知识工作对比中,多个前沿竞品仍然领先。
- Google 承认模型偶尔会变慢或超时。
- 对于视觉布局和样式,人工评估者更偏好早期模型。
- 此次迁移弃用了熟悉的采样控制项,并会拒绝预填充的模型轮次。
真正的生产瓶颈是行为,而非上下文长度
Gemini 3.6 Flash 的上下文容量和工具能力足以支撑严肃的 Agent。真正的限制在于:面对你的工具、延迟预算和审核标准时,它的行为能否始终保持可预测。
官方的 Gemini 3.6 Flash 模型页面 标明,输入上限为 1,048,576 token,输出上限为 65,536 token。它可接收文本、图像、视频、音频和 PDF,并输出文本;同时支持缓存、代码执行、文件搜索、函数调用、搜索与 Maps grounding、结构化输出、思考、URL 上下文,以及 Preview 阶段的计算机操作。
这样的能力范围很适合获得融资的创始人:其运营 Agent 可以阅读合同、查看仪表盘、调用内部工具,再起草异常报告。它也适合资深业务人员在同一案例中审阅混合格式的 PDF、图表和会议音频。
边界同样重要:
- 计算机操作仍处于 Preview。 对会改变客户、财务或生产状态的操作设置审批关卡。
- 不支持图像生成、音频生成和 Live API。 实时语音或媒体生成产品需要在技术栈中加入其他模型。
- 知识截止时间为 2026 年 3 月。 当最新事实会影响答案时,应使用搜索 grounding 或自有检索系统。
- 幻觉仍是已知限制。 长上下文代表容量,不代表真实可靠。
- 文档已注明偶发变慢和超时。 面向客户的工作流仍需重试、幂等机制和后备路径。
- 视觉样式可能退步。 Google 表示,即使 3.6 生成的代码功能更完善,人工评估者在布局和样式上仍更偏好早期模型。
最后一点很容易被忽略。独立技术开发者让模型制作精致落地页时,可能得到更清晰的逻辑,却看到更弱的视觉构图。应明确给出设计规则、检查截图,不要用编码基准测试代替设计审核。
如何在不破坏生产环境的前提下迁移
迁移到 Gemini 3.6 Flash 不能只替换模型 ID。Google 的迁移指南 涉及请求控制、轮次验证以及部分函数调用处理方式的变更。
明确的破坏性变更包括:
- 移除
temperature、top_p和top_k。它们已经弃用并会被忽略;Google 表示,未来模型代际收到这些字段时将返回 HTTP 400。 - 将
thinking_budget替换为thinking_level,并将后者设为medium或high。 - 移除 Gemini 3.x 不支持的
candidate_count。 - 移除预填充的模型轮次。请求若以非空的
model角色轮次结尾,将返回 HTTP 400。 - 将多轮状态统一到服务端
previous_interaction_id。 - 如果使用
generateContent,请加入call_id和name;每个FunctionResponse都必须包含这两项。
不要等实时流量已经切换后才发现这些改动。应把迁移作为一次受控的模型评估:
冻结一组验收样本
选取真实且已脱敏的任务,覆盖成功案例、常见失败、长工具链、多模态输入和对超时敏感的路径。记录 3.5 Flash 的结果、输出 token、延迟、重试、工具调用和审核时间。
清理请求契约
在修改模型 ID 前,移除已弃用的采样字段、预填充模型轮次、
thinking_budget和candidate_count,并更新多轮交互和函数响应的处理方式。让 3.6 与 3.5 并行影子运行
把同一批符合条件的输入同时发送给两个模型,但不允许 3.6 的结果改变外部状态。比较通过验收率和每个通过验收任务的成本,而不只是语言是否流畅。
从最安全的切片开始金丝雀测试
把一小部分可逆工作负载路由到
gemini-3.6-flash,监控 p95 延迟、超时、格式错误的工具调用、token 用量和人工接管情况,并保留 3.5 Flash 作为即时回滚方案。按任务类型逐步扩大
先迁移复杂编码和 Agent 循环。简单抽取继续留在 Flash-Lite,任何未通过质量关卡的任务则继续使用原模型。最终采用混合路由完全合理。

现在谁应该采用 Gemini 3.6 Flash
使用复杂 Flash 工作负载的团队应立即评估;为简单吞吐付费的团队则应继续使用 Flash-Lite。
当任务会因循环减少而受益时,就应采用。若工作流对延迟敏感、重视视觉样式、已在 Flash-Lite 上稳定运行,或者依赖 3.6 仍落后的基准任务,则应等待。
清晰的架构不是押注某个最喜欢的模型,而是建立路由:Flash-Lite 处理可预测的大批量任务,3.6 Flash 处理复杂 Agent 循环,再为价值足以覆盖高额账单的失败任务提供前沿模型升级路径。
常见问题
Gemini 3.6 Flash 价格是多少?
标准付费 API 的价格为每百万输入 token $1.50、每百万输出 token $7.50,思考 token 也计入输出。Batch 和 Flex 为 $0.75 输入、$3.75 输出;Priority 为 $2.70 输入、$13.50 输出。
Gemini 3.6 Flash 是推理模型吗?
是。Gemini 3.6 Flash 支持思考,默认思考等级为 medium。Google 建议使用 medium 或 high,以替代旧的 thinking_budget 控制项。
Gemini 3.6 Flash 的上下文窗口有多大?
文档标明的输入上限为 1,048,576 token,输出上限为 65,536 token。它可接收文本、图像、视频、音频和 PDF,并输出文本。
Gemini 3.6 Flash 比 Gemini 3.5 Flash 更好吗?
对于复杂 Flash 工作负载,是的。它的每个输出 token 成本更低;Google 称输出 token 少 17%,且发布的编码、机器学习工程、计算机操作和长上下文检索分数均更高。在你自己的金丝雀测试通过验收关卡前,仍应保留 3.5 Flash 作为回滚方案。
想获取面向企业主的 AI 工具全景图?订阅 newsletter 即可领取。
2026年9月3日







