Gemini 3 评测(2026):基准、价格,以及到底该选哪个模型

这篇 Gemini 3 评测拆解 3.1 Pro、3.5 Flash 与即将推出的 3.5 Pro:逐项对比基准成绩、个人订阅和 API 价格、长上下文、多模态与智能体能力,并说明普通用户、开发者和高难度推理任务分别该选哪一款,以及它是否值得替代 ChatGPT 或 Claude。

Friday, September 4, 2026Omid Saffari
Gemini 3 评测(2026):基准、价格,以及到底该选哪个模型

Google 的 Gemini 3 已经不再是单一模型,而这恰恰改变了评测它的方式。2025 年 11 月以“Gemini 3 Pro”之名亮相的产品,如今已经扩展成一整套模型:3.1 Pro 负责最棘手的推理,3.5 Flash 成为速度更快的新默认款,编程表现甚至超过旧旗舰,而 3.5 Pro 也将在几天内到来。真正值得回答的问题,不是“Gemini 3 好不好”,而是究竟该用哪一款,以及它是否值得让你离开 ChatGPT 或 Claude。

Gemini 3 到底值不值得用?先看结论

Gemini 3 已经是一条真正达到前沿水平的模型产品线。对大多数人来说,单是免费版就足以应付日常使用。问题在于,“Gemini 3”代表的是一整个家族,各成员差异很大,而系统默认分配给你的往往并不是最合适的那一款。

如果你本来就在 Google 生态中工作(Gmail、Docs、Search、Android),Gemini 3 是上手门槛最低的前沿 AI;按价格衡量,它也最慷慨:免费版确实能用,付费套餐低至 $4.99/month,比所有对手都便宜,API 的智能水平与价格之比也最突出。长上下文、多模态与视频理解,以及智能体搜索,都是它领先的领域。

它的短板也很明确:面对耗时长、容错率低的任务,输出一致性仍不够强;那种“可以直接相信模型判断”的可靠感,也正是许多人继续使用 Claude 的原因。此外,产品线更新太快,上个月测试过的版本如今可能已经不是现行模型。按任务选模型,不要只认品牌,才能真正发挥它的优势。

现在所说的“Gemini 3”究竟包括什么?

Gemini 3”并不是一款模型,而是一代模型;其中四个版本已经发布或即将登场。先理清这一点,选择就完成了一大半,因为这些名称看起来相似,实际表现却完全不同。

这里的模型,可以简单理解为负责思考的引擎。“Pro”引擎规模更大、推理更深入;“Flash”引擎则更小、更快、价格也更低。到了 2026 年年中,产品线如下:

模型定位状态适合用途
Gemini 3 Pro2025 年 11 月发布的初代旗舰已被取代不建议用于新项目,改用 3.1
Gemini 3.1 Pro当前推理旗舰已上线(预览版)最难的推理、最长的上下文
Gemini 3.5 FlashI/O 2026 发布的高速默认款已上线日常对话、编程、智能体循环
Gemini 3.5 Pro下一代旗舰,约 2M 上下文即将推出(预计很快正式发布)将取代 3.1 Pro 处理深度任务

最反直觉的一点是:价格更低、速度更快的 3.5 Flash,如今在编程和智能体任务上已经超过旧旗舰 3 Pro;Google 还称,它在这些任务上足以媲美大型旗舰模型(Engadget)。因此,“严肃工作就该用贵的”这套直觉,对很多任务已经不成立。

这一代模型的共同特征包括:1 million token 的上下文窗口(即一次对话可读入的信息量,约相当于 1,500 页文本);可在一个 prompt 中原生处理文本、图片、视频、音频和 PDF;知识截止时间为 2025 年 1 月模型卡)。

Gemini 应用界面
Gemini

只需记住一件事:听到“Gemini 3”时,先问清楚具体是哪一款。答案不同,价格可以相差 4 倍,优势也会彻底改变。

Gemini 3 基准测试:这些成绩该怎么解读?

从 Google 公布的数据看,Gemini 3.1 Pro 在多个维度领先前沿模型,也有少数项目落后。相比横扫所有榜单,这种有赢有输的结果反而更可信,因为败绩恰好说明了竞争对手真正占优的地方。

所谓基准测试,就是让每款模型回答同样的问题,再按同一套标准评分,从而进行横向比较。以下是 model card 中 **Gemini 3.1 Pro(Thinking, High)**与当前 Claude、OpenAI 模型的正面对比(来源):

基准测试(衡量内容)Gemini 3.1 ProClaude Opus 4.6GPT-5.2
BrowseComp(智能体网页搜索)85.9%84.0%65.8%
LiveCodeBench Pro(竞技编程,Elo)2887n/a2393
APEX-Agents(长周期专业任务)33.5%29.8%23.0%
Terminal-Bench 2.0(通过终端操作电脑)68.5%65.4%54.0%
SciCode(科研编程)59%52%52%
SWE-Bench Verified(真实编程智能体)80.6%80.8%80.0%
τ2-bench retail(工具调用)90.8%91.9%82.0%
MRCR v2, 128k(长上下文召回)84.9%84.0%83.8%

可以这样看:任务如果需要查找、浏览并分析大量持续变化的信息,Gemini 3.1 Pro 处于领先位置,有时优势相当明显——BrowseComp 为 85.9%,GPT-5.2 则是 65.8%,差距并不小。在专注的软件工程任务上,三者基本打平;而在引用最多的编程基准 SWE-Bench Verified 中,Claude Opus 4.6 略胜一筹。至于严格按规则调用工具,Opus 目前仍以微弱优势成为最可靠的一款。

旗舰模型的推理成绩也指向同一个结论。发布时,Gemini 3 Pro 以 1501 Elo 登顶 LMArena,在研究生级科学问题测试 GPQA Diamond 中取得 91.9%,并在不使用工具的情况下,于刻意设计得极其困难的专家考试 Humanity's Last Exam 中取得 37.5%;对这项考试而言,37.5% 已是很强的成绩(发布文章)。开启增强推理模式 Deep Think 后,Humanity's Last Exam 成绩升至 41.0%,专门用于抵抗记忆作答、强调全新问题解决能力的 ARC-AGI-2 更达到 45.1%

Gemini 3 价格:订阅与 API 成本怎么算?

无论看订阅还是 API,Gemini 3 都是目前进入前沿 AI 成本最低的选择。这是它最鲜明的优势,却也很容易被忽略,因为最值得关注的套餐刚刚悄然改名。

先看个人用户,Google 当前定价如下(套餐页面):

套餐价格包含内容
Free$0Gemini 应用与 Gemini 3 Flash,有每日限额
Google AI Plus$4.99/mo更高使用额度、400 GB 存储空间(原名“AI Premium”)
Google AI Pro$19.99/mo5 TB 存储空间、$10/mo Cloud 抵扣金、更高限额
Google AI Ultra$99.99/moDeep Think、Gemini Agent、20 TB、$40/mo 抵扣金
Google AI Ultra 20x$199.99/mo最高限额、30 TB、$100/mo 抵扣金

对大多数人而言,真正关键的数字是 Google AI Plus 每月 $4.99。ChatGPT Plus 和 Claude Pro 的标准套餐都在每月 $20 左右,因此 Gemini 的中档套餐价格约为它们的四分之一。如果你在其他地方看到“$7.99”,那已经是过期信息;Google 官方页面当前标价为 $4.99。

对开发者来说,API 的价格优势更加突出(定价,每 1M token):

  • Gemini 3.1 Pro:prompt 低于 200k token 时,输入 $2.00 / 输出 $12.00;超过后升至 $4.00 / $18.00。
  • Gemini 3.5 Flash:输入 $1.50 / 输出 $9.00;别忘了,它在编程和智能体任务上已经胜过旧 Pro。
  • 接入 Google Search:Gemini 3 全系列每月共享 5,000 次免费 prompt,之后每 1,000 次查询收费 $14。

用一个具体场景来算。假设你正在开发客服智能体,每月处理 100,000 次对话,每次平均输入 4k token、输出 1k token。使用 3.5 Flash,合计约为 400M 输入 token 和 100M 输出 token,按标价计算就是 $600 + $900 = $1,500/month。同一负载如果改用输出价格高一倍的前沿模型,账单会超过 $2,500。到了 100k 次对话的规模,差额足以支付一名员工。**这笔账,而不是基准图表,才是团队把高流量业务迁往 Gemini 的真正原因。**同档模型的基准差距只有几个百分点,账单差距却可达 40% 甚至更多。

Gemini 3 的真正优势与短板

看重能力覆盖面、触达范围与价格时,选 Gemini 3;如果你需要的是一款无需反复核查其判断的模型,就不该选它。

优势
做得好的地方
4 points

  • 智能水平与价格之比居市场首位。 免费版真正可用,付费套餐只要 $4.99,API 也是三者中最便宜的前沿方案。
  • 长上下文与多模态能力。 1M token,并能在同一个 prompt 中原生处理视频、音频、图片和 PDF;两个竞争对手都没有做到同样顺畅。
  • 智能体搜索与研究。 BrowseComp 成绩领先,又已进入 Google Search 的 AI Mode,联网推理本就是它的主场。
  • 分发范围广。 Gmail、Docs、Android、Search 已经内置,Cursor、GitHub、JetBrains、Replit 等第三方工具也已接入。只要本来就在用 Google,采用成本几乎为零。

短板同样不应回避。最常出现的抱怨是一致性:同类 prompt 相隔一小时,第一次可能表现惊艳,下一次却异常平庸,这也正是论坛评测者提到的问题。合同、医疗或法律文书、财务分析等出错成本高的工作中,许多团队仍更信任 Claude 的稳定性;τ2-bench 工具调用和 SWE-Bench Verified 的成绩,也在小幅度上印证了这种判断。产品线的更迭同样频繁:为 3 Pro 调好的工作流,现在更适合 3.5 Flash,而 3.5 Pro 又会带来一次重置。能力快速提升当然是好事,稳定性却要为此付出代价。

如果想深入比较日常助手体验,可阅读 Gemini 与 ChatGPT 对比详解;[三方 Claude vs ChatGPT vs Gemini 对比](/blog/claude-vs-chatgpt-vs-gemini) 则把三款产品放在同一框架中逐项比较。

Gemini 3 各版本怎么选?

选择应取决于任务,而不是价格标签,因为更便宜的版本往往比直觉中更能打。

你的需求推荐选择原因
免费聊天 / 日常使用免费版(3 Flash)前沿级回答、无需付费、限额宽松
Google 生态中的重度用户AI Plus,$4.99订阅性价比最高,并集成 Workspace
开发高流量功能3.5 Flash API编程胜过旧 Pro,输出成本约低 40%
需要实时网页的智能体开发者3.1 Pro + groundingBrowseComp 领先,长上下文可容纳工具调用历史
处理最难推理任务Ultra + Deep Think在高难度考试中取得顶尖成绩
最重视可靠性考虑改用 Claude面对耗时长、风险高的判断更稳定

一句话决策:**任务重点是规模、覆盖面、搜索或预算,Gemini 更合适;如果是无法承受复核成本的高风险判断,价格差距就不再重要,可靠性才是决定因素。**如果主要工作是写代码,在统一采用某一款模型前,还应把它与专门的编程智能体放在一起权衡。

Gemini 3 怎么开始使用?

开始使用 Gemini 3 大约只需两分钟,而且几乎所有重要功能都可以先在免费版中体验。

  1. 先从免费版开始

    打开 Gemini 应用或 gemini.google.com,使用 Google 账号登录,即可免费使用 Gemini 3 Flash。先让它处理一周的真实工作,再考虑是否付费。

  2. 遇到限额再升级

    如果触及每日限额,或需要更深入的 Workspace 集成,Google AI Plus 的 $4.99/month 套餐对几乎所有人都最合适。$19.99 的 Pro 面向使用量和存储需求更高的用户。

  3. 开发应用先获取 API key

    前往 Google AI Studio 创建 key,优先调用 3.5 Flash。只有当 prompt 确实需要最深入的推理或最大上下文时,再切换至 3.1 Pro,因为后者价格高出数倍。

  4. 谨慎使用 Deep Think

    Deep Think 需要 Google AI Ultra。它只适合真正困难且新颖的问题,日常聊天用不上。大多数人始终都不需要它。

Gemini 3 免费吗?

免费。Gemini 应用提供有每日限额的 Gemini 3 Flash,足够应付大多数日常需求。付费套餐从每月 $4.99 的 Google AI Plus 起步,Deep Think 则需要 $99.99 的 Ultra 套餐。

Gemini 3 多少钱?

个人用户:免费;之后依次为 AI Plus $4.99/mo、AI Pro $19.99/mo、AI Ultra $99.99 和 $199.99/mo。API:Gemini 3.5 Flash 每百万 token 输入 $1.50 / 输出 $9;3.1 Pro 根据 prompt 长度不同,输入 $2 至 $4 / 输出 $12 至 $18。

Gemini 3 比 ChatGPT 或 Claude 更好吗?

根据 Google 公布的基准,它在智能体搜索、长上下文和竞技编程上领先;在 SWE-Bench Verified 和工具调用上,则以微弱差距落后于 Claude Opus 4.6。三者之中它的性价比最高,而高风险工作更适合选择稳定性更强的 Claude。

Gemini 3 Deep Think 是什么?

这是一种为高难度问题投入更多算力的增强推理模式,在 ARC-AGI-2 等测试中取得顶尖成绩(45.1%)。它仅向 Google AI Ultra 套餐开放,用于日常任务则显得大材小用。

Gemini 3 Flash 和 Pro 应该选哪个?

日常聊天、追求速度与成本,以及智能体循环,应选 3.5 Flash;它在编程上已经超过旧 Pro。需要最深入的推理或最长的上下文,并且能够接受更高价格时,再选 3.1 Pro。

想每周看到这种紧跟变化、不炒作的工具分析,了解真实价格与坦诚取舍?订阅邮件通讯

最近更新
2026年9月4日
分类
AI

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

Claude Opus 5.5 对比 Opus 5:价格、编程与 API 迁移指南

Claude Opus 5.5 对比 Opus 5:价格、编程与 API 迁移指南

Claude Opus 5.5 对比 Opus 5:逐项拆解价格、缓存、编程证据与 API 兼容性,说明 thinking、强制工具选择、computer 工具及进度流的五项迁移风险,并给出何时升级、何时保留旧模型的可执行判断框架。同时用固定 token 算例核对真实账单,帮助团队按每个合格结果的成本做选择。2026年9月23日AI
GPT-6 Sol 对比 Luna:先用 Luna,难题再上 Sol

GPT-6 Sol 对比 Luna:先用 Luna,难题再上 Sol

GPT-6 Sol 对比 Luna:完整拆解两者20×的 token 价差、共同的上下文窗口与工具能力,以及 OpenAI 公布的编程成绩;同时给出从 Luna 起步、何时升级到 Sol 的可验证决策规则,帮助技术团队结合任务难度、验收率、复核时间与失败成本,选出总成本更低、真正适合生产环境的模型。2026年9月23日AI
GPT-6 Luna 免费吗?桌面端、Codex 与 API 费用全解析

GPT-6 Luna 免费吗?桌面端、Codex 与 API 费用全解析

GPT-6 Luna 免费吗?本文拆清 Free 与 Go 桌面端免费权限、普通 Chat 与 Codex 的开放范围、API 每百万 token 的实际价格,以及 OpenAI 尚未公布的使用限额,帮助开发者和团队判断该试用、升级套餐还是单独开通 API 计费,避免把免费试用误当成不限量权益。2026年9月22日AI
MiMo V2.6 教程:从 Studio 验证到 API 上线

MiMo V2.6 教程:从 Studio 验证到 API 上线

MiMo V2.6 教程:从 AI Studio 验证任务,到选择按量付费或 Token Plan 密钥、配置 OpenAI 兼容 API,再到比较 Flash、Pro 与 UltraSpeed。附 Python 请求、价格测算、七个业务工作流和按顺序排错的方法,帮助团队在接入真实数据前完成安全评估。2026年9月22日AI
MiMo V2.6 Pro 对比 Flash:价格、性能与部署选择

MiMo V2.6 Pro 对比 Flash:价格、性能与部署选择

MiMo V2.6 Pro 对比 Flash 怎么选?本文对照实时 API 价格、编程与智能体基准、缓存成本和 UltraSpeed,并给出三任务验收框架,帮助创业者、CTO 和技术负责人按单次验收通过成本决定何时用 Flash、何时升级 Pro,避免为缺乏实测价值的质量与速度溢价买单。2026年9月22日AI
MiMo V2.6 免费吗?限免入口、API 价格与 MIT 权重详解

MiMo V2.6 免费吗?限免入口、API 价格与 MIT 权重详解

MiMo V2.6 免费吗?本文拆解 OpenCode 一周限免、Xiaomi API 的 Flash、Pro 与 UltraSpeed 价格、标注 MIT 的模型权重实际成本和免费通道的数据使用风险,并用标准化工作负载算清不同方案的付费差距,帮助开发者判断何时试用、何时转向付费 API,以及自托管是否值得。2026年9月22日AI
Grok 4.7 对比 Grok 4.6:谁更强,是否值得升级?

Grok 4.7 对比 Grok 4.6:谁更强,是否值得升级?

Grok 4.7 对比 Grok 4.6:两者标准 API 价格相同,真正差别在复杂编程、知识工作和迁移风险。本文拆解 xAI 基准、上下文窗口、推理档位与长上下文成本,并给出三项任务的同条件测试方法,帮助团队判断哪些工作负载值得升级、哪些应继续留在稳定的 Grok 4.6 流程,避免只看发布分数做决定。2026年9月21日AI
AI Agent 如何钻规则空子:一场生产事故的完整复盘

AI Agent 如何钻规则空子:一场生产事故的完整复盘

一个自动化编辑系统通过了全部检查,却在 8 天内把 50 篇文章带向几乎无人需要的手工图样软件。本文基于发布台账、研究账单和 Google Search Console 记录,复盘 AI Agent 如何把代理指标误当目标,并拆解无产出许可、范围围栏、主题上限与人工审批如何阻止系统持续跑偏。2026年9月21日AI
订阅通讯

每周日,一封信。写运转中的系统,不写热评。

每周一期。无垃圾邮件。随时退订。