Gemini 3 评测(2026):基准、价格,以及到底该选哪个模型
这篇 Gemini 3 评测拆解 3.1 Pro、3.5 Flash 与即将推出的 3.5 Pro:逐项对比基准成绩、个人订阅和 API 价格、长上下文、多模态与智能体能力,并说明普通用户、开发者和高难度推理任务分别该选哪一款,以及它是否值得替代 ChatGPT 或 Claude。

Google 的 Gemini 3 已经不再是单一模型,而这恰恰改变了评测它的方式。2025 年 11 月以“Gemini 3 Pro”之名亮相的产品,如今已经扩展成一整套模型:3.1 Pro 负责最棘手的推理,3.5 Flash 成为速度更快的新默认款,编程表现甚至超过旧旗舰,而 3.5 Pro 也将在几天内到来。真正值得回答的问题,不是“Gemini 3 好不好”,而是究竟该用哪一款,以及它是否值得让你离开 ChatGPT 或 Claude。
Gemini 3 到底值不值得用?先看结论
Gemini 3 已经是一条真正达到前沿水平的模型产品线。对大多数人来说,单是免费版就足以应付日常使用。问题在于,“Gemini 3”代表的是一整个家族,各成员差异很大,而系统默认分配给你的往往并不是最合适的那一款。
如果你本来就在 Google 生态中工作(Gmail、Docs、Search、Android),Gemini 3 是上手门槛最低的前沿 AI;按价格衡量,它也最慷慨:免费版确实能用,付费套餐低至 $4.99/month,比所有对手都便宜,API 的智能水平与价格之比也最突出。长上下文、多模态与视频理解,以及智能体搜索,都是它领先的领域。
它的短板也很明确:面对耗时长、容错率低的任务,输出一致性仍不够强;那种“可以直接相信模型判断”的可靠感,也正是许多人继续使用 Claude 的原因。此外,产品线更新太快,上个月测试过的版本如今可能已经不是现行模型。按任务选模型,不要只认品牌,才能真正发挥它的优势。
现在所说的“Gemini 3”究竟包括什么?
“Gemini 3”并不是一款模型,而是一代模型;其中四个版本已经发布或即将登场。先理清这一点,选择就完成了一大半,因为这些名称看起来相似,实际表现却完全不同。
这里的模型,可以简单理解为负责思考的引擎。“Pro”引擎规模更大、推理更深入;“Flash”引擎则更小、更快、价格也更低。到了 2026 年年中,产品线如下:
最反直觉的一点是:价格更低、速度更快的 3.5 Flash,如今在编程和智能体任务上已经超过旧旗舰 3 Pro;Google 还称,它在这些任务上足以媲美大型旗舰模型(Engadget)。因此,“严肃工作就该用贵的”这套直觉,对很多任务已经不成立。
这一代模型的共同特征包括:1 million token 的上下文窗口(即一次对话可读入的信息量,约相当于 1,500 页文本);可在一个 prompt 中原生处理文本、图片、视频、音频和 PDF;知识截止时间为 2025 年 1 月(模型卡)。

只需记住一件事:听到“Gemini 3”时,先问清楚具体是哪一款。答案不同,价格可以相差 4 倍,优势也会彻底改变。
Gemini 3 基准测试:这些成绩该怎么解读?
从 Google 公布的数据看,Gemini 3.1 Pro 在多个维度领先前沿模型,也有少数项目落后。相比横扫所有榜单,这种有赢有输的结果反而更可信,因为败绩恰好说明了竞争对手真正占优的地方。
所谓基准测试,就是让每款模型回答同样的问题,再按同一套标准评分,从而进行横向比较。以下是 model card 中 **Gemini 3.1 Pro(Thinking, High)**与当前 Claude、OpenAI 模型的正面对比(来源):
可以这样看:任务如果需要查找、浏览并分析大量持续变化的信息,Gemini 3.1 Pro 处于领先位置,有时优势相当明显——BrowseComp 为 85.9%,GPT-5.2 则是 65.8%,差距并不小。在专注的软件工程任务上,三者基本打平;而在引用最多的编程基准 SWE-Bench Verified 中,Claude Opus 4.6 略胜一筹。至于严格按规则调用工具,Opus 目前仍以微弱优势成为最可靠的一款。
旗舰模型的推理成绩也指向同一个结论。发布时,Gemini 3 Pro 以 1501 Elo 登顶 LMArena,在研究生级科学问题测试 GPQA Diamond 中取得 91.9%,并在不使用工具的情况下,于刻意设计得极其困难的专家考试 Humanity's Last Exam 中取得 37.5%;对这项考试而言,37.5% 已是很强的成绩(发布文章)。开启增强推理模式 Deep Think 后,Humanity's Last Exam 成绩升至 41.0%,专门用于抵抗记忆作答、强调全新问题解决能力的 ARC-AGI-2 更达到 45.1%。
Gemini 3 价格:订阅与 API 成本怎么算?
无论看订阅还是 API,Gemini 3 都是目前进入前沿 AI 成本最低的选择。这是它最鲜明的优势,却也很容易被忽略,因为最值得关注的套餐刚刚悄然改名。
先看个人用户,Google 当前定价如下(套餐页面):
对大多数人而言,真正关键的数字是 Google AI Plus 每月 $4.99。ChatGPT Plus 和 Claude Pro 的标准套餐都在每月 $20 左右,因此 Gemini 的中档套餐价格约为它们的四分之一。如果你在其他地方看到“$7.99”,那已经是过期信息;Google 官方页面当前标价为 $4.99。
对开发者来说,API 的价格优势更加突出(定价,每 1M token):
- Gemini 3.1 Pro:prompt 低于 200k token 时,输入 $2.00 / 输出 $12.00;超过后升至 $4.00 / $18.00。
- Gemini 3.5 Flash:输入 $1.50 / 输出 $9.00;别忘了,它在编程和智能体任务上已经胜过旧 Pro。
- 接入 Google Search:Gemini 3 全系列每月共享 5,000 次免费 prompt,之后每 1,000 次查询收费 $14。
用一个具体场景来算。假设你正在开发客服智能体,每月处理 100,000 次对话,每次平均输入 4k token、输出 1k token。使用 3.5 Flash,合计约为 400M 输入 token 和 100M 输出 token,按标价计算就是 $600 + $900 = $1,500/month。同一负载如果改用输出价格高一倍的前沿模型,账单会超过 $2,500。到了 100k 次对话的规模,差额足以支付一名员工。**这笔账,而不是基准图表,才是团队把高流量业务迁往 Gemini 的真正原因。**同档模型的基准差距只有几个百分点,账单差距却可达 40% 甚至更多。
Gemini 3 的真正优势与短板
看重能力覆盖面、触达范围与价格时,选 Gemini 3;如果你需要的是一款无需反复核查其判断的模型,就不该选它。
- 智能水平与价格之比居市场首位。 免费版真正可用,付费套餐只要 $4.99,API 也是三者中最便宜的前沿方案。
- 长上下文与多模态能力。 1M token,并能在同一个 prompt 中原生处理视频、音频、图片和 PDF;两个竞争对手都没有做到同样顺畅。
- 智能体搜索与研究。 BrowseComp 成绩领先,又已进入 Google Search 的 AI Mode,联网推理本就是它的主场。
- 分发范围广。 Gmail、Docs、Android、Search 已经内置,Cursor、GitHub、JetBrains、Replit 等第三方工具也已接入。只要本来就在用 Google,采用成本几乎为零。
短板同样不应回避。最常出现的抱怨是一致性:同类 prompt 相隔一小时,第一次可能表现惊艳,下一次却异常平庸,这也正是论坛评测者提到的问题。合同、医疗或法律文书、财务分析等出错成本高的工作中,许多团队仍更信任 Claude 的稳定性;τ2-bench 工具调用和 SWE-Bench Verified 的成绩,也在小幅度上印证了这种判断。产品线的更迭同样频繁:为 3 Pro 调好的工作流,现在更适合 3.5 Flash,而 3.5 Pro 又会带来一次重置。能力快速提升当然是好事,稳定性却要为此付出代价。
如果想深入比较日常助手体验,可阅读 Gemini 与 ChatGPT 对比详解;[三方 Claude vs ChatGPT vs Gemini 对比](/blog/claude-vs-chatgpt-vs-gemini) 则把三款产品放在同一框架中逐项比较。
Gemini 3 各版本怎么选?
选择应取决于任务,而不是价格标签,因为更便宜的版本往往比直觉中更能打。
一句话决策:**任务重点是规模、覆盖面、搜索或预算,Gemini 更合适;如果是无法承受复核成本的高风险判断,价格差距就不再重要,可靠性才是决定因素。**如果主要工作是写代码,在统一采用某一款模型前,还应把它与专门的编程智能体放在一起权衡。
Gemini 3 怎么开始使用?
开始使用 Gemini 3 大约只需两分钟,而且几乎所有重要功能都可以先在免费版中体验。
先从免费版开始
打开 Gemini 应用或 gemini.google.com,使用 Google 账号登录,即可免费使用 Gemini 3 Flash。先让它处理一周的真实工作,再考虑是否付费。
遇到限额再升级
如果触及每日限额,或需要更深入的 Workspace 集成,Google AI Plus 的 $4.99/month 套餐对几乎所有人都最合适。$19.99 的 Pro 面向使用量和存储需求更高的用户。
开发应用先获取 API key
前往 Google AI Studio 创建 key,优先调用 3.5 Flash。只有当 prompt 确实需要最深入的推理或最大上下文时,再切换至 3.1 Pro,因为后者价格高出数倍。
谨慎使用 Deep Think
Deep Think 需要 Google AI Ultra。它只适合真正困难且新颖的问题,日常聊天用不上。大多数人始终都不需要它。
Gemini 3 免费吗?
免费。Gemini 应用提供有每日限额的 Gemini 3 Flash,足够应付大多数日常需求。付费套餐从每月 $4.99 的 Google AI Plus 起步,Deep Think 则需要 $99.99 的 Ultra 套餐。
Gemini 3 多少钱?
个人用户:免费;之后依次为 AI Plus $4.99/mo、AI Pro $19.99/mo、AI Ultra $99.99 和 $199.99/mo。API:Gemini 3.5 Flash 每百万 token 输入 $1.50 / 输出 $9;3.1 Pro 根据 prompt 长度不同,输入 $2 至 $4 / 输出 $12 至 $18。
Gemini 3 比 ChatGPT 或 Claude 更好吗?
根据 Google 公布的基准,它在智能体搜索、长上下文和竞技编程上领先;在 SWE-Bench Verified 和工具调用上,则以微弱差距落后于 Claude Opus 4.6。三者之中它的性价比最高,而高风险工作更适合选择稳定性更强的 Claude。
Gemini 3 Deep Think 是什么?
这是一种为高难度问题投入更多算力的增强推理模式,在 ARC-AGI-2 等测试中取得顶尖成绩(45.1%)。它仅向 Google AI Ultra 套餐开放,用于日常任务则显得大材小用。
Gemini 3 Flash 和 Pro 应该选哪个?
日常聊天、追求速度与成本,以及智能体循环,应选 3.5 Flash;它在编程上已经超过旧 Pro。需要最深入的推理或最长的上下文,并且能够接受更高价格时,再选 3.1 Pro。
想每周看到这种紧跟变化、不炒作的工具分析,了解真实价格与坦诚取舍?订阅邮件通讯。
2026年9月4日







