Gemini TTS 价格全解:3.8 Flash 每分钟成本与选型指南
Gemini 3.8 Flash TTS 标准层当前每分钟生成音频成本为 $0.0135,Flash-Lite 为 $0.009。本文拆解 Standard、Batch、Flex 与 Priority 的价格,换算每小时和批量成本,并说明免费层、缓存费用及 2027年1月1日翻倍后的预算影响,帮助团队选对模型与服务层。

Gemini 3.8 Flash TTS 标准服务层的 Gemini TTS 价格为每生成 1 分钟 $0.0135,Flash-Lite 则为 每分钟 $0.009。这是截至 2026年12月31日、仅计算输出的费率;Google 计划从 2027年1月1日起将价格翻倍,因此现在制定生产预算时就应同时纳入两组数字。
Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 于 2026年9月23日发布。我在 2026年9月24日逐项核对了 Google 实时更新的 Gemini Developer API 价格页,再按 Google 公布的每秒 25 个音频 token,换算出每分钟和每小时的生成成本。

Gemini TTS 价格速览:3.8 Flash 与 Flash-Lite
截至 2026年12月31日,成本最低的是 Flash-Lite 的 Batch 或 Flex:每生成 1 分钟 $0.0045。需要交互式生产流程时,更稳妥的默认选择是 Flash-Lite Standard,价格为 每分钟 $0.009。只有当保真度、复杂发音、方言覆盖或表演指导确实值得额外投入时,才有必要升级到完整版 Flash。
表中所有时长成本均为计算值,并非实测账单,而且只覆盖生成音频的输出费用。最终账单还可能包含文本输入 token、缓存读取和缓存存储。
Gemini 3.8 TTS 每分钟、每小时要花多少钱?
看清计费单位后,时长换算并不复杂:Google 按 每秒 25 个音频 token 计费,因此生成 1 分钟音频需要 1,500 个音频 token,生成 1 小时需要 90,000 个。
截至 12月31日,Flash Standard 的计算如下:
- 1 分钟:1,500 除以 1,000,000,再乘以 $9.00 = $0.0135。
- 1 小时:90,000 除以 1,000,000,再乘以 $9.00 = $0.81。
- 生成 1,000 小时:$0.81 乘以 1,000 = $810。
Flash-Lite Standard 只需把 $9.00 的音频费率替换为 $6.00,结果就是 每分钟 $0.009、每小时 $0.54,以及 每 1,000 小时 $540。从 2027年1月1日起,相同工作量将变为每分钟 $0.018、每小时 $1.08、每 1,000 小时 $1,080。

下面这套计算表可以直接复用:
- **音频输出:**生成秒数乘以 25,除以 1,000,000,再乘以音频输出费率。
- **文本输入:**请求返回的实际输入 token 数除以 1,000,000,再乘以文本输入费率。
- **缓存读取:**实际缓存输入 token 数除以 1,000,000,再乘以缓存读取费率。
- **缓存存储:**缓存 token 数乘以存储小时数,除以 1,000,000,再乘以存储费率。
不要根据音频时长估算文本 token,应记录 API 实际返回的输入量。假设计费记录中恰好有 1,000,000 个文本输入 token,同时在 Standard 上生成了 100 小时音频,那么 Flash 当前总成本为 $81.50,即 $81 音频费加 $0.50 文本费;Flash-Lite 为 $54.50。从 1月1日起,两者分别变为 $163 和 $109。
之所以要分开计算,是因为短脚本也可能生成节奏缓慢、停顿很多的表演,而信息密集的脚本也可能被快速念完。Google 会分别计量脚本和最终生成的音频。
Gemini Flash-Lite TTS 价格:什么情况下更划算?
如果声音只是生产流程中的一个组成部分,而不是作品的核心表演,Flash-Lite 通常更划算。Google 的 TTS 模型指南将其定位于大批量生产、朗读功能、语音智能体级联、语音复刻和日常单人语音。它支持 101 种语言,并与完整版 Flash 使用相同的 API 结构。
完整版 Flash 属于创意制作档。Google 将其定位在最高保真度、细腻表演、复杂发音、地区方言、复杂多人对话,以及覆盖 130 种语言的稳定长篇旁白。截至 12月31日,其 Standard 输出每生成 1 小时比 Lite 贵 $0.27;从 1月1日起,差额升至 $0.54。
判断标准应是能否听出问题,而不是型号高低。先用同一份已批准脚本和声音指导测试 Lite。如果发音、方言、角色表现或长场景达不到制作标准,再修改模型参数,只用 Flash 重跑对应片段。两款模型共用同一套提示结构,因此无需维护两套生产系统。
- 原始音频生成成本足够低,可以整章、整门课程或整批本地化内容进行试音。
- Flash 与 Flash-Lite 共用 API 结构,便于只对必要片段升级。
- 两款模型都支持 Standard、Batch、Flex 和 Priority 消费选项。
- 费率表把文本、音频、缓存读取和存储拆开计费,而不是隐藏在点数里。
- Google 公共页面没有公布固定的 TTS 专属免费额度。
- 所有列出的付费 TTS 费率都计划于 2027年1月1日翻倍。
- Flex 可被系统舍弃,容量紧张时可能失败。
- token 成本不含成品音频所需的人工审听、编辑、母带处理和权利审核。
Standard、Batch、Flex 和 Priority 怎么选?
应按截止时间和容错能力选择服务层。服务层改变的是同一模型请求的调度和计费方式。
**Standard 是日常生产的默认选择。**它采用同步处理,通常在数秒至数分钟内返回,按完整费率收费。编辑试音、设计师反复调整声音指导,或应用需要在用户仍在线时响应,都适合用它。
**Batch 是适合隔夜队列、成本最低且可靠的方案。**它的价格是 Standard 的一半,采用异步处理,目标周转时间最长为 24 小时。出版社制作已完稿的有声书,或学习平台重新生成整套内容目录,都应优先考虑 Batch。
**Flex 与 Batch 同价,但仍采用同步处理。**Google 的目标时长为 1 至 15 分钟,使用尽力而为、可舍弃的容量。请求可能收到容量错误,而且 Google 不会自动将其升级为 Standard。Flex 适合下一步必须等待当前响应、但可以稍后重试的后台流程。
**Priority 适用于语音响应一旦延迟就会损害产品体验的场景。**它通过更高关键级别的容量处理同步流量。超过 Priority 限额后,Google 可能将请求降级到 Standard,并按 Standard 费率计费。按当前 TTS 价格,Priority 是 Standard 的 1.8 倍:Flash-Lite 每输出小时从 $0.54 升至 $0.972,Flash 则从 $0.81 升至 $1.458。

文本输入、音频输出与缓存存储分别计费
音频费用通常占 TTS 账单的大头,但语音生成账单不只有这一项。
Gemini TTS API 成本由四部分组成
文本输入就是脚本。两款模型的 Standard 输入费率相同:截至 12月31日,每 100 万个 token 为 $0.50,之后为 $1.00。Batch 和 Flex 的费率减半,Priority 当前提高到 $0.90,并从 1月1日起升至 $1.80。
音频输出是生成的语音表演,也是 Flash 与 Flash-Lite 价格拉开差距的部分:当前 Standard 每 100 万个音频 token 分别为 $9 和 $6,之后分别为 $18 和 $12。
缓存读取会在复用缓存输入时收费。当前每 100 万个缓存 token,Standard 为 $0.125、Batch 为 $0.0625、Flex 为 $0.025、Priority 为 $0.225;各项价格都将在 1月翻倍。
缓存存储按时间计费。截至 12月31日,所有服务层每 100 万个缓存 token-hour 均为 $0.50;从 1月1日起为 $1.00。因此,把 8,000 个 token 缓存 24 小时,目前成本为 $0.096;用 Standard 读取一次该缓存块,再增加 $0.001。到 1月时,这两项金额将分别变为 $0.192 和 $0.002。
当大段指令或发音上下文会反复使用时,缓存才有价值。对于简短且只用一次的脚本,缓存未必更经济。不要看到较低的读取费率就默认省钱,应先计算存储时长和预计命中次数。
这张费率表没有 TTS 月付或年付订阅。付费 API 按量计费,因此不存在年付折扣,也没有每月内含额度可供超用。锁定风险在别处:未使用的 Gemini API 预付费余额会在一年后到期,并且通常不予退款。
Gemini TTS 免费层:Google 到底承诺了什么?
Google 在两款 Gemini 3.8 TTS 模型的免费层一栏中,将文本输入、音频输出和上下文缓存都标为免费。但价格页并未公布 TTS 专属 token 额度,也没有保证可免费生成多少分钟音频。
因此,免费层适合试音、检查提示结构和制作小型原型,却不能作为产品上线的容量方案。Google 表示,实际生效的限额取决于项目的使用层级,可在 AI Studio 内查看,会随账号状态更新,而且没有保证。应直接检查项目,不要从博客文章照搬配额。
是否付费也会改变隐私条件。Google 的价格页写明,免费层内容可能被用于改进其产品,而根据所链接的条款,付费层内容不会用于这一目的。客户声音、未发布脚本或敏感培训材料在进入工具前,就应把这一点纳入决策。
哪些人可以一直不付费?如果设计师只是试听少量声音,而且始终没有超出项目当前限额,就可能继续免费。只要需要承诺交付量、吞吐能力或处理保密生产内容,就应为付费层编列预算,不能把未明确的免费额度当成基础设施。
同一份声音需求:调价前后分别要花多少?
以 100 小时的单人旁白培训资料为例,最容易看清两款模型的差异。截至 12月31日,Standard 的纯输出小计为:Flash-Lite $54,Flash $81。从 1月1日起,将分别变为 $108 和 $162。文本输入、缓存以及所有重新生成的片段都要另计。
第一轮应使用 Flash-Lite,因为大多数常规旁白并不需要每一句都调用旗舰模型。修改阶段只升级没有通过明确制作检查的内容,例如地区名称发音错误、情绪场景显得平淡、多人对话缺少区分,或长篇音频的声音和房间音色发生漂移。
锁定一份有代表性的需求
选择一段包含实际制作难点的脚本:名称、数字、停顿、情绪转折,以及在需要时加入多位说话者。不同模型必须使用完全相同的文本。
用正确方式指导表演
Gemini 3.8 TTS 会把脚本文本当作需要念出的内容。持续性的指导应写入结构化语音元数据,只把行内标签用于特定时点的声音事件,避免模型误把指令念出来。
先试听 Flash-Lite
生成一份可控的试样,然后保存接口返回的输入 token 用量和实际音频时长。本文没有生成样音,因此文中的时长数据仍是只计算输出的成本,而不是实测账单。
只升级未通过的片段
保留合格的 Lite 输出。对于发音、方言、表演、说话者区分或长篇一致性不达标的段落,将模型参数切换到 Flash。
选择任务队列
有人实时指导时用 Standard;已批准的积压任务发往 Batch;只有配好重试机制时才选 Flex;只有等待会破坏用户体验时才购买 Priority。
别把 TTS 与 Gemini Live 或纯文本 Flash 混为一谈
Gemini 3.8 Flash TTS 接收文本并返回音频表演。通用 gemini-3.8-flash 是另一个端点,使用不同的费率表,因此不能拿文本模型常见的输入、输出价格来估算 TTS。Gemini 价格完整拆解说明了消费者套餐与 Developer API 计费为何彼此独立,Gemini 3 评测则介绍通用模型家族。
Gemini Live 又是另一回事。Google 的语音指南将 TTS 描述为按照原文精确朗读,同时控制风格和声音;Live 则处理交互式、非结构化音频和多模态对话。课程旁白、有声书或已批准的广告脚本属于 TTS。能够听取用户、推理、调用工具并持续与来电者交互的语音智能体,则属于成本模型不同的 Live 工作流。Gemini 3.8 Live 后台工具调用分析解释了这一运营选择。
分清两者,可以避免预算表中最昂贵的一类错误:拿低价文本 token 费率估算生成语音,或拿 TTS 输出费率估算持续在线的 Live 会话。
Gemini TTS 对比 ElevenLabs 与 Deepgram
按首发期 Standard 费率,Gemini 的原始生成时长成本低于 API 选型中常见的另外两家。不过三者的计量方式不同,价格也不能证明音质。
ElevenLabs API 价格显示,Flash/Turbo 与 v3 Conversational 每 1,000 字符 $0.05,页面将其折算为约每分钟 $0.05、即每小时约 $3;v3 创意模型约为每分钟 $0.10、即每小时 $6。若按这一公开的分钟估算比较,Gemini Flash-Lite Standard 当前每小时为 $0.54,Flash 为 $0.81。
Deepgram 价格按字符计费:Aura-2 每 1,000 字符 $0.030,Aura-1 为 $0.015。如果明确采用每分钟口播 1,000 字符的规划假设,折算后约为每小时 $1.80 和 $0.90。问题恰恰出在这个假设:语速、停顿和非语言音频都会改变时长,而 Deepgram 仍按字符收费。
可靠的比较方法,是用自己的脚本进行付费试听。将各服务商统一换算为同一小时的已批准成品音频,把废弃重录也算进去,再评估发音、表演、一致性、延迟和编辑时间。Gemini 在原始 token 成本上的优势确实存在,但如果更便宜的声音带来更多返工,整个制作并不会更省钱。
隐性成本与 2027年1月的预算调整
计划中的调价才是主要预算风险。1,000 小时的 Flash-Lite Standard 积压任务若在 12月31日前完成,按纯音频输出计算为 $540;从 1月1日起则是 $1,080。Flash 会从 $810 升至 $1,620。涨价后的 Batch 或 Flex,其输出小计与当前 Standard 相同。
其他成本来自运营环节:
- **重新生成:**被淘汰的录音也会产生可计费音频输出。
- **人工质检:**每个专有名词、数字、涉及同意授权的声音和最终剪辑都需要审核。
- **缓存存储:**已保存的上下文在释放前会持续按 token-hour 计费。
- 预付费到期:未使用的 Gemini API 预付费余额会在一年后到期,并且通常不予退款。未使用的后付费资金可能符合退款条件,但促销赠金不在此列。
- **应用拆分:**消费者版 Gemini 订阅不会让 Developer API TTS 变成内含功能。
下周一就可以这样做:先用 Flash-Lite Standard 跑 1 小时有代表性的内容,保存实际文本输入用量和输出时长,标出所有未达到制作标准的片段,再只用 Flash 重跑这些部分。把最终模型组合分别代入当前费率和 1月费率两列预算。如果可以接受 24 小时的目标处理时间,再将已批准的积压任务转至 Batch。
Gemini 3.8 TTS 价格常见问题
Gemini Audio TTS 要多少钱?
截至 2026年12月31日,Gemini 3.8 Flash-Lite TTS 的 Standard 音频输出成本为每分钟 $0.009,Gemini 3.8 Flash TTS 为每分钟 $0.0135。这些计算值不包含文本输入、缓存读取和缓存存储。
1000 个 token 要多少钱?
价格取决于 token 类型。按当前 Standard 费率,两款模型的 1,000 个文本输入 token 都是 $0.0005;1,000 个音频输出 token 在 Flash 上为 $0.009,在 Flash-Lite 上为 $0.006,对应 40 秒生成音频。所有金额都将在 2027年1月1日翻倍。
Google TTS API 免费吗?
Google 将 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 在免费层的输入、输出和缓存列为免费,但没有公布固定的 TTS 专属 token 或分钟配额,因此应在 AI Studio 中查看当前生效的限额。
怎样免费使用 TTS?
在 Google AI Studio 中新建或选择一个有效项目,打开语音生成工作区,在项目免费限额内使用两款 Gemini 3.8 TTS 模型之一。不要假设生产环境一定能获得免费容量。
TTS 需要付费吗?
使用 Gemini API 付费层后需要付费。Google 分别计算文本输入、音频输出、缓存读取和缓存存储;目前只计输出时,Standard 起步价为每生成 1 分钟 $0.009。
TTS 成本高吗?
Gemini Flash-Lite Standard 当前每生成 1 小时音频输出为 $0.54,Flash 为 $0.81。Batch 和 Flex 将两者减半,Priority 则分别提高到 $0.972 和 $1.458。
最好的 FreeTTS 软件是什么?
Gemini TTS 是云 API,并非 FreeTTS 软件库。如果只是想零成本评估,Gemini 免费层值得使用,但其公共价格页没有承诺具体的免费分钟数。
怎样启用 Google TTS?
打开 Google AI Studio 的语音生成工作区,或者在有效项目和 API key 下,通过 Gemini API 调用 gemini-3.8-flash-tts 或 gemini-3.8-flash-lite-tts。
Gemini 3.8 Flash TTS 有学生优惠吗?
Google 的 Developer API 价格页没有列出 Gemini TTS 学生专属费率。学生使用的也是面向所有开发者的相同免费层或付费层。
Gemini TTS API 费用可以退款吗?
Google 表示,关联后付费付款账号中的未使用资金可能符合退款条件。未使用的 Gemini API 预付费余额会在购买一年后到期,并且通常不予退款;促销赠金同样不予退款。
Gemini 3.8 Flash TTS 在 2026年调价了吗?
两款模型于 2026年9月23日以首发优惠费率上线。该费率适用至 12月31日,并计划于 2027年1月1日翻倍。
在确定生产预算前,可用 AI Business Workflow Audit Checklist 判断生成式语音应该放在工作流的哪个环节。订阅邮件通讯即可获取。
- 最近更新
- 2026年9月24日
- 分类
- Design







