Gemini TTS 价格全解:3.8 Flash 每分钟成本与选型指南

Gemini 3.8 Flash TTS 标准层当前每分钟生成音频成本为 $0.0135,Flash-Lite 为 $0.009。本文拆解 Standard、Batch、Flex 与 Priority 的价格,换算每小时和批量成本,并说明免费层、缓存费用及 2027年1月1日翻倍后的预算影响,帮助团队选对模型与服务层。

Thursday, September 24, 2026Omid Saffari
Gemini TTS 价格全解:3.8 Flash 每分钟成本与选型指南

Gemini 3.8 Flash TTS 标准服务层的 Gemini TTS 价格为每生成 1 分钟 $0.0135,Flash-Lite 则为 每分钟 $0.009。这是截至 2026年12月31日、仅计算输出的费率;Google 计划从 2027年1月1日起将价格翻倍,因此现在制定生产预算时就应同时纳入两组数字。

Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 于 2026年9月23日发布。我在 2026年9月24日逐项核对了 Google 实时更新的 Gemini Developer API 价格页,再按 Google 公布的每秒 25 个音频 token,换算出每分钟和每小时的生成成本。

Google Developer API 页面显示当前文字转语音 token 费率
Google Gemini Developer API 价格

Gemini TTS 价格速览:3.8 Flash 与 Flash-Lite

截至 2026年12月31日,成本最低的是 Flash-Lite 的 Batch 或 Flex:每生成 1 分钟 $0.0045。需要交互式生产流程时,更稳妥的默认选择是 Flash-Lite Standard,价格为 每分钟 $0.009。只有当保真度、复杂发音、方言覆盖或表演指导确实值得额外投入时,才有必要升级到完整版 Flash。

模型与服务层截至 12月31日的 token 费率(文本输入 / 音频输出)截至 12月31日仅输出成本(分钟;1h / 100h / 1,000h)2027年1月1日起仅输出成本(分钟;1h / 100h / 1,000h)
Flash Standard每 1M 为 $0.50 / $9.00$0.0135; $0.81 / $81 / $810$0.027; $1.62 / $162 / $1,620
Flash Batch每 1M 为 $0.25 / $4.50$0.00675; $0.405 / $40.50 / $405$0.0135; $0.81 / $81 / $810
Flash Flex每 1M 为 $0.25 / $4.50$0.00675; $0.405 / $40.50 / $405$0.0135; $0.81 / $81 / $810
Flash Priority每 1M 为 $0.90 / $16.20$0.0243; $1.458 / $145.80 / $1,458$0.0486; $2.916 / $291.60 / $2,916
Flash-Lite Standard每 1M 为 $0.50 / $6.00$0.009; $0.54 / $54 / $540$0.018; $1.08 / $108 / $1,080
Flash-Lite Batch每 1M 为 $0.25 / $3.00$0.0045; $0.27 / $27 / $270$0.009; $0.54 / $54 / $540
Flash-Lite Flex每 1M 为 $0.25 / $3.00$0.0045; $0.27 / $27 / $270$0.009; $0.54 / $54 / $540
Flash-Lite Priority每 1M 为 $0.90 / $10.80$0.0162; $0.972 / $97.20 / $972$0.0324; $1.944 / $194.40 / $1,944

表中所有时长成本均为计算值,并非实测账单,而且只覆盖生成音频的输出费用。最终账单还可能包含文本输入 token、缓存读取和缓存存储。

Gemini 3.8 TTS 每分钟、每小时要花多少钱?

看清计费单位后,时长换算并不复杂:Google 按 每秒 25 个音频 token 计费,因此生成 1 分钟音频需要 1,500 个音频 token,生成 1 小时需要 90,000 个。

截至 12月31日,Flash Standard 的计算如下:

  • 1 分钟:1,500 除以 1,000,000,再乘以 $9.00 = $0.0135
  • 1 小时:90,000 除以 1,000,000,再乘以 $9.00 = $0.81
  • 生成 1,000 小时:$0.81 乘以 1,000 = $810

Flash-Lite Standard 只需把 $9.00 的音频费率替换为 $6.00,结果就是 每分钟 $0.009每小时 $0.54,以及 每 1,000 小时 $540。从 2027年1月1日起,相同工作量将变为每分钟 $0.018、每小时 $1.08、每 1,000 小时 $1,080。

黏土风时间轴将每秒 25 个音频 token 换算为当前及 2027年1月的 Gemini TTS 每分钟费率
按 Google 每秒 25 个 token 的规则,可把费率表换算成时长预算。

下面这套计算表可以直接复用:

  1. **音频输出:**生成秒数乘以 25,除以 1,000,000,再乘以音频输出费率。
  2. **文本输入:**请求返回的实际输入 token 数除以 1,000,000,再乘以文本输入费率。
  3. **缓存读取:**实际缓存输入 token 数除以 1,000,000,再乘以缓存读取费率。
  4. **缓存存储:**缓存 token 数乘以存储小时数,除以 1,000,000,再乘以存储费率。

不要根据音频时长估算文本 token,应记录 API 实际返回的输入量。假设计费记录中恰好有 1,000,000 个文本输入 token,同时在 Standard 上生成了 100 小时音频,那么 Flash 当前总成本为 $81.50,即 $81 音频费加 $0.50 文本费;Flash-Lite 为 $54.50。从 1月1日起,两者分别变为 $163 和 $109。

之所以要分开计算,是因为短脚本也可能生成节奏缓慢、停顿很多的表演,而信息密集的脚本也可能被快速念完。Google 会分别计量脚本和最终生成的音频。

Gemini Flash-Lite TTS 价格:什么情况下更划算?

如果声音只是生产流程中的一个组成部分,而不是作品的核心表演,Flash-Lite 通常更划算。Google 的 TTS 模型指南将其定位于大批量生产、朗读功能、语音智能体级联、语音复刻和日常单人语音。它支持 101 种语言,并与完整版 Flash 使用相同的 API 结构。

完整版 Flash 属于创意制作档。Google 将其定位在最高保真度、细腻表演、复杂发音、地区方言、复杂多人对话,以及覆盖 130 种语言的稳定长篇旁白。截至 12月31日,其 Standard 输出每生成 1 小时比 Lite 贵 $0.27;从 1月1日起,差额升至 $0.54。

判断标准应是能否听出问题,而不是型号高低。先用同一份已批准脚本和声音指导测试 Lite。如果发音、方言、角色表现或长场景达不到制作标准,再修改模型参数,只用 Flash 重跑对应片段。两款模型共用同一套提示结构,因此无需维护两套生产系统。

优势
做得好的地方
8 points

  • 原始音频生成成本足够低,可以整章、整门课程或整批本地化内容进行试音。
  • Flash 与 Flash-Lite 共用 API 结构,便于只对必要片段升级。
  • 两款模型都支持 Standard、Batch、Flex 和 Priority 消费选项。
  • 费率表把文本、音频、缓存读取和存储拆开计费,而不是隐藏在点数里。
  • Google 公共页面没有公布固定的 TTS 专属免费额度。
  • 所有列出的付费 TTS 费率都计划于 2027年1月1日翻倍。
  • Flex 可被系统舍弃,容量紧张时可能失败。
  • token 成本不含成品音频所需的人工审听、编辑、母带处理和权利审核。

Standard、Batch、Flex 和 Priority 怎么选?

应按截止时间和容错能力选择服务层。服务层改变的是同一模型请求的调度和计费方式。

**Standard 是日常生产的默认选择。**它采用同步处理,通常在数秒至数分钟内返回,按完整费率收费。编辑试音、设计师反复调整声音指导,或应用需要在用户仍在线时响应,都适合用它。

**Batch 是适合隔夜队列、成本最低且可靠的方案。**它的价格是 Standard 的一半,采用异步处理,目标周转时间最长为 24 小时。出版社制作已完稿的有声书,或学习平台重新生成整套内容目录,都应优先考虑 Batch。

**Flex 与 Batch 同价,但仍采用同步处理。**Google 的目标时长为 1 至 15 分钟,使用尽力而为、可舍弃的容量。请求可能收到容量错误,而且 Google 不会自动将其升级为 Standard。Flex 适合下一步必须等待当前响应、但可以稍后重试的后台流程。

**Priority 适用于语音响应一旦延迟就会损害产品体验的场景。**它通过更高关键级别的容量处理同步流量。超过 Priority 限额后,Google 可能将请求降级到 Standard,并按 Standard 费率计费。按当前 TTS 价格,Priority 是 Standard 的 1.8 倍:Flash-Lite 每输出小时从 $0.54 升至 $0.972,Flash 则从 $0.81 升至 $1.458。

黏土风录音棚将音频任务分流到 Standard、Batch、Flex 和 Priority 服务路径
截止时间与可靠性决定服务层,语音模型则是另一项独立选择。

文本输入、音频输出与缓存存储分别计费

音频费用通常占 TTS 账单的大头,但语音生成账单不只有这一项。

Gemini TTS API 成本由四部分组成

文本输入就是脚本。两款模型的 Standard 输入费率相同:截至 12月31日,每 100 万个 token 为 $0.50,之后为 $1.00。Batch 和 Flex 的费率减半,Priority 当前提高到 $0.90,并从 1月1日起升至 $1.80。

音频输出是生成的语音表演,也是 Flash 与 Flash-Lite 价格拉开差距的部分:当前 Standard 每 100 万个音频 token 分别为 $9 和 $6,之后分别为 $18 和 $12。

缓存读取会在复用缓存输入时收费。当前每 100 万个缓存 token,Standard 为 $0.125、Batch 为 $0.0625、Flex 为 $0.025、Priority 为 $0.225;各项价格都将在 1月翻倍。

缓存存储按时间计费。截至 12月31日,所有服务层每 100 万个缓存 token-hour 均为 $0.50;从 1月1日起为 $1.00。因此,把 8,000 个 token 缓存 24 小时,目前成本为 $0.096;用 Standard 读取一次该缓存块,再增加 $0.001。到 1月时,这两项金额将分别变为 $0.192 和 $0.002。

当大段指令或发音上下文会反复使用时,缓存才有价值。对于简短且只用一次的脚本,缓存未必更经济。不要看到较低的读取费率就默认省钱,应先计算存储时长和预计命中次数。

这张费率表没有 TTS 月付或年付订阅。付费 API 按量计费,因此不存在年付折扣,也没有每月内含额度可供超用。锁定风险在别处:未使用的 Gemini API 预付费余额会在一年后到期,并且通常不予退款。

Gemini TTS 免费层:Google 到底承诺了什么?

Google 在两款 Gemini 3.8 TTS 模型的免费层一栏中,将文本输入、音频输出和上下文缓存都标为免费。但价格页并未公布 TTS 专属 token 额度,也没有保证可免费生成多少分钟音频。

因此,免费层适合试音、检查提示结构和制作小型原型,却不能作为产品上线的容量方案。Google 表示,实际生效的限额取决于项目的使用层级,可在 AI Studio 内查看,会随账号状态更新,而且没有保证。应直接检查项目,不要从博客文章照搬配额。

是否付费也会改变隐私条件。Google 的价格页写明,免费层内容可能被用于改进其产品,而根据所链接的条款,付费层内容不会用于这一目的。客户声音、未发布脚本或敏感培训材料在进入工具前,就应把这一点纳入决策。

哪些人可以一直不付费?如果设计师只是试听少量声音,而且始终没有超出项目当前限额,就可能继续免费。只要需要承诺交付量、吞吐能力或处理保密生产内容,就应为付费层编列预算,不能把未明确的免费额度当成基础设施。

同一份声音需求:调价前后分别要花多少?

以 100 小时的单人旁白培训资料为例,最容易看清两款模型的差异。截至 12月31日,Standard 的纯输出小计为:Flash-Lite $54,Flash $81。从 1月1日起,将分别变为 $108 和 $162。文本输入、缓存以及所有重新生成的片段都要另计。

第一轮应使用 Flash-Lite,因为大多数常规旁白并不需要每一句都调用旗舰模型。修改阶段只升级没有通过明确制作检查的内容,例如地区名称发音错误、情绪场景显得平淡、多人对话缺少区分,或长篇音频的声音和房间音色发生漂移。

  1. 锁定一份有代表性的需求

    选择一段包含实际制作难点的脚本:名称、数字、停顿、情绪转折,以及在需要时加入多位说话者。不同模型必须使用完全相同的文本。

  2. 用正确方式指导表演

    Gemini 3.8 TTS 会把脚本文本当作需要念出的内容。持续性的指导应写入结构化语音元数据,只把行内标签用于特定时点的声音事件,避免模型误把指令念出来。

  3. 先试听 Flash-Lite

    生成一份可控的试样,然后保存接口返回的输入 token 用量和实际音频时长。本文没有生成样音,因此文中的时长数据仍是只计算输出的成本,而不是实测账单。

  4. 只升级未通过的片段

    保留合格的 Lite 输出。对于发音、方言、表演、说话者区分或长篇一致性不达标的段落,将模型参数切换到 Flash。

  5. 选择任务队列

    有人实时指导时用 Standard;已批准的积压任务发往 Batch;只有配好重试机制时才选 Flex;只有等待会破坏用户体验时才购买 Priority。

别把 TTS 与 Gemini Live 或纯文本 Flash 混为一谈

Gemini 3.8 Flash TTS 接收文本并返回音频表演。通用 gemini-3.8-flash 是另一个端点,使用不同的费率表,因此不能拿文本模型常见的输入、输出价格来估算 TTS。Gemini 价格完整拆解说明了消费者套餐与 Developer API 计费为何彼此独立,Gemini 3 评测则介绍通用模型家族。

Gemini Live 又是另一回事。Google 的语音指南将 TTS 描述为按照原文精确朗读,同时控制风格和声音;Live 则处理交互式、非结构化音频和多模态对话。课程旁白、有声书或已批准的广告脚本属于 TTS。能够听取用户、推理、调用工具并持续与来电者交互的语音智能体,则属于成本模型不同的 Live 工作流。Gemini 3.8 Live 后台工具调用分析解释了这一运营选择。

分清两者,可以避免预算表中最昂贵的一类错误:拿低价文本 token 费率估算生成语音,或拿 TTS 输出费率估算持续在线的 Live 会话。

Gemini TTS 对比 ElevenLabs 与 Deepgram

按首发期 Standard 费率,Gemini 的原始生成时长成本低于 API 选型中常见的另外两家。不过三者的计量方式不同,价格也不能证明音质。

ElevenLabs API 价格显示,Flash/Turbo 与 v3 Conversational 每 1,000 字符 $0.05,页面将其折算为约每分钟 $0.05、即每小时约 $3;v3 创意模型约为每分钟 $0.10、即每小时 $6。若按这一公开的分钟估算比较,Gemini Flash-Lite Standard 当前每小时为 $0.54,Flash 为 $0.81。

Deepgram 价格按字符计费:Aura-2 每 1,000 字符 $0.030,Aura-1 为 $0.015。如果明确采用每分钟口播 1,000 字符的规划假设,折算后约为每小时 $1.80 和 $0.90。问题恰恰出在这个假设:语速、停顿和非语言音频都会改变时长,而 Deepgram 仍按字符收费。

可靠的比较方法,是用自己的脚本进行付费试听。将各服务商统一换算为同一小时的已批准成品音频,把废弃重录也算进去,再评估发音、表演、一致性、延迟和编辑时间。Gemini 在原始 token 成本上的优势确实存在,但如果更便宜的声音带来更多返工,整个制作并不会更省钱。

隐性成本与 2027年1月的预算调整

计划中的调价才是主要预算风险。1,000 小时的 Flash-Lite Standard 积压任务若在 12月31日前完成,按纯音频输出计算为 $540;从 1月1日起则是 $1,080。Flash 会从 $810 升至 $1,620。涨价后的 Batch 或 Flex,其输出小计与当前 Standard 相同。

其他成本来自运营环节:

  • **重新生成:**被淘汰的录音也会产生可计费音频输出。
  • **人工质检:**每个专有名词、数字、涉及同意授权的声音和最终剪辑都需要审核。
  • **缓存存储:**已保存的上下文在释放前会持续按 token-hour 计费。
  • 预付费到期:未使用的 Gemini API 预付费余额会在一年后到期,并且通常不予退款。未使用的后付费资金可能符合退款条件,但促销赠金不在此列。
  • **应用拆分:**消费者版 Gemini 订阅不会让 Developer API TTS 变成内含功能。

下周一就可以这样做:先用 Flash-Lite Standard 跑 1 小时有代表性的内容,保存实际文本输入用量和输出时长,标出所有未达到制作标准的片段,再只用 Flash 重跑这些部分。把最终模型组合分别代入当前费率和 1月费率两列预算。如果可以接受 24 小时的目标处理时间,再将已批准的积压任务转至 Batch。

Gemini 3.8 TTS 价格常见问题

Gemini Audio TTS 要多少钱?

截至 2026年12月31日,Gemini 3.8 Flash-Lite TTS 的 Standard 音频输出成本为每分钟 $0.009,Gemini 3.8 Flash TTS 为每分钟 $0.0135。这些计算值不包含文本输入、缓存读取和缓存存储。

1000 个 token 要多少钱?

价格取决于 token 类型。按当前 Standard 费率,两款模型的 1,000 个文本输入 token 都是 $0.0005;1,000 个音频输出 token 在 Flash 上为 $0.009,在 Flash-Lite 上为 $0.006,对应 40 秒生成音频。所有金额都将在 2027年1月1日翻倍。

Google TTS API 免费吗?

Google 将 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 在免费层的输入、输出和缓存列为免费,但没有公布固定的 TTS 专属 token 或分钟配额,因此应在 AI Studio 中查看当前生效的限额。

怎样免费使用 TTS?

在 Google AI Studio 中新建或选择一个有效项目,打开语音生成工作区,在项目免费限额内使用两款 Gemini 3.8 TTS 模型之一。不要假设生产环境一定能获得免费容量。

TTS 需要付费吗?

使用 Gemini API 付费层后需要付费。Google 分别计算文本输入、音频输出、缓存读取和缓存存储;目前只计输出时,Standard 起步价为每生成 1 分钟 $0.009。

TTS 成本高吗?

Gemini Flash-Lite Standard 当前每生成 1 小时音频输出为 $0.54,Flash 为 $0.81。Batch 和 Flex 将两者减半,Priority 则分别提高到 $0.972 和 $1.458。

最好的 FreeTTS 软件是什么?

Gemini TTS 是云 API,并非 FreeTTS 软件库。如果只是想零成本评估,Gemini 免费层值得使用,但其公共价格页没有承诺具体的免费分钟数。

怎样启用 Google TTS?

打开 Google AI Studio 的语音生成工作区,或者在有效项目和 API key 下,通过 Gemini API 调用 gemini-3.8-flash-ttsgemini-3.8-flash-lite-tts

Gemini 3.8 Flash TTS 有学生优惠吗?

Google 的 Developer API 价格页没有列出 Gemini TTS 学生专属费率。学生使用的也是面向所有开发者的相同免费层或付费层。

Gemini TTS API 费用可以退款吗?

Google 表示,关联后付费付款账号中的未使用资金可能符合退款条件。未使用的 Gemini API 预付费余额会在购买一年后到期,并且通常不予退款;促销赠金同样不予退款。

Gemini 3.8 Flash TTS 在 2026年调价了吗?

两款模型于 2026年9月23日以首发优惠费率上线。该费率适用至 12月31日,并计划于 2027年1月1日翻倍。

在确定生产预算前,可用 AI Business Workflow Audit Checklist 判断生成式语音应该放在工作流的哪个环节。订阅邮件通讯即可获取

最近更新
2026年9月24日
分类
Design

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

梭编图解软件怎么选:4款工具从构思到印刷的完整对比

梭编图解软件怎么选:4款工具从构思到印刷的完整对比

梭编图解软件该怎么选?本文对比 Inkscape、Amaziograph、Affinity 与 TattingCAD 的可编辑性、对称构图、针目标注、矢量导出、平台限制和价格,说明怎样从草图建立可复用组件,输出清晰的 SVG/PDF,并用实物样品验证图样,帮你判断哪款工具适合构思、排版或最终交付。2026年9月20日Design
卡片编织软件推荐:4款免费图案设计工具对比

卡片编织软件推荐:4款免费图案设计工具对比

卡片编织软件不只要画出彩色纹样,还要完整保留穿线方向、逐行转牌、捻度和反转点。本文对比 Tablet Weaving Draft Designer、Twisted Threads、GTT 与 SeiZenn 的导出、交互跟织、复杂结构和离线能力,帮助你按最终需要的输出方式选对免费工具。2026年9月20日Design
PCStitch 对比 WinStitch:照片转十字绣图纸怎么选

PCStitch 对比 WinStitch:照片转十字绣图纸怎么选

PCStitch 和 WinStitch 哪个更适合把照片转成十字绣图纸?本文用同一输入比较减色、碎针清理、符号编辑、PDF 与 Pattern Keeper 导出、试用限制、价格和单张成本,并为人像制作、图纸销售及旧版 Windows 用户给出明确选择,也说明何时值得迁移及购买前如何公平试用。2026年9月20日Design
QuiltAssistant 评测:这款免费拼布设计软件只适合一种任务

QuiltAssistant 评测:这款免费拼布设计软件只适合一种任务

QuiltAssistant 能把照片拆成可编辑布片并生成纸样拼布打印设置,但目前仅提供老旧 Windows 下载版,免费许可也只限私人非商业用途。本次实测覆盖照片切分、形状编辑、A1 到 A4 编号、缝份和镜像打印设置,并对比 EQ8 与 PreQuilt,帮你判断这款免费拼布设计软件是否适合自己的项目。2026年9月20日Design
WinStitch价格全解析:版本、附加费与购买建议

WinStitch价格全解析:版本、附加费与购买建议

WinStitch价格从单平台Premium版£46起,但默认购物车会加入下载保障和税费。本文拆解Windows与Mac套装、终身升级、免费Demo、退款及授权边界,并对比Stitchmate、PCStitch和Xstitchify,帮你按真实工作流算清总成本,避开不必要的附加项。2026年9月20日Design
产品演示视频选 ngram 还是 Demosmith?

产品演示视频选 ngram 还是 Demosmith?

ngram 与 Demosmith 都能制作产品演示视频,但两者依据的事实源完全不同:前者把文档、截图和录屏编排成故事,后者让代理直接操作并录制网页产品。本文以一段 60 秒、1080p 演示为基准,对比两款产品演示软件的月费与用量上限、界面改动后的返工、导出格式和迁移成本,帮你判断哪条 AI产品演示工作流更适合团队。2026年9月19日Design
Seamly2D 教程:把整版纸样拆成 A4 与 Letter 分页打印

Seamly2D 教程:把整版纸样拆成 A4 与 Letter 分页打印

这份 Seamly2D 教程从创建大版面开始,讲清如何导出 A4 或 Letter 分页 PDF、设置 100% 实际尺寸、校准页边距与 1 cm 搭接区,并用 10 × 10 cm 测试方块先验证纸样比例,再按网格编号拼接整套纸样,避免整批废纸或因缩放错误裁坏面料。适合独立纸样卖家、量体裁缝、家庭缝纫者与教学场景。2026年9月19日Design
Fiberworks 与 WeavePoint 怎么选:价格、兼容性与织机控制全对比

Fiberworks 与 WeavePoint 怎么选:价格、兼容性与织机控制全对比

Fiberworks 还是 WeavePoint?本文对比 Windows 与 Mac 兼容性、织纹设计上限、WIF 交换、打印输出、织机控制和一次性许可价格,并按具体控制器给出购买与迁移建议,帮你判断低价跨平台方案是否够用,还是值得为 WeavePoint 的 128 综框能力和出版级输出支付溢价。2026年9月19日Design
订阅通讯

每周日,一封信。写运转中的系统,不写热评。

每周一期。无垃圾邮件。随时退订。