2026 年最佳低延迟文本转语音(TTS)API 深度评测:专为语音 Agent 打造
深度评测 8 款适用于语音 Agent 的低延迟 TTS API,从首包音频延迟 TTFA、流式传输、打断处理机制、计费模型及生产落地决策展开综合对比。结合 5000 万字符实测场景,解析为何原生打断状态管理比单纯的毫秒延迟指标更关键,助力构建高可靠实时对话系统。

Deepgram Flux TTS 是 2026 年语音 Agent 领域综合表现最出色的低延迟 API:其官方标称的 80 ms 首包音频延迟(TTFA)直接集成了原生打断状态追踪机制,而非仅仅提供快速的音频合成。相比之下,Pika 虽然能在约 1.2 秒内合成长达 1 分钟的 48 kHz 高清音频,但其实时 API 采用异步调用机制且明确不支持流式传输,这种宣传指标根本无法优化电话通话中的真实体感延迟。
核心选型结论
如果是以英语为主、通话中用户频繁打断、插话并要求 Agent 精确记住已播放内容的语音 Agent 场景,首选 Deepgram Flux TTS。它的延迟指标或许不是本文中数值绝对最小的,但其核心优势在于:流式协议能够实时回报用户已听到的文本与被打断未播放的文本,从而在打断(barge-in)发生后完美保护对话状态机不发生漂移。
如果团队最看重透明的分位数延迟测试数据和极快的首包音频响应,请选择 Rime Mist v3。若多语言覆盖能力与字符成本是核心制约条件,请选择 Inworld Realtime TTS-2 Flash。而在需要成熟的多语言语音生态、且团队能接受更高字符费率和自行处理文本规范化(Text Normalization)任务的前提下,ElevenLabs Flash v2.5 是稳妥的选择。
以下价格数据均于 2026 年 8 月 26 日在各服务商官网完成核实。“起始价格”指公开可见的最低接入门槛,并非实际生产环境的最终账单。
工程落地中的硬性决策规则非常明确:打断处理的准确性完胜单纯追求孤立的低延迟数值。当有两个备选方案都能正确处理打断路径时,才需要在真实的电话网络路由下对比 p95 首包音频表现,接着评估实际综合成本与声音拟真度。一个服务商完全可以在服务端基准测试中拔得头筹,却在经过公网传输、音频缓冲、格式转码或一次失败的打断交互后彻底搞砸整通电话。
如果需要的是打包完整的全栈平台而非底层组件 API,建议参考 AI 语音 Agent 平台对比指南。若是为了长音频旁白、无障碍阅读或常规音频生成,通用的 文本转语音(TTS)选型指南 适用的决策逻辑则截然不同。
评选标准与测试维度
这是一篇基于真实商业公开数据的交叉对比分析,并非在单一受控实验室中对 8 款 API 进行的合成跑分。所有模型名称、公开定价、套餐梯度、并发限制、传输协议以及官方标称的延迟数据,均在 2026 年 8 月 26 日核实自各厂商一手官方页面。排名的核心逻辑是将这些客观事实代入到语音 Agent 的生产落地实战中进行权重考量。
做出这种区分至关重要,因为各家厂商公布的延迟指标统计口径并不一致。Inworld 报告的是不含网络传输的服务端 P90 首包音频字节延迟;ElevenLabs 公布的大致模型推理延迟排除了应用层和网络开销;Rime 在特定并发条件下公布了 P50 和 P90 首包音频时间,并单独对各区域网络往返时间进行了测算;Deepgram 声称其延迟“低至”80 ms;而 Hume 则明确区分了约 100 ms 的模型推理延迟与 Instant 模式下实际生成首包音频所需的约 200 ms 耗时。
这些数据在各自的系统内部极具参考意义,但它们不能直接当作跨厂商的纯粹基准测试对比。
我们通过以下 5 个核心维度决定最终位次:
- 首段可播音频耗时(TTFA): 真正的响应延迟预算始于 Agent 准备好文本的那一刻,终于用户端扬声器发出声音的瞬间。整段音频生成耗时与此完全是两个概念。
- 打断状态管理能力(Interruption State): 真实的通话必须明确知道已经播出了什么、哪些内容尚未播放,以及用户强行打断后语言模型到底该保留哪些上下文状态。
- 流式传输协议支持: 持久化的 WebSocket 连接、渐进式输入、主动取消指令以及开箱即用的音频格式支持,这些工程特性往往比模型本身微小的推理优势更能缩短体感延迟。
- 生产环境经济模型: 真实的预算支出取决于预估业务量下的字符数或 token 数,加上保底消费和梯度门槛,绝非单纯对比定价页面上展示的最低数字。
- 已知的硬性技术壁垒: 语言支持范围、数字与特殊符号规范化支持、并发上限、模型 Preview 阶段状态、输出编码格式、商用授权许可及定义不明的基准口径,都会改变实际的赢家。
语音表现力固然重要,但排在硬性系统故障之后。一个音色极佳但启动迟缓、念错银行卡号,或者在用户插话时依然自顾自播报的声音,在生产环境中绝不是合格的 Agent 声音。

1. Deepgram Flux TTS:语音 Agent 的综合最优解
Deepgram Flux TTS 是目前综合表现最强的方案,因为其专为语音 Agent 打造的通信协议将打断视为系统“状态”,而非仅仅当成一个“停止播放”的按钮。

在 Deepgram 的 GA 正式版发布记录 中,其公布的首包音频延迟低至 80 ms,但在 2026 年 8 月 12 日正式商用时落地的核心功能更具生产价值:在实时 WebSocket 连接中,发送一条 Interrupt 消息即可立刻终止当前话轮;系统返回的 SpeechInterrupted 事件会明确返回 text_spoken(已播报文本)与 text_remaining(未播报文本)。这让 Agent 可以严格依据用户实际听到的内容来同步并更新对话记忆,彻底摆脱靠客户端音频播放时间戳去盲猜进度的原始做法。
试想一个查询账户余额的 Agent 正在播报:“您的账户余额为两千八百……”此时用户打断并询问付款问题。一条通用的停止播放指令确实可以掐断音频波形,但后端的大语言模型(LLM)很可能误以为整个余额数字已经被完整传达给了用户。Flux 提供了精准的状态边界来修正这种对话记忆错位。反映在实际业务中,就是能极大减少因信息不对称导致的重复播报、自相矛盾的答复,以及客户端繁琐的声音进度记账逻辑。
此外,Flux 还通过其 v2 Speak WebSocket 支持跨话轮维护会话上下文。这在处理客服投诉时极其有用——即便遭遇连续打断,系统仍能保持语气沉稳或适时变得精炼。相比将每句话切碎孤立处理的传统旁白模型,它显然更符合多轮交互式通话的真实需求。
该方案的主要短板在于生态覆盖面:当前 GA 版本仅提供涵盖 7 种口音的 36 种英语音色。如果业务上线有强制的多语言需求,Inworld 或 ElevenLabs 会更合适。此外,Flux 在默认的 Voice Agent 集成链路中直接输出无封装、无比特率头信息的原始 linear16、mulaw 或 alaw 音频流。这些格式虽然天生契合电话交换网络,但如果下游系统强依赖 MP3、Opus、FLAC、AAC 或 WAV,就必须自行搭建转码层,或者改用 Deepgram 的 Aura 系列模型。
最佳适用: 频繁发生打断交互的英语客服、预约排期、销售线索初筛及售后呼叫场景。
核心亮点: 打断发生后,原生返回已播报与未播报文本的状态隔离。
定价模式: 2026 年 9 月 12 日前 Flux 免费开放;自 9 月 13 日起,标准 Pay As You Go 为 $0.0450/1K 字符,Growth 档位为 $0.0405/1K 字符。
免费试用: 有。Pay As You Go 模式赠送 $200 免费额度,无保底消费门槛且不过期。
Deepgram 阶梯定价一览
根据 Deepgram 实时定价页面,商业接入分为三档路径:Pay As You Go 自带 $200 赠送金,支持最高 45 路 TTS REST 或 WebSocket 并发连接;Growth 档位起步需预付 $4,000 年费额度,将 TTS 并发上限放宽至 60 路;Enterprise 提供针对更大规模用量、私有化部署、数据合规及专属技术支持的定制方案。
模型的定价梯次同样需要关注。在 Flux 促销期结束后,Pay As You Go 资费为 $0.0450/1K 字符,Growth 为 $0.0405/1K 字符;Aura-2 对应的价格分别为 $0.030 和 $0.027;Aura-1 则为 $0.0150 和 $0.0135。低价的 Aura 模型适合交互较弱的播报场景,但它们并不具备 Flux 原生的对话打断状态追踪特性。
- 原生打断事件能精确返回已播报与未播报文本切片。
- 对话上下文支持跨话轮记忆继承,避免机械重置。
- 官方标称首包音频延迟低至 80 ms。
- 提供公有云、VPC、本地私有化及自托管部署方案,满足合规要求。
- 目前仅支持英语语种。
- 默认语音 Agent 通信链路仅支持原始 linear16、mulaw 和 alaw 编码输出。
- 按公开标称资费计算,Flux 标准价格高于 Rime Mist 和 Inworld Flash。
Flux 推荐生产架构搭建步骤
建立长连接传输管道
将 Agent 客户端接入 v2 Speak WebSocket,并在整个通话会话期间保持心跳长连。切忌将每句话拆解为独立的 HTTP 批处理请求。
采用面向电话协议的音频编码
直接选择 linear16、mulaw 或 alaw 输出以对齐下游电话交换网。若电话运营商本身已原生支持上述格式,必须从核心链路中剔除转码开销。
按语义短语渐进式推流送入文本
在大语言模型生成内容的过程中,按照完整的语义短语(Clause)逐步发送。这样既能让 TTS 模型拥有充足的语义上下文以保证语调自然,又无需等待整个段落生成完毕。
将打断机制深度融入状态机管理
用户插话瞬间,立即向服务端发送 Interrupt 消息。将对话上下文中原本计划回复的 Assistant 内容替换为 text_spoken,并在请求下一轮 LLM 前将 text_remaining 彻底丢弃。
全链路监控终端用户实际听觉延迟
在工程日志中完整打点:文本就绪时刻、接收到首字节时刻、首帧音频入队时刻以及首帧扬声器播放时刻。紧盯 p95 统计指标针对最慢的链路进行调优,而非被厂商在极端测试下的峰值数据迷惑。
总结: Deepgram 能在本次横评中拔得头筹,核心在于其 API 协议能在打断发生时坚决捍卫对话状态的一致性。只有在多语言为硬性刚需或单价极其敏感的前提下,才应考虑其他备选。
2. Rime Mist v3:低延迟基准指标最为透明的专业选手
Rime Mist v3 斩获第二名,归功于其在同行中提供了最具决策价值、颗粒度最细的延迟测试基准报告。

Rime 的延迟官方文档 显示,在单并发请求下,Mist v3 的首包音频耗时达到了 P50 37 ms、P90 56 ms。即便在 12 并发的高负载下,测得的 P50 与 P90 数据依旧稳定保持在 37 ms 和 56 ms。作为对照,同一页面披露的 Coda 模型在单并发下为 P50 96 ms、P90 98 ms,并发升至 12 时会增加至 150 ms 和 181 ms。
公开此类细分数据远比宣传单个“最优极限延迟”更有价值,因为它揭示了长尾延迟以及负载变化对系统的实际影响。不过这依然不能代表端到端通话延迟。Rime 官方测算表明,即便命中最近的机房区域,美国本土大部分地区的网络往返仍会带来 25 到 50 ms 的开销,而跨区域调用更会叠加 60 到 85 ms 的网络延迟。在此之后,还有自身的流媒体服务处理、音频缓冲和电信交换网络的传输开销。
Mist 是纯粹的低延迟利器,而 Coda 则侧重多语言能力与丰富的元数据支持。Mist 仅支持英语、法语、德语和西班牙语,拥有 94 个音色;Coda 则支持 8 种商用语言及 184 种音色。两者均支持 HTTP 和 WebSocket 两种流式协议,但 Coda 提供精确到词级的时间戳(Word-level Timestamps),Mist 则不提供。如果业务层依赖词级别的时间戳来精细化对齐音画或同步播放进度,Mist 缺失该元数据的代价将超过其 TTFA 带来的性能优势。
最佳适用: 需要严格验证分位数延迟指标、且业务范围落在 Mist 支持的四种语言之内的团队。
核心亮点: 在 1 并发与 12 并发场景下均明确公布了 P50 与 P90 TTFA 延迟。
定价模式: Mist v3 为 $0.03/1K 字符;Coda 为 $0.05/1K 字符。
免费试用: 有,但 Rime 官方页面关于赠送时长的表述存在冲突。
Rime 阶梯定价一览
Starter 档位下,Mist 资费为 $0.03/1K 字符,Coda 为 $0.05/1K 字符,无需绑定信用卡,允许最高 20 路并发生成。Enterprise 采用定制报价,提供不设限的并发量、无限自定义声音克隆配额、SLA 保障、专属支持,并支持公有云、本地私有化或 VPC 部署。
官方页面在 Starter 权益处标注为“赠送约 800 分钟免费额度”,但在底部的常见问题(FAQ)中又写为“赠送 3,000 分钟”。建议确认注册即送额度这一事实,具体时长以控制台实际入账余额或官方页面后续纠错为准。这种细微的出入在规模化生产中微不足道,但正是我们坚持实名锁死事实数据的原因。
- Mist 明确公布了特定并发环境下的中位数与长尾 TTFA 延迟。
- 37 ms P50 和 56 ms P90 的表现处于业界顶尖水准。
- 同时支持 HTTP 与 WebSocket 双流式方案。
- 企业版支持公有云、VPC 与本地化私有部署。
- Mist 仅支持 4 种商用语言,且缺乏词级别的时间戳。
- 机房距离带来的公网网络开销往往超过模型本身的推理延迟。
- 定价页面关于新用户免费赠送时长的文案存在出入。
总结: Rime Mist 是本次对比中纯粹的速度王者。只有在业务系统能够容忍缺乏打断元数据、且经过实地部署测算其分位数优势确实成立时,其优先级才会超越 Deepgram。
3. Inworld Realtime TTS-2 Flash:多语言覆盖与综合成本之选
在公开按量付费的计费阶梯下,Inworld Realtime TTS-2 Flash 是多语言语音 Agent 极具性价比的选择。

Inworld 官方 TTS 页面 表明,Flash 模型的服务端 P90 首字节响应延迟为 20 ms,而主打更强表现力的 TTS-2 模型则为 150 ms。请注意,这些指标均属于排除了网络延迟的服务端数据,不能直接拿去与 Rime 的全网端到端预估或 Hume 的实际综合首包音频指标相提并论。更具指导意义的结论在于:Inworld 专为 WebSocket 实时推流对 Flash 进行了深度优化,在合理调度网络链路的前提下,模型侧延迟绝不会成为系统瓶颈。
语言覆盖面是其真正的杀手锏。Inworld 支持 200+ 种语言,且只需 5 到 15 秒的参考音频即可在这些语种间完成声音跨语种克隆。对于需要在多国市场统一品牌音色身份、又不想为每个语种分别采购并维护不同服务商的客户支持类 Agent 而言,这具有极高的实用价值。
成本层面的优势同样突出。按需计费(On-Demand)的 Flash 资费仅为 $15/1M 字符,相比之下 Rime Mist 为 $30/1M 字符,促销期后的 Deepgram Flux 为 $45/1M 字符,ElevenLabs Flash 为 $50/1M 字符。以本文后半部分测算的 5000 万字符消耗量为基准,在享受任何大客户折扣前,其公开价格仅为每月 $750。
主要代价体现在较为复杂的计费阶梯机制上。Inworld 引入了月度额度(Credits)、各模型专属扣费率、6 档套餐级别以及不同的并发配额限制。当所选付费套餐的保底额度远超实际消耗时,单纯较低的单价并不等同于账单总额更低。采购时应严格根据实际调用负荷匹配套餐,不要单纯为了账面折扣率盲目升级。
最佳适用: 大并发多语言 Agent,以及需要在全球数十个语种间保持统一人设声音的业务。
核心亮点: 覆盖 200+ 语种,原生 WebSocket 流式传输,公开按需计费单价低至 $15/1M 字符。
定价模式: 免费起步;Flash 单价从 On-Demand 的 $15/1M 字符逐步下降,Enterprise 档位可低至 $5 以下。
免费试用: 有。On-Demand 档位包含最高 70 分钟的 TTS 额度。
Inworld 阶梯定价一览
根据 Inworld 实时定价页面,其账户额度可统一用于抵扣 TTS、STT 及 LLM 模型调用:
- On-Demand: 免费起步,包含最高 70 分钟 TTS 额度,Flash 单价为 $15/1M 字符,TTS-2 为 $25/1M 字符,支持 5 路并发。
- Creator: 每月保底 $25 额度,Flash 为 $10/1M 字符,TTS-2 为 $20/1M 字符,支持 10 路并发。
- Builder: 每月保底 $100 额度,Flash 为 $9/1M 字符,TTS-2 为 $17.50/1M 字符,支持 50 路并发。
- Developer: 每月保底 $300 额度,Flash 为 $8/1M 字符,TTS-2 为 $15/1M 字符,支持 150 路并发。
- Growth: 每月保底 $1,500 额度,Flash 为 $7/1M 字符,TTS-2 为 $12.50/1M 字符,支持 500 路并发。
- Enterprise: 定制商务方案,TTS-2 可低至 $5/1M 字符,Flash 可低于 $5/1M 字符,提供定制并发配额。
Inworld 官方计算器默认以 1,000 字符约等于 1 分钟音频进行换算。可使用该行业经验值做初始预算摸底,但后续务必替换为真实业务提示词生成的实际字符密度。措辞简练的催收 Agent 与滔滔不绝的教育辅导 Agent,每分钟消耗的字符量会有显著差距。
- Flash 模型给出了 20 ms 的服务端 P90 首字节响应数据。
- 覆盖 200+ 种语言,支持极短样本的跨语种音色克隆。
- 在四款成本入围厂商中,公开字符单价最为低廉。
- 并发能力弹性充足,从 On-Demand 的 5 路平滑扩展至 Growth 的 500 路。
- 宣传延迟指标明确排除了公网路由延迟。
- 6 档额度体系让实际综合采购成本评估变得复杂。
- 强调情感拟真的 TTS-2 模型价格更高,且首包延迟指标劣于 Flash。
总结: 当 Agent 面向全球市场多语言发布、或字符计费支出成为业务重点关注指标时,Inworld 是首选。而在纯英语环境中,Deepgram 依靠原生打断状态管理带来的工程确定性,其价值依然超过这部分价格差。
4. ElevenLabs Flash v2.5:成熟的多语言语音生态
如果团队非常看重音色资产库储备、多语言运营成熟度以及标准化的 API 工具链,ElevenLabs Flash v2.5 是稳妥的主流选型。

ElevenLabs 模型官方文档 披露,Flash v2.5 的模型端纯推理延迟约为 75 ms(不含网络与应用层开销)。该模型原生支持 32 种语言,单次请求字符上限达到 40,000 字符。对于落地生产的语音 Agent 而言,其实际吸引力不在于某一个单纯的测试数据,而是其将低延迟、广泛的语种支持、极其成熟的音色市场以及透明的按量付费路径做到了平衡。
核心痛点隐藏在“文本规范化”(Text Normalization)这一细节中:Flash 为最大化压缩延迟,默认关闭了针对数字、日期与货币单位的正则规范化转换。这意味着手机号、日期、价格等极易被模型以出人意料的读音逐字念出。企业版(Enterprise)客户可以在 v2.5 中手动开启该规范化选项,但对于其他所有客户,必须在大语言模型吐出文本后、送入 TTS 之前,在业务代码中强制完成这部分口语化转换。
这绝非偶发边缘 Case。一个客服 Agent 每天都要高频报送订单号、预约日期、还款金额、收件地址、验证码和联系电话。如果一个日期直接被当成一连串生硬的数字念出来,响应再快的模型也会遭到投诉。必须把文本规范化明确纳入 Prompt 规则和端到端测试用例中,切忌等到生产上线前才去打补丁。
ElevenLabs 是入围厂商中极具代表性的高价值产品。将其排在第四名,是严格基于语音 Agent 生产决策逻辑评估的结果。当团队极度依赖成熟的多语言音色资产库时,它优于后续选手;但当打断状态捕获、透明分位数指标或字符采购成本成为核心卡点时,它只能排在前三名之后。
最佳适用: 看重业界最成熟的声音生态资产、追求极简 API 采购集成的多语言应用。
核心亮点: 覆盖 32 种主流语言,标称模型推理延迟约 75 ms。
定价模式: Flash 和 Turbo 模型的标准计费为 $0.05/1K 字符。
免费试用: 有。Free / Pay As You Go 档位每月赠送 20,000 个 Flash 或 Turbo 字符。
ElevenLabs 阶梯定价一览
根据 ElevenLabs API 实时定价页面 公布的数据:
- Free / Pay As You Go: $0,包含 20,000 个 Flash 或 Turbo 字符。
- Starter: $6/月,包含 120,000 字符。
- Creator: $22/月(首月优惠价 $11),包含 440,000 字符。
- Pro: $99/月,包含 1,980,000 字符。
- Scale: $299/月,包含 5,980,000 字符。
- Business: $990/月,包含 19,800,000 字符。
- Enterprise: 商业定制。
在公开展示的 API 套餐中,超出套餐内额度后的 Flash 结算价统一为 $0.05/1K 字符。因此选择哪个套餐,核心取决于团队所需的保底字符额度、专属账户功能及并发限制,而非寄希望于通过升级获得更低的单字符标称费率。
- Flash v2.5 原生支持 32 种主流语言。
- 官方标称模型推理延迟约 75 ms(未含公网与应用耗时)。
- 免费档位提供了易于上手的原型验证额度。
- 成熟的声音市场与开发工具链,降低了选型与声音管理门槛。
- Flash 默认关闭了数字、日期及货币单位的口语规范化转换。
- $0.05/1K 字符的公开费率大幅高出 Inworld Flash。
- 宣传的主打延迟指标未计入网络交互与应用层耗时。
总结: ElevenLabs 是容错率极高的通用默认之选,但并非万能。选择它的前提是多语言音色资产与生态易用性大于额外的字符溢价,并务必在系统上线前把数字规范化作为核心测试项予以验收。
5. Cartesia Sonic-3.6:专注 WebSocket 上下文管理
对于看重精细化 WebSocket 上下文隔离、实时任务取消及时间戳回调机制的架构师而言,Cartesia Sonic-3.6 是值得重点评估的技术方案。

Cartesia 的实时定价页面已更新为 Sonic-3.6。其 WebSocket API 显式支持上下文标识符(Context Identifier),允许客户端在复用同一个长连接的同时,通过上下文级别的 Cancel 信号直接熔断单条发音,并支持实时返回精确到单词和音素级别的时间戳事件。当 Agent 连续并发推送多个语义短语、需要精准停掉其中某一句并精确对齐前端播放渲染时,该能力十分便利。
在指标透明度方面:在本次对比核查中,其关于 Sonic-3.6 的公开页面并未明确列出经过审计的最新 TTFA 毫秒数值。历史早期版本 Sonic 公布的延迟数据不能草率套用在 3.6 版本上。因此,尽管其通信架构设计极为优秀,但在缺乏最新公开延迟数据的背书下,其综合排位屈居前列厂商之后。
计费模式采用积分制,官方页面默认展示年付价格。折算的音频分钟数仅供初期测算,最终需以真实业务中的调用量换算为准。
最佳适用: 需要基于 Context ID 进行精准取消、且重度依赖音素级时间戳的研发团队。
核心亮点: 支持字级与音素级时间戳,提供精细化的上下文取消信令。
定价模式: 免费档位包含约 27 分钟额度;年付付费档位起步价为 $4/月。
免费试用: 有。Free 档位提供每月 20,000 积分,页面标注约折合 27 分钟 TTS 时长。
Cartesia 阶梯定价一览
- Free: $0/月,约 27 分钟 TTS 时长,支持 2 路并发。
- Pro: 年付折算 $4/月,约 133 分钟时长,支持 3 路并发。
- Startup: 年付折算 $39/月,约 1,667 分钟时长,支持 5 路并发。
- Scale: 年付折算 $239/月,约 10,667 分钟时长,支持 15 路并发。
- Enterprise: 商业定制积分、Agent 专有方案、梯度单价与并发配额。
Cartesia 的模型名称与计费体系相当透明,但在关键的 TTFA 宣发上相对保守。建议必须在目标机房区域针对该模型进行实地网络与播放延时压测。
- WebSocket 上下文隔离机制让会话熔断与发音状态管理格外清晰。
- 单词与音素级时间戳,为前端精准对齐播放提供了底层支持。
- 免费计划能够快速推进技术原型开发。
- 付费方案不限制团队席位数量。
- 当前核验页面未找到明确归属于 Sonic-3.6 的公开 TTFA 延迟数值。
- 官网展示的优惠月费需按年计费绑定。
- 在进入 Enterprise 定制前,公开套餐最高仅支持 15 路并发。
总结: Cartesia 属于底层架构扎实的备选方案。只有当团队在目标机房实测其 p95 延迟确实超过头部选手时,才建议将其提到更高顺位,切勿盲信旧版本的历史跑分。
6. Hume Octave 2:兼顾情感表现力与动态感知
Hume Octave 2 是本次对比中专攻拟真人性化表达的特殊选手,适合那些对情感共鸣与语气起伏要求极高、而非单纯追求绝对低延迟的语音 Agent。

Hume 的 Octave 文档 当前将 Octave 2 标注为预览版(Preview)。官方公布的模型侧纯推理延迟约为 100 ms(不含网络传输),而在 Instant 极速流式模式下,受负载与输入复杂度影响,客户端实际拿到首包音频的时间通常在 200 ms 左右。这两个指标有本质区别,后者更能体现业务系统在注入自身播放缓冲前的真实体感。
在预览阶段,该模型已支持英语、日语、韩语、西班牙语、法语、葡萄牙语、意大利语、德语、俄语、印地语和阿拉伯语。模型支持用短短 15 秒的声音片段进行音色克隆,API 同时提供了 HTTP 响应流、双向 WebSocket 长连流式传输以及非流式接口。
Hume 能在横评中占据一席之地,在于其卓越的语义理解与情绪渲染能力。心理陪伴类 Agent、AI 导师或具有极高品牌温度的客服场景中,语速微调、重音停顿所带来的情感张力往往是商业闭环的核心。单纯机械的预约排期通知则完全无需承担这种延迟折损。
最佳适用: 心理辅导、虚拟陪伴、情绪安抚及重度拟人化 IP 交互场景。
核心亮点: 情绪渲染能力优秀,Octave 2 预览版模型端延迟约 100 ms。
定价模式: 免费档位包含约 10 分钟时长;付费方案在企业定制前横跨 $3 至 $500/月。
免费试用: 有。Free 档位每月提供 10,000 字符额度与 1 路并发连接。
Hume 阶梯定价一览
- Free: $0/月,包含 10,000 字符(约 10 分钟),限速 15 RPM,支持 1 路并发。
- Starter: $3/月,包含 30,000 字符(约 30 分钟),限速 15 RPM,支持 5 路并发。
- Creator: $14/月(首月优惠价 $7),包含 140,000 字符(约 140 分钟),超额后 $0.15/1K 字符,限速 75 RPM,支持 5 路并发。
- Pro: $70/月,包含 100 万字符(约 1,000 分钟),超额后 $0.12/1K 字符,限速 75 RPM,支持 10 路并发。
- Scale: $200/月,包含 3.3 百万字符(约 3,300 分钟),超额后 $0.10/1K 字符,限速 150 RPM,支持 20 路并发。
- Business: $500/月,包含 1000 万字符(约 10,000 分钟),超额后 $0.05/1K 字符,限速 225 RPM,支持 30 路并发。
- Enterprise: 商业定制调用额度、速率限制及并发路数。
该价格曲线利于前期低成本摸索,但 Creator 档位超额资费相对较高。业务放量后,Business 档位超额单价才会降至 $0.05/1K 字符——与 ElevenLabs Flash 标准单价持平,但其底层需背负 $500 的月费门槛以及完全不同的声音特性定位。
- 细腻的情绪语调表达能力在该领域具备明显差异化壁垒。
- 同时支持 HTTP 流式与双向 WebSocket 实时推流。
- 最短仅需 15 秒音频样本即可展开音色克隆。
- Free 和 Starter 方案让验证情绪 Agent 原型的门槛极低。
- Octave 2 目前仍处于 Preview 预览状态。
- Instant 模式下实际生成首包音频耗时往往在 200 ms 左右,高于纯模型标注的 100 ms。
- Creator 档位超额部分字符成本高达 $0.15/1K 字符。
总结: Hume 绝非速度取胜的选手,但它也不以此为卖点。只有当 Agent 极具温度的情感表态能直接推动留存率、信任度或付费转化,且平淡的声音无法满足需求时,才应接受其相对较高的首包延迟。
7. Gradium:欧美区域一体化语音技术栈方案
对于希望统一采购 TTS 和 STT、依靠多区域就近智能路由并采用一揽子资费套餐的架构师,Gradium 是一套省心的务实解法。

Gradium 官方 API 参考文档 显示,其同时支持 REST 与 WebSocket 接口接入。请求走统一 API 域名,后台根据客户端位置自动调度至就近的欧盟(EU)或美国(US)集群进行计算。官方承诺欧盟流量完全在欧洲境内处理,美国流量留在美国本土,从而为跨大西洋业务大幅简化了原本需要根据合规政策自行调度多套 Endpoints 的工程负担。
计费采用月度统一积分制,而非单一字符计价。生成 1 个 TTS 字符扣除 1 点积分,官方将约 45,000 字符折算为 1 小时音频。如果业务同时重度依赖语音转写(STT)或多语言翻译,全家桶额度共享机制会非常划算;但若仅评估纯 TTS 调用,横向价格对比就会显得不够直接。
免费层最核心的限制在于商用版权:Free 档位虽开放 API 接入并提供约 1 小时 TTS 额度,但明确禁止商用。月费 $13 的 XS 套餐是公开体系中支持商业运营的最低起点。
最佳适用: 需要在欧美两地同时部署、且期望单一套件搞定语音识别与合成的企业。
核心亮点: 统一域名入口,全自动按地理位置调度至欧盟或美国集群。
定价模式: 免费版仅供非商用;商用付费套餐起步价为 $13/月。
免费试用: 有。Free 包含 45,000 点额度,折大约 1 小时 TTS 时长,提供 2 路并发。
Gradium 阶梯定价一览
- Free: $0/月,45,000 积分,约 1 小时 TTS,2 路并发,开放完整 API,但禁止商用。
- XS: $13/月,225,000 积分,约 5 小时 TTS,5 路并发,允许商业用途。
- S: $43/月,900,000 积分,约 20 小时 TTS,5 路并发,允许商用。
- M: $340/月,900 万积分,约 200 小时 TTS,10 路并发,允许商用。
- L: $1,615/月,4,500 万积分,约 1,000 小时 TTS,15 路并发,允许商用。
- Enterprise: 商业定制,支持不限额度扣减与超高并发。
额外加购积分包(每 100,000 积分)的阶梯资费为:XS 档位 $6.90,S 档位 $5.00,M 档位 $4.00,L 档位 $3.80。承诺的套餐包越大,超额单价越低,但这也意味着真实综合单价直接取决于业务的实际资源消耗率。
- REST 与 WebSocket 双协议收敛在统一的 API 规范之下。
- 自动化按地域将流量透明转发至欧盟或美国集群计算。
- TTS、STT 与多语言翻译共用同一套积分池,结算方便。
- $13 起步的 XS 计划以极低门槛提供了正规商用 API 权限。
- 免费计划严格限制非商业用途。
- 官网当前核验页面未直接公布最新精确的 TTFA 数据。
- 积分打包计费模型难以直观对比纯 TTS 业务的单位字符成本。
总结: Gradium 适合技术栈聚合型诉求,而非追求单项极限低延迟的场景。当区域合规数据隔离与全栈语音组件收敛能够带来的运维节省,超过了追求极致毫秒级延迟的价值时,它应当进入候选名单。
8. OpenAI GPT-4o Mini TTS:深度绑定 OpenAI 架构时的便捷路径
对于整个业务链路已经完全围绕 OpenAI API 进行构建与标准化交付的团队,OpenAI GPT-4o Mini TTS 是一套集成代价最小的顺手之选。

该模型通过 官方语音接口 接收文本并输出音频。接口支持直接推流音频或返回 Server-Sent Events (SSE) 事件流,内置 13 种预设音色并支持自定义 Voice ID,同时支持 MP3、Opus、AAC、FLAC、WAV 和 PCM 等丰富的编码格式,播放语速可在 0.25 到 4.0 之间自由调节。
主要信息缺失在于官方当前的实际 TTFA 指标。OpenAI 官方模型页面并未披露具体的首包音频耗时,因此仅凭官方文档无法将其排入顶尖低延迟阵营。它能入选,完全是因为它提供了原生流式传输,且在已有 OpenAI 依赖的项目中复用现有密钥管理、可观测性监控和商务结算通道,能带来明显的运维减负。
其计费模式同样难以与常规按字符收费的厂商平视对比。OpenAI 按输入文本 token($0.60/1M tokens)与输出音频 token($12/1M tokens)组合计费。尽管综合资费在承受范围之内,但采购核算时必须基于真实的 token 消耗抽样统计,而不能简单套用字符单价公式。官方模型页面限制单次请求最高输入 2,000 text tokens。
最佳适用: 已全面基于 OpenAI 基础设施构建、且看重供应商精简度超过追求极致延迟报告的团队。
核心亮点: 音频格式丰富、支持多种推流模式、内置语气指令(Voice Instructions),免去新引入供应商的商务与技术成本。
定价模式: $0.60/1M 输入文本 tokens + $12/1M 输出音频 tokens。
免费试用: 无。该模型不提供免费体验层(Free usage tier)。
OpenAI 账户梯度与调用配额一览
根据 GPT-4o Mini TTS 官方文档,该模型不支持 Free 账户调用。不同绑卡充值梯度对应的限速为:Tier 1 允许 500 RPM 与 50,000 TPM;Tier 2 提升至 2,000 RPM 与 150,000 TPM;Tier 3 允许 5,000 RPM 与 600,000 TPM;Tier 4 允许 10,000 RPM 与 200 万 TPM;Tier 5 允许 10,000 RPM 与 800 万 TPM。
这些梯队代表并发配额而非月租订阅。工程的核心权衡在于:采用基于 token 计费的音频接口与单一供应源带来的架构极简性,能否弥补其在字符单价透明度与语音 Agent 专有打断协议方面的相对不足。
- 官方 Speech 接口原生支持原始音频流与 SSE 事件流推送。
- 支持 6 种输出音频格式与 13 种内置音色,开箱即用。
- 复用现有的 OpenAI 账号、治理工具和密钥基础设施,大幅降低管理运维成本。
- 支持 Voice Instructions,无需切换提供商即可对发音语气进行调控。
- 官方未公布审计过的一手 TTFA 延迟数据。
- Token 计费模式相比按字符计费的竞品更难精准预测预算。
- 不支持免费调用尝试。
总结: 如果项目目标是砍掉外部多余的供应商依赖,OpenAI 可以保留在备选名单中。但在真实通话链路跑出过硬的数据之前,不要盲目推定其端到端延迟能超越专业级音频提供商。
50,000 分钟合成音频的真实成本账单
为了公平横向对比各家公有云按量付费成本,我们使用统一的字符换算基准进行测算。参考 Inworld 官方的换算标准,1 分钟语音约折合 1,000 个字符,因此 50,000 分钟合成时长等价于 5000 万字符。该测算旨在建立统一情境下的成本量级体感,并非绝对的实际开票数字。
在此基准下:
- Inworld Flash On-Demand 按 $15/1M 字符计算,费用为 $750/月。
- Rime Mist v3 按 $0.03/1K 字符计算,费用为 $1,500/月。
- 促销期结束后的 Deepgram Flux Pay As You Go 按 $0.045/1K 字符计算,费用为 $2,250/月。
- ElevenLabs Flash 按 $0.05/1K 字符计算,费用为 $2,500/月。

切忌脱离系统工程实际,把单纯的成本差额当成唯一的选型依据。一个字符单价便宜但频繁导致重复播报、念错银行卡号、或者需要研发团队耗费数周去手写状态机打断补偿机制的音色,最终产生的技术和业务代价将远超节省下的账面费用。反过来,如果不加验证地盲目为大牌供应商支付品牌溢价,也是技术选型上的懒惰。
该测算包含三项前提假设:第一,不同语种、不同语速和标点符号密度下的每分钟真实字符数存在波动;第二,各家的保底预存积分套餐会带来最低月度消费承诺,但能解锁更低的超额单价;第三,企业级商务折扣通常一事一议。在签署任何年度商业合同前,务必提取至少一周的真实生产 Agent 对话历史,运行字符与 token 统计脚本进行精准推算。
方案选型决策矩阵
如果业务场景以英语为主且用户插话打断非常频繁,首选 Deepgram Flux TTS。其原生返回的已播报与未播报状态隔离机制是决定性的架构优势。
如果在意公开透明的尾部延迟百分位数、业务语种落在其支持的 4 种语言之内、且业务层无需依赖单词级时间戳,首选 Rime Mist v3。请注意将流媒体机房尽可能就近部署在用户侧,以防物理网络往返损耗抹平模型本身的延迟优势。
如果同一个 Agent 必须在全球几十个国家无缝切换母语沟通,或者字符采购预算面临严苛的财务管控,首选 Inworld TTS-2 Flash。在 5 万分钟的标准场景下,其公开按量计费策略能给财务留出最大的缓冲空间。
如果企业期望直接复用成熟完备的多语言语音资产与控制台体验,且希望从个人免费验证平滑过渡到企业级方案,首选 ElevenLabs Flash v2.5。但必须在业务网关层针对所有数字、日期、金额、兑换码和地址强制做好文本口语化规范。
如果通话播放架构对于实时取消、词级/音素级时间戳有高精度控制需求,首选 Cartesia Sonic-3.6。请务必在真实生产环境中独立运行延迟实测,不要沿用历史旧版本的评测数字。
如果情绪起伏与人性化温度直接决定了业务的转化、留存或品牌壁垒,首选 Hume Octave 2。请提前评估 Preview 阶段的稳定性,并做好接受其相对较高的首包音频响应时间的准备。
如果需要由单一提供商搞定 TTS 与 STT 双向流水线、需要欧美本地就近数据合规隔离,首选 Gradium。任何正式商业验证请直接从 $13 的 XS 套餐起步,因为 Free 档位明确禁止商用。
如果系统已重度集成 OpenAI 生态,且省去一家外部供应商的商务与系统接入成本超过了专业音频厂商带来的边际收益,首选 OpenAI GPT-4o Mini TTS。请直接用真实网络环境跑出端到端延迟,切勿将大厂品牌光环等同于超低延迟表现。
决定终局选择的往往是这个核心问题:当用户在一句关键业务陈述的中途突然插话打断,系统会发生什么? 如果答案是“客户端只能靠本地播放时间去盲猜到底播放到了哪个字”,那么在挑选声音音质之前,请务必先补齐这个致命的架构漏洞。
生产落地的避坑指南
Pika Speech:长音频生成迅速,但目前并不适合实时流式交互
Pika Speech 是一款出色的长音频旁白与声音克隆模型,但其目前的 API 协议并不适合以超低延迟为核心指标的交互式语音 Agent。

根据 Pika 2026 年 8 月 18 日的技术发布说明,在本地运行的 3 分钟测试中,其 Real-time Factor (RTF) 达到了惊人的 0.02。在其长音频基准测试下,生成 1 分钟语音仅耗时约 1.2 秒。该模型输出 48 kHz 高清音频,支持基于 5 秒样本进行音色克隆,单次请求最大支持 5 分钟语音生成。
这代表了出众的长音频批处理吞吐能力,但绝不代表终端用户能在几十毫秒内听到第一个音节。
在 Pika Speech 实时 API 文档 中,官方在适用边界部分明确注明“不适用于实时流式合成”。客户端提交 POST 请求后仅返回一个排队任务 ID,随后必须靠轮询(Poll)等待整段生成完成。根据厂商 2026 年 8 月 14 日公开的测试表,Pika Speech 定价折合每分钟语音仅 $0.01,这在大规模异步长文本配音中极具竞争力,但这种非实时的通信协议在多轮人机交互通话场景下直接失去了入围资格。
最佳适用: 音频旁白、视频配音、长文本高吞吐音频离线批量生成。
核心亮点: 在官方测试基准下生成 1 分钟音频仅需约 1.2 秒。
定价模式: 厂商 8 月基准测试表标注为每生成分钟 $0.01。
免费试用: 核验页面未标注明确的免费体验政策。
- 在官方长音频基准测试下,整体批量吞吐生成极快。
- 48 kHz 高保真音质与 5 秒超短样本克隆,非常贴合内容创作。
- 标称每分钟 $0.01 的费率在离线生成领域具有价格优势。
- 当前 API 明确不支持实时流式合成。
- 采用异步提交、任务排队与状态轮询机制。
- 优秀的批量长音频生成吞吐量完全无法换算为低延迟首包音频响应。
总结: 目前请将 Pika 用于离线异步音频任务。只有当其公开发布了支持原生推流且具备可审计 TTFA 指标的实时接口时,才可考虑将其引入交互式 Agent 架构。
谨防将“免费无上限”当作生产依赖
横评中多家供应商确实提供了可观的赠送金额或每月免费额度,但在此次核查的所有一手官方页面中,没有任何一家承诺提供永久免费、不限用量且保障低延迟 SLA 的生产级接口。免费档位通常附加了严苛的约束,例如禁止商用、极低的并发上限、不保证可用性或极小的字符配额。
在技术原型跑通前,就必须对正价付费方案做好资金预算,否则业务暴增带来的不是成功,而是突发生产事故。
延迟敏感型场景应果断避开非必要的“高表现力”大模型
主流厂商如今普遍将其模型体系分化为两类:一类主打对话低延迟,另一类侧重高表现力或离线长文本。在对响应时效要求极高的通话中,选用 ElevenLabs 请认准 Flash 而非反应较慢的模型;在 Rime 中首选 Mist 而非更重的 Coda;在 Inworld 中若追求性能与成本,应优先选择 Flash 而非 TTS-2。切勿为电话网络物理通道根本无法体现的声音细节,盲目承担长达数百毫秒的延迟惩罚。
下周一的落地行动建议
建议安排一次实战验证测试:圈定 Deepgram Flux、Rime Mist、Inworld Flash 和 ElevenLabs Flash 这四款产品,在保持语言模型输出、媒体流服务、服务器机房区域、电话运营商信令、音频编解码格式以及客户端播放缓冲等全部上下文变量绝对一致的前提下,展开五大业务场景的横向盲测。
这五个测试场景应当专门针对系统漏洞进行覆盖:
- 简短问候语: 暴露单纯空载状态下的首包音频(TTFA)物理延迟底线。
- 长篇回复中途打断: 在句子播报到一半时插入杂音与语音,验证状态机能否精准剥离已读与未读文本。
- 复杂实体混杂语句: 话轮中刻意包含人名、特定月份日期、货币数字、联系电话及复杂英数字母混合验证码,测试规范化能力。
- 非均匀流式推送: 模拟真实 LLM 推理卡顿时,大小不一的文本切片送入 TTS 对音频连续性的冲击。
- 脉冲并发压测: 模拟线上早晚业务高峰,直接冲击预计的最高并发路数,观察长尾延迟劣化幅度。
在测试过程中,全程埋点记录:文本就绪时刻、接收到首字节时刻、首帧音频入队时刻、首帧扬声器播报时刻、p50 TTFA、p95 TTFA、打断逻辑判定是否正确,以及用户端实际听到的字符转录记录。只有当候选方案完全通过了严苛的延迟达标线与打断状态机校验后,再去评审音质好听与否。
紧接着,将生产环境预估的字符体量代入各家实际能买到的最低价格阶梯中核算总账。周一的架构决策绝不是讨论“哪家 Demo 的声音听起来最自然”,而是验证“哪家活下来的系统能用最低的月度综合成本,支撑起高准确、抗打断的真实语音通话业务”。
如果 Deepgram 能覆盖业务语种,其原生打断状态追踪使其成为默认之选;若是跨国多语言场景,优先压测 Inworld 与 ElevenLabs;如果以追求极低 TTFA 为首要指标,将 Rime 保留在最终决赛圈。花上一天时间踏踏实实跑完端到端真实数据,远比对着各家官网的花哨形容词纠结数周更有成效。
常见问题(FAQ)
目前用于语音 Agent 最好的文本转语音(TTS)API 是哪一款?
在本次横向对比中,对于英语语音 Agent 而言,综合表现最佳的是 Deepgram Flux TTS,因其将低首包音频延迟与原生的打断状态管理协议进行了深度整合。若业务更看重 200+ 种语言覆盖或极低的按量字符单价,Inworld 是更好的选择;而 Rime 则在透明的低延迟指标上具备特长。
市面上存在免费的低延迟 TTS API 吗?
存在,但多为测试额度。Deepgram 提供 $200 赠送金,并在 2026 年 9 月 12 日前对 Flux 开启限时免费;Inworld 在 On-Demand 方案中提供最高 70 分钟额度;ElevenLabs 提供 20,000 字符 Flash 额度;Cartesia 赠送约 27 分钟时长;Hume 赠送约 10 分钟;Gradium 提供约 1 小时但仅限非商用。这些均为原型开发体验额度,无法支撑无上限的免费商用生产。
目前计费最便宜的低延迟 TTS API 是哪家?
在 5000 万字符(约折合 50,000 分钟音频)的公开按量付费测算场景下,Inworld Flash On-Demand 是入围的四款按字符计价产品中最经济的,月费仅需 $750。由于企业级折扣、保底承诺积分、语种分布及每分钟实际字符密度均会影响最终开票总额,正式签约前请基于真实对话历史进行测算。
目前表现最佳的本地私有化部署 TTS 模型是哪款?
本地自建或私有化托管模型属于完全不同的采购架构。Deepgram Flux 与 Rime 均在文档中提供了私有化部署通道,但最终体验取决于所拥有的 GPU 硬件算力、并发峰值、模型授权条款以及团队运维长连流式服务的能力。建议在自备的目标计算集群上直接压测 TTFA 与实时生成因子(RTF)。
低延迟 TTS API 可以在 Android 移动端运行吗?
可以。安全规范的做法是将厂商 API 密钥存放在业务服务端,由后端向客户端转发已生成的流式音频,并在移动设备本地埋点记录从发起到扬声器发声的真实延迟。切勿将密钥明文硬编码进客户端 App;此外,移动端的公网抖动与底层播放器缓冲往往比服务商模型推理延迟对体感的影响更大。
获取面向业务决策者的 AI 工具全景图谱,免去重复调研的周折,系统化对比语音 Agent 体系中的其余关键技术组件。
2026年9月3日







