Лучшие low latency text to speech API для голосовых агентов в 2026 году
Сравнение 8 low latency text to speech API для голосовых агентов: задержка TTFA, стриминг, перебивание (barge-in), цены и продакшн-ограничения.

Deepgram Flux TTS — лучший low latency text to speech API общего назначения для голосовых агентов в 2026 году: заявленная задержка до первого аудиобайта от 80 ms подкреплена нативной обработкой прерываний (barge-in), а не просто быстрым синтезом. Pika может сгенерировать минуту аудио 48 kHz примерно за 1.2 секунды, но ее текущий API асинхронен и прямо не предназначен для real-time стриминга, поэтому красивый заголовок не сделает телефонный разговор быстрее.
Краткий ответ
Выбирайте Deepgram Flux TTS для англоязычного голосового агента, если собеседники часто перебивают речь, меняют тему и ожидают, что агент помнит, на каком слове его прервали. Цифра задержки у него не самая маленькая на этой странице. Его преимущество в том, что стриминговый протокол точно сообщает, какой текст пользователь услышал, а какой был обрезан, защищая контекст диалога при barge-in.
Выбирайте Rime Mist v3, если вам важнее всего прозрачные отчеты по перцентилям задержки и сверхбыстрое первое аудио. Выбирайте Inworld Realtime TTS-2 Flash, когда ключевую роль играют многоязычность и низкая стоимость за символы. Выбирайте ElevenLabs Flash v2.5, если зрелая многоязычная экосистема голосов перевешивает более высокий тариф за символы и необходимость вручную нормализовать текст.
Цены ниже проверены на официальных сайтах провайдеров 26 августа 2026 года. «Стартовая цена» обозначает минимальный публичный порог входа, а не реальный чек в продакшне.
Правило выбора простое: корректность обработки перебиваний важнее изолированной цифры миллисекунд. Как только пара кандидатов корректно отрабатывает ваш сценарий barge-in, сравните p95 времени до первого аудио через реальный маршрут телефонии, а затем оцените итоговую стоимость и звучание голоса. Провайдер может выиграть серверный бенчмарк, но провалить реальный звонок из-за сетевых задержек, буферизации, перекодирования звука или сбившегося прерывания.
Если вам нужна готовая платформа «все в одном», а не компонентный API, начните со сравнения платформ для голосовых агентов. Если же задача сводится к озвучке, доступности или генерации аудиофайлов, обратитесь к более широкому руководству по text-to-speech.
Как отбирались эти API
Это выверенное сравнение фактов, а не отчет об одновременном синтетическом тестировании в изолированной лаборатории. Каждое название модели, публичный тариф, лимит, транспортный протокол и заявленная задержка взяты с официальных страниц провайдеров по состоянию на 26 августа 2026 года. Рейтинг оценивает эти данные с точки зрения продакшн-требований к голосовым агентам на базе нейросетей.
Эта разница принципиальна: публикуемые числа задержек измеряют разные отрезки. Inworld заявляет серверное P90 времени до первого аудиобайта без учета сети. ElevenLabs публикует приблизительную задержку самой модели, исключая сетевые и прикладные задержки. Rime показывает P50 и P90 времени до первого звука при заданной конкурентности и отдельно оценивает региональный сетевой round-trip. Deepgram заявляет время «вплоть до» 80 ms. Hume разделяет задержку модели около 100 ms и примерно 200 ms до первого аудио в режиме instant mode.
Эти метрики полезны внутри системы каждого вендора, но не образуют единый сквозной бенчмарк.
Итоговый порядок определили пять критериев:
- Первое воспроизводимое аудио: Таймер запускается в момент готовности текста у агента и останавливается, когда собеседник слышит первый звук. Время генерации целого файла — совершенно другая метрика.
- Контекст прерывания (Barge-in): В реальном звонке нужно четко знать, что именно успело прозвучать, что не прозвучало, и что языковая модель должна сохранить в памяти после перебивания.
- Стриминговый транспорт: Персистентные сокеты WebSocket, прогрессивная передача текста, отмена потока и пригодные телефонные форматы звука могут сэкономить больше задержки, чем оптимизация модели на несколько миллисекунд.
- Экономика продакшна: Реальный счет складывается из объема сгенерированных символов или токенов, минимальных платежей и особенностей тарифных планов, а не из самой дешевой строчки на лендинге.
- Технические барьеры: Поддержка языков, нормализация чисел, лимиты параллельных потоков, статус preview, форматы аудиокодеков, коммерческие права и неясные условия бенчмарков меняют итогового лидера.
Качество голоса критично, но оценивается только после исключения технических сбоев. Голос с безупречным тембром, который стартует с опозданием, ошибочно читает номер счета или продолжает говорить поверх реплики клиента, не годится для голосового агента.

1. Deepgram Flux TTS: лучший выбор для голосовых агентов
Deepgram Flux TTS лидирует в общем зачете, потому что протокол для голосовых агентов воспринимает прерывание как смену состояния, а не просто как команду «стоп».

В журнале релизов Deepgram указано время до первого аудио вплоть до 80 ms, но главное продакшн-улучшение появилось вместе со статусом General Availability 12 августа 2026 года. В активном WebSocket-соединении сообщение Interrupt прерывает текущую реплику. Событие SpeechInterrupted возвращает text_spoken и text_remaining. Это позволяет агенту обновить контекст на основе того, что человек реально услышал, а не угадывать по таймингам аудиоплеера.
Представьте сценарий: агент проверки баланса начинает говорить «Ваш остаток составляет две тысячи восемьсот...», но клиент перебивает его вопросом о платеже. Обычная команда отмены оборвет аудиодорожку, но LLM в бэкенде может считать, что сумма баланса была названа полностью. Flux дает приложению точную границу для корректировки состояния. Итог для бизнеса — меньше повторов, отсутствие противоречивых реплик и отказ от сложного трекинга воспроизведения на клиенте.
Flux также сохраняет контекст диалога между репликами через WebSocket v2 Speak. Это помогает, когда тон ответа должен оставаться спокойным после претензии клиента или становиться лаконичным при частых перебиваниях. Это гораздо лучше подходит для многошагового диалога, чем дикторские модели, генерирующие каждую фразу как изолированный фрагмент.
Главное ограничение — масштабирование по языкам. На этапе GA каталог включает 36 голосов на английском языке с 7 акцентами. Если для запуска требуется мультиязычность, вперед выходят Inworld или ElevenLabs. Кроме того, Flux по умолчанию отдает несжатый поток linear16, mulaw или alaw в стандартной интеграции Voice Agent без метаданных контейнера. Для телефонии это оптимум, но если вашей инфраструктуре нужны форматы MP3, Opus, FLAC, AAC или WAV «из коробки», придется перенастроить стек или выбрать линейку моделей Aura.
Лучший выбор для: Англоязычной поддержки, назначения встреч, квалификации лидов и звонков с регулярным перебиванием.
Главное преимущество: Нативный возврат сказанного и несказанного текста при прерывании.
Цены: Flux бесплатен до 12 сентября 2026 года; стандартный Pay As You Go стоит $0.0450 за 1,000 символов, Growth — $0.0405 за 1,000 с 13 сентября.
Пробный период: Да. Тариф Pay As You Go включает стартовый кредит $200 без минимального порога и без ограничения по сроку действия.
Тарифные планы Deepgram
На странице цен Deepgram доступны три коммерческих варианта. Pay As You Go начинается со стартового кредита $200 и поддерживает до 45 параллельных REST или WebSocket подключений TTS. План Growth стартует от $4,000 предоплаченных кредитов в год и поднимает планку параллельных TTS-сессий до 60. План Enterprise рассчитывается индивидуально под крупные объемы, выделенные инсталляции, специальные требования к данным или расширенный SLA.
Цены зависят и от выбранной модели. После окончания промо-периода Flux на Pay As You Go обойдется в $0.0450 за 1,000 символов, а на Growth — в $0.0405. Aura-2 стоит $0.030 и $0.027 соответственно. Aura-1 обойдется в $0.0150 и $0.0135. Модели Aura привлекательны для менее интерактивных сценариев, но они лишены разговорного механизма обработки прерываний Flux.
- Нативные события barge-in возвращают точно сказанный и оставшийся текст.
- Контекст диалога передается между репликами без сброса на каждом шаге.
- Заявленное время до первого звука — от 80 ms.
- Поддерживаются варианты Cloud, VPC, on-prem и self-hosted под жесткие требования безопасности.
- Flux пока работает только с английским языком.
- Дефолтный пайплайн для голосовых агентов отдает только потоки linear16, mulaw и alaw.
- Базовые расценки Flux за знаки выше, чем у Rime Mist и Inworld Flash.
Практическая настройка Flux
Откройте постоянный транспорт
Подключите агента к v2 Speak WebSocket и держите сессию открытой на протяжении всего разговора. Не делайте отдельный REST-запрос на каждое предложение.
Выберите кодек под телефонию
Укажите linear16, mulaw или alaw в соответствии со своей АТС или голосовым шлюзом. Исключите этап перекодирования на горячем пути, если провайдер телефонии принимает эти форматы напрямую.
Стримите текст логическими частями
Отправляйте законченные синтаксические конструкции по мере их генерации языковой моделью. Части фразы достаточно, чтобы ИИ звучал естественно, не дожидаясь генерации всего абзаца.
Связывайте прерывание с памятью агента
Когда собеседник перебивает, отправьте сигнал Interrupt. В контексте диалога замените запланированную реплику агента значением text_spoken, а text_remaining сбросьте до следующего ответа модели.
Замеряйте задержку на стороне клиента
Фиксируйте время готовности текста, получение первого байта, постановку первого фрейма в очередь и его воспроизведение. Оптимизируйте самое медленное звено на перцентиле p95 вместо ориентации на идеальные цифры из промо-материалов.
Вердикт: Deepgram занимает первое место, поскольку его API сохраняет целостность контекста при прерываниях. Рассматривайте альтернативы, если критически важна мультиязычность или минимальная стоимость за символы.
2. Rime Mist v3: лидер по прозрачности бенчмарков с низкой задержкой
Rime Mist v3 занимает второе место благодаря самой детальной и полезной для инженеров раскладке задержек в этом обзоре.

Документация по задержкам Rime фиксирует для Mist v3 время до первого звука на уровне 37 ms P50 и 56 ms P90 при одном активном запросе. При 12 одновременных запросах показатели сохраняются: 37 ms и 56 ms. На той же странице можно сравнить показатели модели Coda: 96 ms P50 и 98 ms P90 при одном запросе, с ростом до 150 ms и 181 ms при нагрузке в 12 параллельных сессий.
Это гораздо полезнее единственной идеальной цифры, поскольку наглядно демонстрирует поведение хвоста распределения под нагрузкой. Однако это все еще не сквозная задержка звонка. Rime указывает, что типичный round-trip сети добавляет от 25 до 50 ms по большей части США при подключении к ближайшему региону, а при маршрутизации на противоположное побережье — от 60 до 85 ms. Дальше в цепочке находятся медиасервер, аудиобуфер и оператор связи.
Mist ориентирован на предельную скорость; Coda предлагает более широкий выбор языков и метаданных. Mist поддерживает английский, французский, немецкий и испанский языки с 94 голосами. Coda поддерживает 8 языков в продакшне и 184 голоса. Обе модели стримят звук через HTTP и WebSockets, но Coda возвращает временные метки слов (timestamps), а Mist — нет. Если приложению нужны точные границы слов для синхронизации, отсутствие таймстемпов в Mist может перевесить выигрыш в задержке TTFA.
Лучший выбор для: Команд, которым необходимы подтвержденные перцентили задержки и достаточно четырех языков модели Mist.
Главное преимущество: Открыто опубликованные P50 и P90 TTFA при 1 и 12 параллельных запросах.
Цены: Mist v3 стоит $0.03 за 1,000 символов; Coda — $0.05 за 1,000.
Пробный период: Да, но на сайте Rime есть разночтения по объему включенных минут.
Тарифные планы Rime
Тариф Starter предлагает $0.03 за 1,000 символов для Mist и $0.05 для Coda, не требует привязки карты и разрешает до 20 одновременных генераций TTS. План Enterprise рассчитывается индивидуально: он включает неограниченное число параллельных сессий, неограниченное клонирование голосов, SLA, выделенную поддержку, а также варианты развертывания в cloud, on-prem или VPC.
В описании Starter на сайте указано «около 800 бесплатных минут», а в блоке FAQ на той же странице — «3,000 бесплатных минут». Наличие приветственного лимита подтверждено, но точный объем стоит уточнять по факту начисления в личном кабинете.
- Публикуются медианные (P50) и хвостовые (P90) показатели TTFA под нагрузкой.
- Результаты 37 ms P50 и 56 ms P90 выделяются среди конкурентов.
- Поддерживается стриминг через HTTP и WebSocket.
- Enterprise позволяет развертывание в VPC или on-premise.
- Mist ограничен 4 языками и не отдает пословные таймстемпы.
- Сетевой маршрут может добавить больше задержки, чем время инференса самой нейросети.
- На странице тарифов есть нестыковки по объему бесплатного пробного лимита.
Вердикт: Rime Mist — лучший узкоспециализированный инструмент по скорости. Ставьте его выше Deepgram, только если вашему сценарию не нужны детальные метаданные перебивания, а замеры в реальном сетевом контуре подтверждают преимущество по перцентилям.
3. Inworld Realtime TTS-2 Flash: лидер по стоимости масштабирования и числу языков
Inworld Realtime TTS-2 Flash — наиболее экономичное решение для мультиязычных голосовых агентов по стандартным публичным тарифам on-demand.

На странице TTS от Inworld заявлено P90 времени до первого аудиобайта на уровне 20 ms для Flash и 150 ms для более выразительной модели TTS-2. Эти показатели измерены на стороне сервера без учета сети, поэтому их нельзя напрямую сопоставлять со сквозными сетевыми оценками Rime или Hume. Практический вывод проще: Inworld оптимизировал Flash под мгновенный стриминг через WebSocket, и серверный инференс модели вряд ли станет узким местом при грамотной маршрутизации.
Языковой охват — сильная сторона платформы. Inworld поддерживает 200+ языков и умеет клонировать голос для всех этих языков по сэмплу от 5 до 15 секунд. Это идеальный вариант для службы поддержки, которой необходимо сохранить единую тональность бренда на разных рынках без поиска отдельных подрядчиков под каждый регион.
Разница в затратах тоже заметна. Тариф On-Demand для Flash составляет $15 за 1 миллион знаков против $30 за 1 миллион у Rime Mist, $45 у Deepgram Flux (после окончания акции) и $50 у ElevenLabs Flash. При нагрузке в 50 миллионов символов в месяц базовый счет составит всего $750 еще до обсуждения оптовых скидок.
Сложность кроется в тарифной сетке. Inworld оперирует ежемесячными пакетами кредитов, модельными коэффициентами, 6 уровнями подписки и разными лимитами параллельных сессий. Более низкая ставка за знак не гарантирует меньший счет, если обязательный объем кредитов выбранного тарифа превышает ваше реальное потребление.
Лучший выбор для: Высоконагруженных мультиязычных агентов и задач, где нужен один узнаваемый голос на десятках языков.
Главное преимущество: 200+ языков, WebSocket-стриминг и цена $15 за 1M символов на тарифе On-Demand для Flash.
Цены: Бесплатный старт; цена Flash снижается с $15 за 1M символов на On-Demand до уровня ниже $5 на Enterprise.
Пробный период: Да. On-Demand включает до 70 минут TTS.
Тарифные планы Inworld
В тарифной сетке Inworld кредиты расходуются на TTS, STT и работу языковых моделей:
- On-Demand: Бесплатный старт, включает до 70 минут TTS, стоимость Flash — $15 за 1M символов, TTS-2 — $25, до 5 параллельных сессий.
- Creator: $25 в месяц кредитами, Flash по $10 за 1M и TTS-2 по $20, до 10 параллельных сессий.
- Builder: $100 в месяц кредитами, Flash по $9 за 1M и TTS-2 по $17.50, до 50 параллельных сессий.
- Developer: $300 в месяц кредитами, Flash по $8 за 1M и TTS-2 по $15, до 150 параллельных сессий.
- Growth: $1,500 в месяц кредитами, Flash по $7 за 1M и TTS-2 по $12.50, до 500 параллельных сессий.
- Enterprise: Индивидуальные условия, где TTS-2 опускается до $5 за 1M символов, Flash — ниже $5 за 1M, с выделенными лимитами параллелизма.
В калькуляторе Inworld 1 минута сгенерированной речи приравнивается примерно к 1,000 символов. Используйте это допущение для базовых расчетов, но затем обязательно подставьте метрики своих боевых промптов: лаконичный бот для напоминания о задолженности и развернутый консультант расходуют совершенно разный объем символов в минуту.
- Серверное P90 времени до первого байта у Flash — 20 ms.
- Поддержка 200+ языков с кросс-языковым клонированием.
- Самая доступная публичная цена за знаки среди четверки лидеров по стоимости.
- Масштабирование параллелизма от 5 сессий на On-Demand до 500 на Growth.
- Публикуемая цифра задержки не учитывает сетевой транспорт.
- Структура из 6 уровней кредитных пакетов усложняет расчет итогового чека.
- Более эмоциональная модель TTS-2 стоит дороже и имеет более высокую задержку, чем Flash.
Вердикт: Inworld — вариант номер один для международных запусков и сценариев, где расходы на символы строго ограничены. Deepgram остается впереди для англоязычных звонков, где нативный контроль прерываний экономит больше часов разработки и бизнес-рисков, чем разница в тарифе.
4. ElevenLabs Flash v2.5: зрелая мультиязычная экосистема
ElevenLabs Flash v2.5 — самый надежный универсальный выбор, когда ключевыми факторами являются разнообразие каталога голосов, мультиязычность и знакомый API.

В документации ElevenLabs указана задержка около 75 ms для Flash v2.5 без учета задержек сети и приложения. Модель поддерживает 32 языка и лимит до 40,000 символов на запрос. Для голосового ассистента здесь ценна не изолированная цифра задержки, а баланс быстродействия, широкого покрытия языков, развитой платформы управления голосами и доступного тарифа pay-as-you-go.
Главный подводный камень связан с нормализацией текста. Во Flash нормализация чисел по умолчанию отключена ради минимизации задержки. Номера телефонов, даты и валюты могут читаться неожиданным для абонента образом. Клиенты уровня Enterprise могут принудительно включить нормализацию для v2.5. Всем остальным необходимо нормализовать такие данные на уровне системного промпта LLM перед отправкой в TTS.
Это не частный случай: бот техподдержки постоянно произносит номера заказов, даты, денежные суммы, адреса, коды верификации и телефоны. Если дата читается как гигантское число, быстрый синтез теряет всякий смысл. Закладывайте нормализацию в промпты и автотесты заранее, а не исправляйте на ходу после жалоб абонентов.
ElevenLabs занял четвертую строчку, поскольку оценка строится вокруг требований реального продакшна, а не популярности бренда. Сервис стоит предпочесть остальным, если для вас критичны проверенные мультиязычные пайплайны, но он уступает первой тройке, когда во главе угла стоят barge-in, открытые перцентили задержек или минимальная себестоимость за символы.
Лучший выбор для: Мультиязычных решений, которым требуется проверенная экосистема качественных голосов и простое подключение API.
Главное преимущество: Заявленная задержка модели около 75 ms при поддержке 32 языков.
Цены: Flash и Turbo стоят $0.05 за 1,000 символов.
Пробный период: Да. План Free / Pay As You Go включает 20,000 символов для Flash или Turbo.
Тарифные планы ElevenLabs
В прайс-листе API ElevenLabs представлены следующие опции:
- Free / Pay As You Go: $0, включает 20,000 символов Flash или Turbo.
- Starter: $6 в месяц со 120,000 символов.
- Creator: $22 в месяц (первый месяц $11) и 440,000 символов.
- Pro: $99 в месяц с 1,980,000 символов.
- Scale: $299 в месяц с 5,980,000 символов.
- Business: $990 в месяц с 19,800,000 символов.
- Enterprise: Индивидуальный расчет.
Стоимость Flash остается на уровне $0.05 за 1,000 символов на всех публичных тарифах API. Выбор плана влияет на объем включенных знаков, возможности аккаунта и лимиты запросов, а не на базовую ставку за символ.
- Flash v2.5 поддерживает 32 языка.
- Заявленное время работы самой модели — около 75 ms до накладных расходов.
- Бесплатный тариф позволяет полноценно протестировать интеграцию.
- Развитая платформа упрощает подбор и управление голосами.
- Автоматическая нормализация чисел, дат и валют по умолчанию выключена во Flash.
- Тариф $0.05 за 1,000 символов заметно выше расценок Inworld Flash.
- Заявленная задержка не учитывает задержки приложения и сети.
Вердикт: ElevenLabs — проверенный стандарт индустрии, но не безусловный лидер под любые задачи. Выбирайте его, когда качество голосов и привычный стек важнее переплаты за знаки, и обязательно настройте текстовую нормализацию до релиза.
5. Cartesia Sonic-3.6: контроль персистентных контекстов через WebSocket
Cartesia Sonic-3.6 отлично подходит разработчикам, которым требуется детальный контроль над контекстами WebSocket, отмена генерации на лету и события с таймстемпами.

В прайс-листе Cartesia фигурирует модель Sonic-3.6. Ее WebSocket API передает идентификатор контекста (context ID), а само соединение поддерживает отмену контекста, возвращая таймстемпы на уровне слов и фонем. Это необходимо, если бот отправляет текст отдельными частями, должен чисто оборвать конкретную реплику и требует точных метаданных воспроизведения.
При этом на проверенных страницах Cartesia не найдено официальной актуальной цифры TTFA конкретно для Sonic-3.6. Нельзя автоматически переносить показатели задержек старых версий Sonic на модель 3.6. По этой причине Cartesia стоит ниже вендоров с подтвержденными границами задержек, несмотря на продуманную архитектуру протокола.
Тарифы опираются на систему кредитов, а цены на сайте приведены с учетом годовой подписки. Расчетные минуты ориентировочные: они подходят для первичной оценки, но требуют проверки реальным объемом генерации до заключения договора.
Лучший выбор для: Разработчиков, которым нужны context ID, принудительная отмена реплик и поток таймстемпов через WebSocket.
Главное преимущество: Таймстемпы слов и фонем наряду с явной отменой контекстов генерации.
Цены: Бесплатный тариф дает около 27 минут; платные тарифы при годовой оплате начинаются от $4 в месяц.
Пробный период: Да. Бесплатный уровень включает 20,000 кредитов в месяц (около 27 минут TTS).
Тарифные планы Cartesia
- Free: $0 в месяц, около 27 минут TTS, 2 параллельных запроса.
- Pro: $4 в месяц при оплате за год, около 133 минут, 3 параллельных запроса.
- Startup: $39 в месяц при оплате за год, около 1,667 минут, 5 параллельных запросов.
- Scale: $239 в месяц при оплате за год, около 10,667 минут, 15 параллельных запросов.
- Enterprise: Индивидуальные пакеты кредитов, учет активности агентов, скидки за объем и выделенный параллелизм.
Структура планов Cartesia прозрачна для закупки, однако маркетинговые данные по задержкам Sonic-3.6 требуют проверки. Провайдеру предстоит доказать свое преимущество в ходе прямого тестирования в вашем сетевом контуре.
- Контексты в WebSocket делают отмену и состояние реплики прозрачными.
- Таймстемпы слов и фонем упрощают логику управления плеером.
- Удобный бесплатный план для быстрого прототипирования.
- В платные тарифы включено неограниченное число рабочих мест в воркспейсе.
- Нет актуальной публичной цифры TTFA для Sonic-3.6 на официальных ресурсах.
- Публикуемые цены на сайте предполагают годовую оплату.
- Ограничение параллельных сессий до 15 на публичных тарифах (выше — только Enterprise).
Вердикт: Cartesia — отличный кандидат с упором на транспортный протокол. Включайте ее в топ после того, как замеры на вашем боевом контуре подтвердят превосходство над конкурентами по перцентилю p95.
6. Hume Octave 2: максимум эмоциональной выразительности
Hume Octave 2 специализируется на выразительности и интонациях, когда агент должен звучать эмоционально и эмпатично, а не просто быстро.

В документации Hume Octave модель Octave 2 имеет статус preview. Hume заявляет задержку самой нейросети около 100 ms без учета сети, в то время как в instant mode первый аудиосегмент обычно отдается примерно за 200 ms в зависимости от сложности текста и нагрузки. Это две разные границы, и показатель 200 ms ближе к тому, с чем столкнется реальное приложение до накладных расходов воспроизведения.
Модель в режиме превью поддерживает английский, японский, корейский, испанский, французский, португальский, итальянский, немецкий, русский, хинди и арабский языки. Для клонирования голоса достаточно 15 секунд аудиозаписи. API поддерживает потоковую отдачу по HTTP, двунаправленный WebSocket-стриминг и обычные синхронные ответы.
Главный аргумент в пользу Hume — интонационная гибкость. Для виртуальных психологов, коучей, голосовых компаньонов или деликатной клиентской поддержки смысловые акценты и темп имеют решающее значение. Для типового бота, подтверждающего запись к врачу, переплачивать за эмоциональность нет смысла.
Лучший выбор для: Коучинга, персонажей, ассистентов психологической поддержки и сценариев, где интонация определяет доверие.
Главное преимущество: Выразительный эмоциональный синтез с задержкой модели около 100 ms в рамках Octave 2 preview.
Цены: Бесплатный тариф дает около 10 минут; платные планы варьируются от $3 до $500 в месяц до уровня Enterprise.
Пробный период: Да. Бесплатный план включает 10,000 знаков и 1 параллельное соединение.
Тарифные планы Hume
- Free: $0 в месяц, 10,000 знаков (около 10 минут), 15 запросов в минуту, 1 активное соединение.
- Starter: $3 в месяц, 30,000 знаков (около 30 минут), 15 запросов в минуту, 5 соединений.
- Creator: $14 в месяц ($7 за первый месяц), 140,000 знаков (около 140 минут), $0.15 за каждую дополнительную 1,000 знаков, 75 запросов в минуту, 5 соединений.
- Pro: $70 в месяц, 1 миллион знаков (около 1,000 минут), $0.12 за 1,000 сверх лимита, 75 запросов в минуту, 10 соединений.
- Scale: $200 в месяц, 3.3 миллиона знаков (около 3,300 минут), $0.10 за 1,000 сверх лимита, 150 запросов в минуту, 20 соединений.
- Business: $500 в месяц, 10 миллионов знаков (около 10,000 минут), $0.05 за 1,000 сверх лимита, 225 запросов в минуту, 30 соединений.
- Enterprise: Индивидуальные лимиты по объему, RPS и параллелизму.
Тарифная сетка удобна для тестирования, но превышение лимитов на Creator обходится дорого. На тарифе Business цена дополнительных знаков снижается до $0.05 за 1,000 — как у ElevenLabs Flash, но требует базовой абонентской платы $500 в месяц при совершенно другом позиционировании голосов.
- Выразительная эмоциональная подача выделяется на фоне конкурентов.
- Поддержка стриминга по HTTP и двунаправленного WebSocket.
- Клонирование голоса доступно по сэмплу от 15 секунд.
- Тарифы Free и Starter позволяют недорого протестировать эмоциональный синтез.
- Octave 2 находится в статусе preview.
- Реальное время до первого звука в instant mode ближе к 200 ms, чем к 100 ms модели.
- Дорогие символы сверх пакета на плане Creator ($0.15 за 1K).
Вердикт: Hume не претендует на звание самого быстрого движка. Выбирайте его, когда живые эмоции и интонации приносят бизнесу конверсию и удержание, которые не способен дать нейтральный скоростной голос.
7. Gradium: единый речевой стек для ЕС и США
Gradium — практичное решение, когда объединение TTS и STT у одного поставщика с региональной маршрутизацией важнее рекордов TTFA.

В API-документации Gradium есть поддержка эндпоинтов для REST и WebSocket. Запросы отправляются на единый хост и автоматически распределяются в ближайший кластер в Европе или США. По заявлению Gradium, трафик из ЕС обрабатывается внутри Европы, а трафик из США — в Соединенных Штатах. Это упрощает архитектуру, избавляя от ручного выбора региональных адресов.
Биллинг строится на ежемесячных пакетах кредитов, а не на тарификации за знаки. Один символ TTS расходует один кредит, при этом 45,000 символов соответствуют примерно 1 часу речи. Пакетная модель выгодна, если в рамках одного аккаунта задействованы распознавание (STT) или перевод, но усложняет сравнение, если нужен только синтез.
Ключевое ограничение бесплатного плана — коммерческие права. Free открывает доступ к API и примерно 1 часу генерации, но запрещает коммерческое использование. Первым коммерческим тарифом является план XS за $13 в месяц.
Лучший выбор для: Продуктов, которым нужен один провайдер для синтеза и распознавания речи с региональной обработкой.
Главное преимущество: Единый эндпоинт API с автоматической маршрутизацией между кластерами ЕС и США.
Цены: Бесплатно для личных проектов; коммерческие планы стартуют от $13 в месяц.
Пробный период: Да. План Free включает 45,000 кредитов (около 1 часа TTS) и 2 параллельных потока.
Тарифные планы Gradium
- Free: $0 в месяц, 45,000 кредитов, около 1 часа TTS, 2 параллельные сессии, доступ к API, без коммерческого использования.
- XS: $13 в месяц, 225,000 кредитов, около 5 часов TTS, 5 параллельных сессий, коммерческая лицензия.
- S: $43 в месяц, 900,000 кредитов, около 20 часов TTS, 5 параллельных сессий, коммерческая лицензия.
- M: $340 в месяц, 9 миллионов кредитов, около 200 часов TTS, 10 параллельных сессий, коммерческая лицензия.
- L: $1,615 в месяц, 45 миллионов кредитов, около 1,000 часов TTS, 15 параллельных сессий, коммерческая лицензия.
- Enterprise: Индивидуальный тариф с неограниченными кредитами и нужным числом потоков.
Дополнительные пакеты на 100,000 кредитов стоят $6.90 на плане XS, $5.00 на S, $4.00 на M и $3.80 на L. Снижение стоимости за объем выгодно при стабильной загрузке, но итоговая цена зависит от утилизации пакета.
- Поддержка REST и WebSocket TTS через единый API.
- Автоматическая маршрутизация трафика в дата-центры ЕС или США.
- Единый баланс кредитов для TTS, STT и перевода.
- Доступный порог входа в коммерческий API с тарифа XS за $13.
- Бесплатный тариф исключает коммерческое применение.
- Нет официальной цифры TTFA в проверенной документации.
- Пакетная система кредитов усложняет прямое сравнение затрат на чистый TTS.
Вердикт: Gradium интересен для консолидации инфраструктуры, а не ради победы в тестах на миллисекунды. Он уместен, когда соблюдение требований к локализации данных в ЕС и единый речевой поставщик экономят больше инженерных ресурсов, чем выигрыш пары десятков миллисекунд.
8. OpenAI GPT-4o Mini TTS: оптимально для готовой инфраструктуры на OpenAI
OpenAI GPT-4o Mini TTS — удобный вариант интеграции, если проект уже полностью стандартизирован на стеке API от OpenAI.

Модель принимает текст и генерирует речь через официальный speech-эндпоинт. API поддерживает стриминг сырого звука или Server-Sent Events (SSE), предлагает 13 встроенных голосов с поддержкой кастомных voice ID и выдает аудио в MP3, Opus, AAC, FLAC, WAV и PCM. Скорость воспроизведения настраивается в диапазоне от 0.25 до 4.0.
При этом в документации отсутствует подтвержденная цифра задержки TTFA. OpenAI не приводит точных замеров, поэтому считать GPT-4o Mini TTS лидером по скорости исключительно на базе документации нельзя. Модель вошла в список благодаря поддержке потоковой передачи и выгоде от использования единого поставщика: общие ключи доступа, мониторинг и единый биллинг снижают операционные издержки.
Тарификация также отличается от конкурентов: OpenAI списывает $0.60 за 1 миллион входных текстовых токенов и $12 за 1 миллион выходных аудиотокенов. Расчет требует моделирования на реальных диалогах, а не простого умножения знаков на тариф. Максимальный входной контекст составляет 2,000 токенов на запрос.
Лучший выбор для: Команд, уже использующих экосистему OpenAI, для которых простота интеграции важнее подтвержденных рекордов задержки.
Главное преимущество: Богатый выбор аудиоформатов, гибкий стриминг, голосовые инструкции и отсутствие нового вендора в стеке.
Цены: $0.60 за 1M входных текстовых токенов плюс $12 за 1M выходных аудиотокенов.
Пробный период: Нет. Бесплатный уровень доступа для этой модели не поддерживается.
Уровни использования OpenAI (Usage Tiers)
На официальной странице GPT-4o Mini TTS нет бесплатного тарифа. Лимиты зависят от уровня аккаунта: Tier 1 разрешает 500 запросов в минуту и 50,000 токенов в минуту. Tier 2 — 2,000 и 150,000. Tier 3 — 5,000 и 600,000. Tier 4 — 10,000 и 2 миллиона. Tier 5 — 10,000 и 8 миллионов.
Это технические лимиты пропускной способности, а не абонентская плата. Задача инженера — выяснить, перевешивает ли удобство работы с привычным API прозрачность посимвольных тарифов и продвинутые протоколы прерываний специализированных TTS-сервисов.
- Эндпоинт отдает поток через бинарный чанк-стриминг или SSE.
- 6 выходных аудиоформатов и 13 базовых голосов закрывают большинство задач.
- Использование существующего контракта с OpenAI снижает бюрократическую и операционную нагрузку.
- Поддерживаются инструкции для управления манерой произношения без смены платформы.
- Официальные цифры TTFA не опубликованы.
- Токенизированный биллинг сложнее прогнозировать в сравнении с тарифами за символы.
- Нет бесплатного тестового режима для этой модели.
Вердикт: Держите OpenAI в списке, если это избавляет от необходимости подключать нового подрядчика. Но не считайте его быстрейшим по умолчанию, пока не проведете замеры на боевом телефонном транке.
Сколько стоят 50,000 минут генерации речи
Наиболее прозрачный способ сопоставить затраты — взять одинаковое соотношение символов и открытые тарифы on-demand. Калькулятор Inworld принимает 1 минуту речи равной примерно 1,000 символов, соответственно 50,000 минут эквивалентны 50 миллионам знаков. Это типовой расчетный сценарий, а не фиксированная оферта.
При таком объеме:
- Inworld Flash On-Demand обойдется в $750 в месяц (из расчета $15 за 1M символов).
- Rime Mist v3 составит $1,500 в месяц (из расчета $0.03 за 1,000 символов).
- Deepgram Flux Pay As You Go после акции составит $2,250 в месяц (из расчета $0.045 за 1,000 символов).
- ElevenLabs Flash обойдется в $2,500 в месяц (из расчета $0.05 за 1,000 символов).

Не делайте выбор исключительно по цене. Дешевый движок, из-за которого клиенты перезванивают, путают реквизиты или который требует недель разработки кастомного модуля прерываний, обойдется дороже мнимой экономии. С другой стороны, платить надбавку раскрученному бренду без измеримой бизнес-пользы — банальная неэффективность.
В этом расчете есть три упрощения. Во-первых, реальная плотность символов в минуте зависит от языка, темпа и пунктуации. Во-вторых, платные тарифные пакеты могут требовать минимального депозита или, напротив, открывать скидки за объем. В-третьих, корпоративные условия всегда обсуждаются индивидуально. Прогоните недельный массив реальных логов диалогов через счетчик символов перед подписанием годового контракта.
Кому какой сервис подходит
Выбирайте Deepgram Flux TTS, когда нужен английский язык, а абоненты регулярно перебивают бота. Нативная фиксация произнесенного текста — решающий аргумент.
Выбирайте Rime Mist v3, если в приоритете подтвержденные перцентили задержки, целевые страны укладываются в 4 языка Mist, а архитектуре не требуются пословные таймстемпы. Размещайте медиасерверы ближе к клиентам, чтобы сетевые задержки не нивелировали скорость модели.
Выбирайте Inworld TTS-2 Flash, если ассистент должен общаться на десятках языков или если бюджет на генерацию знаков является ключевой метрикой. Его стандартный тариф on-demand дает максимальный запас маржинальности в сценарии на 50,000 минут.
Выбирайте ElevenLabs Flash v2.5, если бизнесу требуется проверенная платформа синтеза с легким переходом от бесплатного тестирования к масштабным пакетам. Обязательно позаботьтесь о нормализации чисел, дат, валют и аббревиатур до отправки в TTS.
Выбирайте Cartesia Sonic-3.6, когда механике воспроизведения необходимы отмена контекста и детальная раскладка таймстемпов по словам и фонемам. Обязательно проведите замер TTFA в реальной инфраструктуре, так как на сайте нет готовой цифры для версии 3.6.
Выбирайте Hume Octave 2, если эмоциональный контакт — это часть бизнес-модели, а не просто украшение. Миритесь со статусом preview и повышенным временем отклика только тогда, когда эмпатия в голосе напрямую конвертируется в выручку или лояльность.
Выбирайте Gradium, если вам нужен единый поставщик TTS и STT с автоматической маршрутизацией запросов по кластерам в ЕС и США. Для коммерческих тестов сразу подключайте тариф XS, так как Free исключает коммерческое использование.
Выбирайте OpenAI GPT-4o Mini TTS, если отказ от интеграции стороннего провайдера важнее документально подтвержденных рекордов скорости. Измеряйте сквозное время в боевом контуре: наличие знакомого бренда не гарантирует мгновенный ответ.
Главный вопрос, снимающий сомнения при выборе: Что происходит с состоянием диалога, когда абонент перебивает агента на середине важного факта? Если ответ сводится к «клиентское приложение пытается угадать, что успело прозвучать», решите эту проблему до споров о красоте тембров.
Варианты, которых стоит избегать при фокусе на задержку
Pika Speech: быстрые готовые файлы, неподходящий транспорт для звонков
Pika Speech — впечатляющая система для озвучки и клонирования голоса, но ее текущий API не подходит по своей архитектуре для интерактивных голосовых агентов реального времени.

В релизе Pika от 18 августа 2026 года зафиксирован real-time factor 0.02 в локальных 3-минутных тестах. В бенчмарке длинных текстов минута речи генерируется примерно за 1.2 секунды. Модель отдает звук 48 kHz, клонирует голос по 5-секундному сэмплу и принимает до 5 минут текста в одном запросе.
Для пакетной генерации готовых дорожек это выдающаяся пропускная способность. Но это не имеет отношения к тому, насколько быстро абонент в трубке услышит первый слог.
В документации API Pika Speech синтез в реальном времени прямо указан в графе «Not for» («Не предназначено для»). Запрос методом POST создает фоновую задачу в очереди, статус которой клиент должен периодически опрашивать (polling) до готовности аудиофайла. Тариф $0.01 за минуту генерации делает Pika отличным решением для пакетной озвучки контента, но асинхронная модель взаимодействия исключает сервис из рейтинга инструментов для живого диалога.
Лучший выбор для: Закадровой озвучки, создания контента и пакетной генерации файлов.
Главное преимущество: Около 1.2 секунды на генерацию целой минуты аудио в тестах провайдера.
Цены: $0.01 за минуту генерации в бенчмарке вендора от августа.
Пробный период: Не подтвержден на проверенных страницах релиза.
- Высокая скорость пакетной генерации длинных файлов.
- Звук 48 kHz и клонирование по короткому сэмплу идеальны для медиаконтента.
- Низкая базовая ставка $0.01 за сгенерированную минуту.
- API прямо не предназначен для real-time стриминга.
- Асинхронная архитектура требует ожидания и поллинга статуса задач.
- Скорость генерации целого файла не отражает время до первого воспроизводимого байта.
Вердикт: Используйте Pika для генерации аудио в фоновом режиме. Возвращайтесь к оценке сервиса для интерактивных ботов только тогда, когда появится публичный стриминговый API с подтвержденным таймингом первого байта.
Иллюзия «бесплатного безлимита» в продакшне
Некоторые провайдеры начисляют приветственные гранты или бесплатные ежемесячные квоты. Ни один из проверенных ресурсов не предлагает бесконечный, надежный и быстрый TTS корпоративного уровня бесплатно. Бесплатные тарифы сопровождаются ограничениями: запретом на коммерцию, лимитом в 1-2 параллельных потока или крошечным балансом символов.
Планируйте переход на платный тариф еще до того, как прототип будет закончен. Иначе первый же наплыв пользователей приведет к инциденту на проде.
Тяжелые модели там, где критична скорость
Большинство поставщиков сейчас разделяют быстрые разговорные модели и тяжелые генераторы для художественного чтения. Выбирайте Flash вместо стандартных медленных версий ElevenLabs для интерактивных сценариев, Mist вместо Coda при жестких требованиях к задержке, и Inworld Flash вместо TTS-2, когда экономика и отклик важнее нюансов интонаций. Не стоит платить задержкой за то качество звука, которое телефонный канал связи все равно срежет.
План действий на понедельник
В ближайший понедельник разверните сравнительный тест из 5 сценариев для Deepgram Flux, Rime Mist, Inworld Flash и ElevenLabs Flash. Зафиксируйте одинаковые условия: идентичный вывод LLM, медиасервер, регион дата-центра, оператора связи, аудиокодек и размер буфера плеера.
Эти 5 сценариев должны протестировать типичные точки отказа:
- Короткое приветствие, выявляющее чистую задержку до первого аудио.
- Развернутый ответ, прерванный абонентом ровно на середине фразы.
- Реплика, содержащая имя клиента, дату с указанием месяца, сумму в валюте, номер телефона и проверочный код.
- Потоковый ответ от языковой модели с неравномерными текстовыми чанками.
- Пиковый всплеск одновременных звонков, соответствующий плановой нагрузке запуска.
Замеряйте время готовности текста, получение первого байта, добавление первого фрейма в очередь воспроизведения, время фактического звучания в трубке, p50 TTFA, p95 TTFA, корректность прерывания и фактический текст, услышанный пользователем. Оценивайте естественность тембра только после того, как кандидат прошел порог по задержке и корректности barge-in.
Затем спроецируйте полученный объем знаков на тарифный план, который реально потребуется купить. Задача тестирования — ответить не на вопрос «какое демо звучит приятнее?», а определить: «кто из финалистов обеспечивает корректные, управляемые диалоги с перебиванием при минимальной совокупной стоимости в месяц?»
Если Deepgram закрывает языковые потребности, нативная работа с прерываниями делает его фаворитом. Если проект мультиязычный, начните с Inworld и ElevenLabs. Если решающим фактором является минимальное время первого звука, обязательно включите Rime в финальный тест. Один день системных инструментальных замеров полезнее недели чтения маркетинговых обещаний.
Часто задаваемые вопросы
Какой TTS API лучший?
Deepgram Flux TTS — лучший API общего назначения для англоязычных голосовых агентов в нашем обзоре, поскольку он объединяет низкую задержку с нативной поддержкой прерываний (barge-in). Inworld становится лучшим выбором при работе с 200+ языками или жестком лимите бюджета за знаки, а Rime лидирует по подтвержденной скорости инференса.
Существует ли бесплатный low latency text to speech API?
Да. Deepgram предоставляет $200 кредита на Pay As You Go и бесплатный промо-доступ к Flux до 12 сентября 2026 года. Inworld включает до 70 минут TTS на тарифе On-Demand, ElevenLabs дает 20,000 символов Flash, Cartesia — около 27 минут, Hume — около 10 минут, а Gradium — около 1 часа для некоммерческих проектов. Это квоты для прототипирования, а не безлимитные продакшн-планы.
Какой TTS API самый дешевый?
В сценарии на 50 миллионов символов Inworld Flash On-Demand оказался самым доступным среди четырех сервисов с посимвольной оплатой — $750 в месяц. Корпоративные скидки, минимальные пакеты кредитов, распределение языков и средняя длина фраз могут изменить баланс, поэтому стройте расчет на логах реальных диалогов.
Какая локальная TTS-модель лучшая?
Локальный хостинг self-hosted моделей — отдельная архитектурная задача, отличная от вызова облачного API. Deepgram Flux и Rime поддерживают приватное развертывание, но итоговая эффективность зависит от вашего парка GPU, требований к параллелизму, условий лицензирования модели и опыта эксплуатации инференс-стека. Замеряйте задержку TTFA и real-time factor строго на том оборудовании, которое пойдет в продакшн.
Работают ли low latency TTS API на Android?
Да. Храните API-ключ вендора на собственном бэкенде, передавайте аудиопоток с бэкенда на Android-клиент и измеряйте задержку до старта воспроизведения непосредственно на устройстве. Зашивать приватные ключи в мобильное приложение небезопасно, а нестабильная сотовая связь и локальные аудиобуферы смартфона могут свести на нет низкую задержку серверной нейросети.
Получите карту инструментов ИИ для владельцев бизнеса, чтобы собрать надежный стек голосового агента без лишних затрат времени на первичное исследование рынка.
3 сент. 2026 г.







