Цена Gemini TTS: сколько стоят Flash и Flash-Lite
Сколько стоит минута Gemini 3.8 Flash TTS и Flash-Lite: тарифы Standard, Batch, Flex и Priority, бесплатный уровень и удвоение цен с января 2027 года.

Цена Gemini TTS: для Gemini 3.8 Flash TTS в режиме Standard она начинается с $0.0135 за минуту сгенерированного аудио, а Flash-Lite стоит $0.009 за минуту. Это расчетные тарифы только за выходной аудиопоток, действующие до 31 декабря 2026 года. С 1 января 2027 года Google планирует повысить их вдвое, поэтому в производственный бюджет уже сейчас стоит заложить оба сценария.
Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS вышли 23 сентября 2026 года. 24 сентября 2026 года я сверил все приведенные ниже ставки с актуальной страницей тарифов Gemini Developer API от Google, а затем пересчитал указанные Google 25 аудиотокенов в секунду в минуты и часы готового аудио.

Цена Gemini TTS для моделей 3.8: краткая сводка
Самый дешевый вариант — Flash-Lite в режимах Batch или Flex: $0.0045 за минуту сгенерированного аудио до 31 декабря 2026 года. Для интерактивного производственного процесса разумным выбором по умолчанию будет Flash-Lite Standard за $0.009 в минуту. Полный Flash оправдан, когда более высокая точность, сложное произношение, поддержка диалектов или режиссура исполнения действительно стоят доплаты.
Все показатели длительности в таблице рассчитаны, а не взяты из реального счета. Они учитывают только сгенерированное аудио на выходе. В итоговый счет также могут войти входные текстовые токены, чтение кэша и его хранение.
Цена Gemini TTS 3.8 за минуту и час
Расчет становится простым, если видеть единицу тарификации: Google учитывает 25 аудиотокенов в секунду, поэтому одна сгенерированная минута равна 1,500 аудиотокенам, а один сгенерированный час — 90,000 аудиотокенам.
Для Flash Standard до 31 декабря:
- Одна минута: 1,500 разделить на 1,000,000 и умножить на $9.00 = $0.0135.
- Один час: 90,000 разделить на 1,000,000 и умножить на $9.00 = $0.81.
- Тысяча сгенерированных часов: $0.81 умножить на 1,000 = $810.
Для Flash-Lite Standard вместо ставки $9.00 за аудио используется $6.00. Получается $0.009 за минуту, $0.54 за час и $540 за 1,000 часов. С 1 января 2027 года те же объемы будут стоить $0.018 за минуту, $1.08 за час и $1,080 за 1,000 часов.

Воспроизводимый расчет выглядит так:
- Аудио на выходе: число сгенерированных секунд умножить на 25, разделить на 1,000,000 и умножить на ставку для выходного аудио.
- Текст на входе: фактическое число входных токенов из ответа на запрос разделить на 1,000,000 и умножить на ставку для входного текста.
- Чтение кэша: фактическое число закэшированных входных токенов разделить на 1,000,000 и умножить на ставку чтения кэша.
- Хранение кэша: число закэшированных токенов умножить на часы хранения, разделить на 1,000,000 и умножить на ставку хранения.
Не оценивайте количество текстовых токенов по длительности аудио — фиксируйте входное значение, которое возвращает API. Если в данных об использовании указано ровно 1,000,000 входных текстовых токенов и 100 сгенерированных часов в Standard, Flash сейчас обойдется в $81.50: $81 за аудио плюс $0.50 за текст. Flash-Lite будет стоить $54.50. С 1 января суммы вырастут до $163 и $109 соответственно.
Это важно, потому что короткий сценарий может превратиться в медленное исполнение с длинными паузами, а насыщенный текст — прозвучать быстро. Google тарифицирует сценарий и получившееся аудио отдельно.
Тарифы Gemini Flash-Lite TTS: когда Lite выгоднее
Flash-Lite выигрывает, когда голос — лишь один из компонентов продукта, а не главное исполнение. В руководстве Google по моделям TTS он предназначен для массового производства, функций чтения вслух, каскадов голосовых агентов, воспроизведения голоса и повседневной речи одного диктора. Модель поддерживает 101 язык и использует ту же схему API, что и полный Flash.
Полный Flash — творческий уровень. Google рекомендует его для максимальной точности, тонкой актерской подачи, сложного произношения, региональных диалектов, сложных диалогов с несколькими участниками и стабильной длинной озвучки на 130 языках. В Standard его выходное аудио стоит на $0.27 за сгенерированный час больше, чем Lite, до 31 декабря и на $0.54 больше с 1 января.
Ориентироваться нужно на слышимый недостаток, а не на престиж модели. Сначала прогоните один и тот же утвержденный сценарий и режиссерские указания через Lite. Если произношение, диалект, игра персонажа или длинная сцена не соответствуют планке качества, смените параметр модели и перегенерируйте этот фрагмент во Flash. Структура промптов общая, поэтому поддерживать две производственные системы не придется.
- Себестоимость сгенерированного аудио достаточно низкая, чтобы целиком прослушивать пробные версии глав, курсов или пакетов локализации.
- Flash и Flash-Lite используют общую схему, поэтому выборочное повышение уровня модели легко реализовать.
- Обе модели поддерживают режимы Standard, Batch, Flex и Priority.
- В тарифной сетке текст, аудио, чтение кэша и хранение указаны отдельно, а не спрятаны внутри условных кредитов.
- На публичной странице Google нет фиксированного бесплатного лимита именно для TTS.
- Все указанные платные тарифы TTS должны удвоиться 1 января 2027 года.
- Flex работает с негарантированной емкостью и может отказать при высокой нагрузке.
- Стоимость токенов не включает прослушивание человеком, редактирование, мастеринг и проверку прав, необходимые перед выпуском аудио.
Как выбрать Standard, Batch, Flex или Priority
Выбирайте режим обслуживания по срокам и допустимости сбоев. Режим определяет, как один и тот же запрос к модели будет поставлен в очередь и оплачен.
Standard — основной вариант для повседневного производства. Он работает синхронно, обычно отвечает за время от нескольких секунд до нескольких минут и оплачивается по полной ставке. Такой режим подходит редактору, который прослушивает реплики, дизайнеру, уточняющему режиссуру голоса, или приложению, которому нужен ответ, пока пользователь еще ждет.
Batch — самый дешевый надежный способ обработать очередь, которую можно оставить на ночь. Он стоит вдвое дешевле Standard, работает асинхронно и рассчитан на выполнение в срок до 24 часов. Издателю, который создает готовую аудиокнигу, или образовательной платформе, перегенерирующей каталог, стоит начинать с него.
Flex стоит столько же, сколько Batch, но остается синхронным. Целевое время ответа Google — от 1 до 15 минут; при этом используется негарантированная емкость, которую система может перераспределить. Запрос способен получить ошибку нехватки ресурсов, и Google не переведет его автоматически в Standard. Flex подходит для фонового процесса, в котором следующий шаг зависит от ответа, но может повторить попытку позже.
Priority нужен там, где задержка голосового ответа вредит продукту. Синхронный трафик направляется в ресурсы с более высоким приоритетом. При превышении лимитов Priority Google может понизить запрос до Standard и выставить счет по ставке Standard. В текущей сетке TTS Priority стоит в 1.8 раза дороже Standard: час Flash-Lite дорожает с $0.54 до $0.972, а Flash — с $0.81 до $1.458.

Текст на входе, аудио на выходе и хранение кэша оплачиваются отдельно
В большинстве счетов за TTS основная сумма приходится на аудио, но этим стоимость генерации голоса не ограничивается.
Стоимость Gemini TTS API: четыре части счета
Текст на входе — это расшифровка, которую вы отправляете. Для обеих моделей действует одна ставка Standard: $0.50 за 1 миллион токенов до 31 декабря, затем $1.00. В Batch и Flex она вдвое ниже. В Priority она составляет $0.90 сейчас и $1.80 с 1 января.
Аудио на выходе — сгенерированное исполнение. Здесь ставки Flash и Flash-Lite различаются: сейчас Standard стоит $9 против $6 за 1 миллион аудиотокенов, затем — $18 против $12.
Чтение кэша оплачивается при повторном использовании закэшированных входных данных. Сейчас Standard стоит $0.125 за 1 миллион закэшированных токенов, Batch — $0.0625, Flex — $0.025, а Priority — $0.225. В январе каждая ставка удвоится.
Хранение кэша тарифицируется по времени. До 31 декабря для всех режимов указано $0.50 за 1 миллион токено-часов, а с 1 января — $1.00. Поэтому хранение 8,000 токенов в течение 24 часов сейчас стоит $0.096. Одно чтение этого блока в Standard добавит $0.001. С января эти суммы составят $0.192 и $0.002.
Кэширование полезно, если объемные инструкции или контекст произношения многократно повторяются. Для короткого уникального сценария оно не обязательно выгодно. Прежде чем считать низкую ставку чтения экономией, учтите срок хранения и ожидаемое число обращений к кэшу.
В этой тарифной сетке нет месячной или годовой подписки на TTS. Платное использование API тарифицируется по факту, поэтому здесь нет ни годовой скидки, ни включенного месячного лимита, который можно превысить. Риск привязки проявляется в другом: неиспользованные предоплаченные кредиты Gemini API сгорают через год и, как правило, не возвращаются.
Бесплатный тариф Gemini TTS: что обещает Google
В колонке бесплатного уровня Google указывает текст на входе, аудио на выходе и контекстное кэширование как бесплатные для обеих моделей Gemini 3.8 TTS. При этом на странице тарифов нет отдельного лимита токенов TTS или гарантированного количества бесплатных минут аудио.
Поэтому бесплатный уровень удобен для проб голосов, проверки структуры промпта и небольших прототипов, но не годится как план мощностей для производственного запуска. По данным Google, действующие лимиты зависят от уровня использования проекта, отображаются в AI Studio, меняются вместе со статусом аккаунта и не гарантируются. Проверяйте конкретный проект, а не копируйте квоту из статьи в блоге.
При переходе на оплату меняются и условия конфиденциальности. На странице тарифов Google сказано, что контент бесплатного уровня может использоваться для улучшения продуктов компании, а контент платного уровня для этой цели не используется согласно условиям по ссылке. Голос клиента, неопубликованный сценарий или конфиденциальный учебный модуль нужно оценить с этой точки зрения до загрузки в инструмент.
Кому можно вообще не платить? Дизайнер, который лишь пробует несколько голосов и укладывается в текущие лимиты проекта, может остаться на бесплатном уровне. Тем, кто обещает определенный объем, пропускную способность или конфиденциальную производственную работу, следует заложить платный тариф, а не считать неопределенный лимит инфраструктурой.
Один и тот же голосовой бриф: стоимость до и после повышения
Учебная библиотека с одним диктором длительностью 100 часов нагляднее всего показывает разницу между моделями. В Standard до 31 декабря расчетная сумма только за выходное аудио составит $54 для Flash-Lite и $81 для Flash. С 1 января она вырастет до $108 и $162. Текст на входе, кэширование и все перегенерированные дубли оплачиваются дополнительно.
Первый проход стоит делать через Flash-Lite: в обычной озвучке флагманская модель нужна не в каждой строке. На этапе доработки переводите на старшую модель лишь материал, проваливший конкретную проверку качества: региональное имя произнесено неправильно, эмоциональная сцена звучит плоско, в диалоге нескольких участников теряется разделение или в длинной записи плавают голос и акустика.
Зафиксируйте один показательный бриф
Выберите сценарий со всеми сложностями будущего проекта: именами, числами, паузами, эмоциональными переходами и, если нужно, несколькими участниками. Текст для обеих моделей должен быть одинаковым.
Правильно задайте режиссуру исполнения
Gemini 3.8 TTS воспринимает текст сценария как слова, которые нужно произнести. Постоянные указания помещайте в структурированные метаданные речи, а встроенные теги оставляйте для единичных вокальных событий — иначе модель может произнести инструкцию вслух.
Сначала прослушайте Flash-Lite
Создайте контролируемую пробу, затем сохраните возвращенное количество входных токенов и фактическую длительность аудио. Для этой статьи образец не генерировался, поэтому показатели длительности остаются расчетной стоимостью только выходного аудио, а не данными из реального счета.
Переводите на Flash только неудачные фрагменты
Сохраните удачный результат Lite. Поменяйте параметр модели на Flash в отрывках, которые не проходят проверку произношения, диалекта, актерской подачи, разделения спикеров или стабильности длинной записи.
Выберите очередь
Пока работой руководит человек, используйте Standard. Утвержденную очередь отправляйте в Batch, Flex выбирайте только при наличии обработки повторных попыток, а Priority оплачивайте лишь тогда, когда ожидание портит пользовательский опыт.
Не путайте TTS с Gemini Live и текстовым Flash
Gemini 3.8 Flash TTS получает текст и возвращает звуковое исполнение. Универсальная модель gemini-3.8-flash работает через другую конечную точку и имеет собственную тарифную сетку, поэтому привычные цены текстовой модели за вход и выход нельзя переносить в смету TTS. В подробном разборе цен Gemini объясняется, почему потребительские планы и оплата Developer API существуют отдельно, а обзор Gemini 3 посвящен всему семейству моделей.
Gemini Live — еще один отдельный продукт. В руководстве Google по речи TTS описывается как точное чтение текста с управлением стилем и звуком, тогда как Live предназначен для интерактивного неструктурированного аудио и мультимодального разговора. Озвученный курс, аудиокнига или утвержденный рекламный сценарий — задача TTS. Голосовой агент, который слушает, рассуждает, вызывает инструмент и удерживает собеседника на линии, работает через Live и оплачивается по другой модели. Этот выбор разобран в анализе рабочего процесса Gemini 3.8 Live.
Такое разделение защищает от самой дорогой ошибки в таблице: нельзя рассчитывать сгенерированную речь по дешевой ставке текстовых токенов или оценивать постоянную Live-сессию по тарифу выходного аудио TTS.
Gemini TTS против ElevenLabs и Deepgram
При вводных тарифах Standard Gemini дешевле по чистой длительности сгенерированного аудио, чем два популярных API из шорт-листа. Но единицы тарификации различаются, а сама цена ничего не говорит о качестве голоса.
На странице тарифов ElevenLabs API для Flash/Turbo и v3 Conversational указано $0.05 за 1,000 символов — примерно $0.05 за минуту, или около $3 в час. Творческая модель v3 стоит примерно $0.10 за минуту, или $6 в час. Для сравнения по опубликованной оценке за минуту: Gemini Flash-Lite Standard сейчас обходится в $0.54 за час, а Flash — в $0.81.
Deepgram тарифицирует Aura-2 по $0.030 за 1,000 символов, а Aura-1 — по $0.015. Если для планирования принять 1,000 символов за минуту речи, нормализованная стоимость составит около $1.80 и $0.90 в час. Именно это допущение — слабое место сравнения: темп речи, паузы и невербальные звуки меняют длительность, тогда как Deepgram по-прежнему считает символы.
Корректное сравнение — платное прослушивание одного и того же собственного сценария. Приведите поставщиков к одному часу утвержденного материала, включите отбракованные дубли и оцените произношение, исполнение, стабильность, задержку и время на монтаж. Преимущество Gemini по стоимости токенов существенно, но дешевый голос, который требует больше правок, не удешевляет производство.
Скрытые расходы и пересчет бюджета на январь 2027 года
Главный бюджетный риск — запланированное повышение тарифов. Очередь Flash-Lite Standard длительностью 1,000 часов обойдется в расчетные $540 только за выходное аудио, если завершить ее до 31 декабря, и в $1,080 — с 1 января. Для Flash сумма вырастет с $810 до $1,620. После повышения Batch или Flex будут стоить за выходное аудио столько же, сколько Standard стоит сегодня.
Есть и другие операционные расходы:
- Перегенерация: отбракованные дубли создают новый оплачиваемый выходной аудиопоток.
- Контроль качества человеком: каждое имя собственное, число, голос с особыми требованиями к согласию и финальный монтаж требуют проверки.
- Хранение кэша: сохраненный контекст оплачивается по токено-часам, пока его не удалят.
- Сгорание предоплаты: неиспользованные предоплаченные кредиты Gemini API сгорают через год и, как правило, не возвращаются. Неиспользованные средства постоплаты могут подлежать возврату, но промокредиты возврату не подлежат.
- Разделение продуктов: потребительская подписка Gemini не превращает TTS в Developer API во включенную услугу.
Практический шаг на понедельник: прогоните один показательный час через Flash-Lite Standard, сохраните фактическое использование входных токенов и длительность выхода, отметьте все фрагменты, не прошедшие проверку качества, и повторно создайте во Flash только их. Получившееся соотношение внесите в две колонки бюджета — по текущим ставкам и по январским. Затем перенесите утвержденную очередь в Batch, если срок до 24 часов приемлем.
FAQ о цене Gemini 3.8 TTS
Сколько стоит синтез речи Gemini Audio TTS?
До 31 декабря 2026 года выходное аудио в Standard стоит $0.009 за минуту для Gemini 3.8 Flash-Lite TTS и $0.0135 за минуту для Gemini 3.8 Flash TTS. Эти расчетные суммы не включают текст на входе, чтение кэша и его хранение.
Сколько стоят 1000 токенов?
Все зависит от типа токенов. Сейчас в Standard 1,000 входных текстовых токенов стоят $0.0005 для любой из моделей. Тысяча выходных аудиотокенов стоит $0.009 во Flash или $0.006 во Flash-Lite и соответствует 40 секундам сгенерированного аудио. Все суммы удвоятся 1 января 2027 года.
Можно ли пользоваться Google TTS API бесплатно?
На бесплатном уровне Google указывает вход, выход и кэширование Gemini 3.8 Flash TTS и Flash-Lite TTS как бесплатные. Фиксированная квота токенов или минут именно для TTS не опубликована, поэтому смотрите действующий лимит в AI Studio.
Как получить TTS бесплатно?
Создайте или выберите активный проект в Google AI Studio, откройте рабочую область для генерации речи и используйте одну из двух моделей Gemini 3.8 TTS в пределах бесплатных лимитов проекта. Не считайте эту бесплатную емкость гарантированной для производства.
Нужно ли платить за TTS?
Да, после перехода на платный уровень Gemini API. Google отдельно тарифицирует текст на входе, аудио на выходе, чтение кэша и его хранение; текущая ставка Standard только за выход начинается с $0.009 за сгенерированную минуту.
Насколько дорог синтез речи?
Сейчас выходное аудио Gemini Flash-Lite Standard стоит $0.54 за сгенерированный час, а Flash — $0.81. В Batch и Flex эти суммы вдвое ниже, а в Priority вырастают до $0.972 и $1.458.
Какое ПО FreeTTS лучше?
Gemini TTS — облачный API, а не программная библиотека FreeTTS. Для бесплатной оценки подойдет бесплатный уровень Gemini, но публичная страница тарифов не обещает конкретное количество бесплатных минут.
Как включить Google TTS?
Откройте в Google AI Studio рабочую область для генерации речи или вызовите gemini-3.8-flash-tts либо gemini-3.8-flash-lite-tts через Gemini API, используя активный проект и ключ API.
Есть ли у Gemini 3.8 Flash TTS скидка для студентов?
На странице тарифов Developer API от Google нет отдельной студенческой ставки для Gemini TTS. Студенты используют те же бесплатный или платный уровни API, что и остальные разработчики.
Можно ли вернуть оплату за Gemini TTS API?
Google сообщает, что неиспользованные средства в привязанном платежном аккаунте с постоплатой могут подлежать возврату. Неиспользованные предоплаченные кредиты Gemini API сгорают через год после покупки и, как правило, не возвращаются; промокредиты также исключены.
Менялась ли цена Gemini 3.8 Flash TTS в 2026 году?
Модели вышли 23 сентября 2026 года с вводными платными тарифами. Они действуют до 31 декабря, а с 1 января 2027 года должны удвоиться.
Используйте чек-лист аудита рабочих процессов с ИИ, чтобы понять, где генерация голоса уместна, прежде чем утверждать производственный бюджет. Получить его вместе с рассылкой.
- Последнее обновление
- 24 сент. 2026 г.
- Категория
- Design







