Grok Voice Transcribe 2.0: распознавание речи без роста цены
Распознавание речи в Grok Voice Transcribe 2.0 не подорожало. Что изменилось с моделью по умолчанию и как проверить расшифровки перед миграцией.

В Grok Voice Transcribe 2.0 распознавание речи по-прежнему стоит $0.10 за час в пакетном режиме и $0.20 за час в потоковом. Но в актуальной документации сменилась модель по умолчанию: один и тот же API-запрос без явно заданной модели может вернуть другой текст расшифровки — и изменить работу всех следующих этапов.
Что изменилось в Grok Voice Transcribe 2.0
xAI выпустила эту версию 18 сентября 2026 года. Новая версия стала текущей моделью распознавания речи вместо Grok Voice Transcribe 1.0: она преобразует записанную или живую речь в текст, который затем использует другой продукт или рабочий процесс.
Предусмотрено два понятных режима работы. В пакетном режиме готовый файл или ссылка на аудио отправляется в REST-эндпоинт. В потоковом режиме звук поступает через WebSocket прямо во время разговора, поэтому субтитры, ответы агента или подсказки в реальном времени могут появляться еще до завершения звонка.
На странице релиза сказано, что существующие интеграции могут перейти на модель 2.0 без изменений в коде. Звучит удобно, но именно поэтому командам стоит быть внимательнее. Если модель не указана в запросе, момент изменения результата определяет провайдер.
Тарифы остались прежними. Пакетная обработка по-прежнему стоит $0.10 за час аудио, потоковая — $0.20. В цену входят диаризация, которая соотносит слова с говорящими, временные метки для отдельных слов и приоритизация ключевых терминов.
Цена API прежняя, но распознавание речи может обойтись дороже
На уровне API расчет прост:
Потоковая обработка стоит вдвое дороже пакетной. На 1,000 часах аудио разница составит $100. Такая доплата оправданна, когда ожидание готовой записи ломает сам продукт — например, в живых субтитрах, подсказках оператору в реальном времени или голосовом агенте, который должен немедленно выбрать следующий ответ.
Если аудио уже лежит в хранилище, потоковая передача сама по себе не сделает расшифровку полезнее. Для медиаархива, очереди подкастов, записанных интервью или ночной проверки звонков обычно лучше сохранить пакетную обработку и более низкий тариф.
Плата за API — лишь одна статья расходов. Для практической оценки полезна такая формула:
Общая стоимость транскрибации = расходы на аудио-API + стоимость ручной правки + затраты на переделку следующих этапов
Первая часть известна из тарифов. Вторая зависит от времени редактора и полной стоимости часа его работы. Третья возникает, когда изменившиеся слова, метки говорящих, временные метки или формат чисел влияют на файл субтитров, оценку качества, заметку в CRM, поисковый индекс или автоматическое действие.
Именно в этом заключается деловой эффект релиза. Расходы на обработку аудио могут остаться прежними, а итоговая стоимость пригодной к работе расшифровки — вырасти или снизиться. Пока модель не проверена на репрезентативных записях, сокращение времени правки остается возможностью, а не экономией, которую можно заложить в прогноз.
Кому подойдет модель и что для них изменится
Руководитель службы поддержки с архивом звонков
Команда поддержки может обрабатывать записанные звонки в пакетном режиме по $0.10 за час аудио, включить диаризацию и передать названия продуктов как ключевые термины. Прямые расходы на API останутся предсказуемыми. Главный вопрос при миграции — сократит или увеличит версия 2.0 время, которое проверяющий тратит на исправление имен, данных учетной записи и распределения реплик между говорящими.
Ценность здесь измеряется не отвлеченной оценкой точности, а сокращением очереди на правку без роста числа ошибок на следующих этапах. Перед сменой модели в продакшене нужно измерить оба показателя.
Продуктовая команда с голосовым агентом в реальном времени
Для голосового агента ожидание до конца звонка лишает продукт смысла. Потоковая обработка по $0.20 за час аудио оправдывает более высокий тариф, потому что расшифровка входит в контур управления в реальном времени. Команде стоит сравнить, как обе модели обрабатывают паузы, числа, перебивания и ключевые термины, а затем проверить действия, которые запускаются на основе этих расшифровок.
Для человека текст может выглядеть чище и при этом ломать рабочий процесс: достаточно, чтобы иное форматирование одного значения изменило результат поиска или другая граница реплики заставила агента ответить слишком рано. Поэтому приемочное тестирование должно охватывать не только текст, но и последующее действие.
Руководитель медиапроизводства, выпускающий субтитры
Агентству, которое обрабатывает интервью или видео клиентов, стоит использовать пакетный режим, включить временные метки в сравнение и проверить одни и те же сложные имена и наложения голосов с обеими явно заданными моделями. Результат нужно оценивать по времени правки и качеству субтитров при передаче заказчику, а не по сводному бенчмарку поставщика.
API — это компонент, а не редакторская среда. Если команде нужен браузерный редактор, бот для встреч, процесс подготовки субтитров или передача сложных случаев человеку, лучше обратиться к сравнению готовых сервисов транскрибации.
Многоязычная служба поддержки SaaS
По данным xAI, версия 2.0 вдвое точнее 1.0 в проведенных компанией тестах. Компания также сообщает, что доля ошибок в словах на ее собственном наборе коротких многоязычных фраз снизилась с 20.6% до 6.8%. Это сравнение самого поставщика, а не тесты, выполненные для этой статьи.
Многоязычной службе поддержки следует взять выборку с реальным набором языков, акцентов, телефонных линий, имен и переключений между языками. Общий прирост ничего не говорит о том, улучшилось ли качество именно для языков, на которые приходится основная доля обращений, и достаточно ли изменилось время правки, чтобы повлиять на численность команды.
Явно задайте модель, затем проверьте результат
Минимальный запрос для пакетной обработки выглядит просто. Ниже — пример cURL-запроса из документации xAI, в котором модель 2.0 указана явно:
curl -X POST https://api.x.ai/v1/stt \
-H "Authorization: Bearer $XAI_API_KEY" \
-F model=grok-voice-transcribe-2.0 \
-F file=@audio.mp3Ключевая строка — поле модели. Явное значение grok-voice-transcribe-2.0 оставляет выбор за вами. В качестве временной базы для сравнения актуальная документация пока разрешает grok-voice-transcribe-1.0. В multipart-запросе поле файла следует оставлять последним: xAI предупреждает, что расположенные после него параметры могут быть проигнорированы.
При сравнении версий используйте одинаковые настройки запроса. Если одновременно поменять модель, диаризацию, форматирование, обработку слов-паразитов и ключевые термины, установить причину различий в результате уже не получится.
Найдите все запросы без явно заданной модели
Проверьте пакетные и потоковые вызовы, в которых отсутствует
model. Не забудьте фоновые задачи, внутренние инструменты, тестовые среды и интеграции поставщиков, скрывающие работу с эндпоинтом. В актуальной документации запрос без модели уже направляется в 2.0.Соберите репрезентативный набор аудио
Возьмите реальные примеры условий, с которыми сталкивается система: чистые записи, шумные звонки, одновременную речь, акценты, названия продуктов, адреса электронной почты, коды учетных записей и языки, на которые приходится фактический объем. Удалите или защитите конфиденциальные данные в соответствии с действующими правилами.
Запустите 1.0 и 2.0 с одинаковыми настройками
Явно задайте каждую модель, не меняя остальные параметры. Сохраните текст расшифровки, временные метки, распределение реплик между говорящими и результат любого резюме, поиска, оценки или автоматического действия, использующего эти данные.
Оцените разницу для человека и системы
Замерьте время ручной правки на час аудио. Отметьте ошибки в именах, числах, определении говорящих и временных метках. Затем сравните результат следующих этапов: изменение расшифровки важно лишь тогда, когда оно помогает или мешает задаче, ради которой создается текст.
Выберите модель для продакшена
Явно закрепите 2.0 после успешного прохождения приемочных проверок. Оставляйте 1.0 только как документированный временный резервный вариант, пока она доступна, и не стройте долгосрочный план вокруг неопубликованной даты отключения.
Без рекламных обещаний
Цена подтверждена. Экономия труда — нет.
Заявления xAI о точности дают повод провести тест, но не заменяют расчет численности команды. Разные наборы аудио могут дать разные результаты, а снижение доли ошибок в словах не обязательно означает меньше минут ручной проверки или более безопасную автоматизацию.
Формулировка о переходе тоже менялась быстрее анонса. На странице от 18 сентября сказано, что модель по умолчанию вскоре изменится, тогда как актуальная документация уже показывает 2.0 как вариант для запросов без явного указания модели. Это еще одна причина закрепить модель в продакшене, а не полагаться на меняющийся алиас.
Наконец, тарифы $0.10 и $0.20 покрывают обработку аудио. Они не учитывают очередь на проверку, интеграционные работы, хранение, повторные запросы или цену ошибочного действия на следующем этапе. Учитывайте эти статьи отдельно, чтобы дешевый API не маскировал дорогой рабочий процесс.
Что делать сейчас
Действуйте на этой неделе, если хотя бы один запрос к xAI speech-to-text не содержит модель или если в продакшене явно задана 1.0. Найдите все такие вызовы, прогоните репрезентативный набор и выберите модель для явного закрепления в продакшене.
Используйте потоковый режим, только если появление расшифровки во время речи влияет на результат работы продукта. Для записей, которые могут подождать, выбирайте пакетную обработку: включенные в тариф диаризация, временные метки и ключевые термины на уровне аудио обойдутся вдвое дешевле.
Подождите, если вы лишь сравниваете поставщиков и расшифровки xAI пока не участвуют в действующем процессе. Оставьте 2.0 в списке кандидатов, но до миграции сравните полную стоимость правки и следующих этапов на собственных аудиозаписях.
Изменения вас не затрагивают, если система не использует xAI speech-to-text или если вы уже явно закрепили 2.0 и проверили ее результат. Интеграция с явно заданной 1.0 пока работает стабильно, но это не повод откладывать проверку миграции: xAI уже объявила о выводе версии из эксплуатации.
Задача на понедельник проста: возьмите репрезентативное аудио, запустите 1.0 и 2.0 с одинаковыми настройками, сравните время правки и различия на следующих этапах, затем явно задайте модель, которая прошла проверку. Неизменившиеся тарифы упрощают расчет бюджета API. Проверка расшифровок защищает весь связанный рабочий процесс.
Подпишитесь на рассылку, чтобы получать практические разборы изменений цен и рабочих процессов в ИИ.
- Последнее обновление
- 20 сент. 2026 г.
- Категория
- Explained







