Grok Voice Transcribe 2.0: распознавание речи без роста цены

Распознавание речи в Grok Voice Transcribe 2.0 не подорожало. Что изменилось с моделью по умолчанию и как проверить расшифровки перед миграцией.

Sunday, September 20, 2026Omid Saffari
Tools
Grok Voice Transcribe 2.0: распознавание речи без роста цены

В Grok Voice Transcribe 2.0 распознавание речи по-прежнему стоит $0.10 за час в пакетном режиме и $0.20 за час в потоковом. Но в актуальной документации сменилась модель по умолчанию: один и тот же API-запрос без явно заданной модели может вернуть другой текст расшифровки — и изменить работу всех следующих этапов.

Что изменилось в Grok Voice Transcribe 2.0

xAI выпустила эту версию 18 сентября 2026 года. Новая версия стала текущей моделью распознавания речи вместо Grok Voice Transcribe 1.0: она преобразует записанную или живую речь в текст, который затем использует другой продукт или рабочий процесс.

Предусмотрено два понятных режима работы. В пакетном режиме готовый файл или ссылка на аудио отправляется в REST-эндпоинт. В потоковом режиме звук поступает через WebSocket прямо во время разговора, поэтому субтитры, ответы агента или подсказки в реальном времени могут появляться еще до завершения звонка.

На странице релиза сказано, что существующие интеграции могут перейти на модель 2.0 без изменений в коде. Звучит удобно, но именно поэтому командам стоит быть внимательнее. Если модель не указана в запросе, момент изменения результата определяет провайдер.

Тарифы остались прежними. Пакетная обработка по-прежнему стоит $0.10 за час аудио, потоковая — $0.20. В цену входят диаризация, которая соотносит слова с говорящими, временные метки для отдельных слов и приоритизация ключевых терминов.

Цена API прежняя, но распознавание речи может обойтись дороже

На уровне API расчет прост:

РежимТариф за час аудиоСтоимость 1,000 часов аудиоКогда использовать
Пакетный$0.10$100Запись уже готова
Потоковый$0.20$200Расшифровка нужна во время разговора

Потоковая обработка стоит вдвое дороже пакетной. На 1,000 часах аудио разница составит $100. Такая доплата оправданна, когда ожидание готовой записи ломает сам продукт — например, в живых субтитрах, подсказках оператору в реальном времени или голосовом агенте, который должен немедленно выбрать следующий ответ.

Если аудио уже лежит в хранилище, потоковая передача сама по себе не сделает расшифровку полезнее. Для медиаархива, очереди подкастов, записанных интервью или ночной проверки звонков обычно лучше сохранить пакетную обработку и более низкий тариф.

Плата за API — лишь одна статья расходов. Для практической оценки полезна такая формула:

Общая стоимость транскрибации = расходы на аудио-API + стоимость ручной правки + затраты на переделку следующих этапов

Первая часть известна из тарифов. Вторая зависит от времени редактора и полной стоимости часа его работы. Третья возникает, когда изменившиеся слова, метки говорящих, временные метки или формат чисел влияют на файл субтитров, оценку качества, заметку в CRM, поисковый индекс или автоматическое действие.

Именно в этом заключается деловой эффект релиза. Расходы на обработку аудио могут остаться прежними, а итоговая стоимость пригодной к работе расшифровки — вырасти или снизиться. Пока модель не проверена на репрезентативных записях, сокращение времени правки остается возможностью, а не экономией, которую можно заложить в прогноз.

Кому подойдет модель и что для них изменится

Руководитель службы поддержки с архивом звонков

Команда поддержки может обрабатывать записанные звонки в пакетном режиме по $0.10 за час аудио, включить диаризацию и передать названия продуктов как ключевые термины. Прямые расходы на API останутся предсказуемыми. Главный вопрос при миграции — сократит или увеличит версия 2.0 время, которое проверяющий тратит на исправление имен, данных учетной записи и распределения реплик между говорящими.

Ценность здесь измеряется не отвлеченной оценкой точности, а сокращением очереди на правку без роста числа ошибок на следующих этапах. Перед сменой модели в продакшене нужно измерить оба показателя.

Продуктовая команда с голосовым агентом в реальном времени

Для голосового агента ожидание до конца звонка лишает продукт смысла. Потоковая обработка по $0.20 за час аудио оправдывает более высокий тариф, потому что расшифровка входит в контур управления в реальном времени. Команде стоит сравнить, как обе модели обрабатывают паузы, числа, перебивания и ключевые термины, а затем проверить действия, которые запускаются на основе этих расшифровок.

Для человека текст может выглядеть чище и при этом ломать рабочий процесс: достаточно, чтобы иное форматирование одного значения изменило результат поиска или другая граница реплики заставила агента ответить слишком рано. Поэтому приемочное тестирование должно охватывать не только текст, но и последующее действие.

Руководитель медиапроизводства, выпускающий субтитры

Агентству, которое обрабатывает интервью или видео клиентов, стоит использовать пакетный режим, включить временные метки в сравнение и проверить одни и те же сложные имена и наложения голосов с обеими явно заданными моделями. Результат нужно оценивать по времени правки и качеству субтитров при передаче заказчику, а не по сводному бенчмарку поставщика.

API — это компонент, а не редакторская среда. Если команде нужен браузерный редактор, бот для встреч, процесс подготовки субтитров или передача сложных случаев человеку, лучше обратиться к сравнению готовых сервисов транскрибации.

Многоязычная служба поддержки SaaS

По данным xAI, версия 2.0 вдвое точнее 1.0 в проведенных компанией тестах. Компания также сообщает, что доля ошибок в словах на ее собственном наборе коротких многоязычных фраз снизилась с 20.6% до 6.8%. Это сравнение самого поставщика, а не тесты, выполненные для этой статьи.

Многоязычной службе поддержки следует взять выборку с реальным набором языков, акцентов, телефонных линий, имен и переключений между языками. Общий прирост ничего не говорит о том, улучшилось ли качество именно для языков, на которые приходится основная доля обращений, и достаточно ли изменилось время правки, чтобы повлиять на численность команды.

Явно задайте модель, затем проверьте результат

Минимальный запрос для пакетной обработки выглядит просто. Ниже — пример cURL-запроса из документации xAI, в котором модель 2.0 указана явно:

Bash
curl -X POST https://api.x.ai/v1/stt \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -F model=grok-voice-transcribe-2.0 \
  -F file=@audio.mp3

Ключевая строка — поле модели. Явное значение grok-voice-transcribe-2.0 оставляет выбор за вами. В качестве временной базы для сравнения актуальная документация пока разрешает grok-voice-transcribe-1.0. В multipart-запросе поле файла следует оставлять последним: xAI предупреждает, что расположенные после него параметры могут быть проигнорированы.

При сравнении версий используйте одинаковые настройки запроса. Если одновременно поменять модель, диаризацию, форматирование, обработку слов-паразитов и ключевые термины, установить причину различий в результате уже не получится.

  1. Найдите все запросы без явно заданной модели

    Проверьте пакетные и потоковые вызовы, в которых отсутствует model. Не забудьте фоновые задачи, внутренние инструменты, тестовые среды и интеграции поставщиков, скрывающие работу с эндпоинтом. В актуальной документации запрос без модели уже направляется в 2.0.

  2. Соберите репрезентативный набор аудио

    Возьмите реальные примеры условий, с которыми сталкивается система: чистые записи, шумные звонки, одновременную речь, акценты, названия продуктов, адреса электронной почты, коды учетных записей и языки, на которые приходится фактический объем. Удалите или защитите конфиденциальные данные в соответствии с действующими правилами.

  3. Запустите 1.0 и 2.0 с одинаковыми настройками

    Явно задайте каждую модель, не меняя остальные параметры. Сохраните текст расшифровки, временные метки, распределение реплик между говорящими и результат любого резюме, поиска, оценки или автоматического действия, использующего эти данные.

  4. Оцените разницу для человека и системы

    Замерьте время ручной правки на час аудио. Отметьте ошибки в именах, числах, определении говорящих и временных метках. Затем сравните результат следующих этапов: изменение расшифровки важно лишь тогда, когда оно помогает или мешает задаче, ради которой создается текст.

  5. Выберите модель для продакшена

    Явно закрепите 2.0 после успешного прохождения приемочных проверок. Оставляйте 1.0 только как документированный временный резервный вариант, пока она доступна, и не стройте долгосрочный план вокруг неопубликованной даты отключения.

Без рекламных обещаний

Цена подтверждена. Экономия труда — нет.

Заявления xAI о точности дают повод провести тест, но не заменяют расчет численности команды. Разные наборы аудио могут дать разные результаты, а снижение доли ошибок в словах не обязательно означает меньше минут ручной проверки или более безопасную автоматизацию.

Формулировка о переходе тоже менялась быстрее анонса. На странице от 18 сентября сказано, что модель по умолчанию вскоре изменится, тогда как актуальная документация уже показывает 2.0 как вариант для запросов без явного указания модели. Это еще одна причина закрепить модель в продакшене, а не полагаться на меняющийся алиас.

Наконец, тарифы $0.10 и $0.20 покрывают обработку аудио. Они не учитывают очередь на проверку, интеграционные работы, хранение, повторные запросы или цену ошибочного действия на следующем этапе. Учитывайте эти статьи отдельно, чтобы дешевый API не маскировал дорогой рабочий процесс.

Что делать сейчас

Действуйте на этой неделе, если хотя бы один запрос к xAI speech-to-text не содержит модель или если в продакшене явно задана 1.0. Найдите все такие вызовы, прогоните репрезентативный набор и выберите модель для явного закрепления в продакшене.

Используйте потоковый режим, только если появление расшифровки во время речи влияет на результат работы продукта. Для записей, которые могут подождать, выбирайте пакетную обработку: включенные в тариф диаризация, временные метки и ключевые термины на уровне аудио обойдутся вдвое дешевле.

Подождите, если вы лишь сравниваете поставщиков и расшифровки xAI пока не участвуют в действующем процессе. Оставьте 2.0 в списке кандидатов, но до миграции сравните полную стоимость правки и следующих этапов на собственных аудиозаписях.

Изменения вас не затрагивают, если система не использует xAI speech-to-text или если вы уже явно закрепили 2.0 и проверили ее результат. Интеграция с явно заданной 1.0 пока работает стабильно, но это не повод откладывать проверку миграции: xAI уже объявила о выводе версии из эксплуатации.

Задача на понедельник проста: возьмите репрезентативное аудио, запустите 1.0 и 2.0 с одинаковыми настройками, сравните время правки и различия на следующих этапах, затем явно задайте модель, которая прошла проверку. Неизменившиеся тарифы упрощают расчет бюджета API. Проверка расшифровок защищает весь связанный рабочий процесс.

Подпишитесь на рассылку, чтобы получать практические разборы изменений цен и рабочих процессов в ИИ.

Последнее обновление
20 сент. 2026 г.
Категория
Explained

Сделать этот сайт предпочтительным в Google

Добавить omidsaffari.com как предпочтительный источник в Google Поиске

Отметьте omidsaffari.com как предпочтительный источник — и Google будет поднимать его для вас в Top Stories, AI Overviews и AI Mode.

Похожие статьи
Отладка Cloudflare Browser Rendering: сначала Inspect, потом перезапуск

Отладка Cloudflare Browser Rendering: сначала Inspect, потом перезапуск

Панель Inspect в Cloudflare Browser Run показывает логи, сетевые запросы и итоговый DOM. Разбираем, как найти причину сбоя до повторного запуска задачи.19 сент. 2026 г.Explained
Приватная библиотека компонентов в v0: как её подключить

Приватная библиотека компонентов в v0: как её подключить

Приватная библиотека компонентов теперь доступна v0 через NPM_TOKEN или NPM_RC. Как подключить пакет, защитить секрет и сократить переделку прототипа.19 сент. 2026 г.Explained
Claude Code Auto Mode: когда исчезает отдельная плата

Claude Code Auto Mode: когда исчезает отдельная плата

В Claude Code 2.1.278 серверные проверки Auto mode больше не оплачиваются отдельно. Кому доступно изменение, где ломается маршрут и что показывает /status.19 сент. 2026 г.Explained
Vercel Turbo для одного деплоя: сколько стоит ускорение

Vercel Turbo для одного деплоя: сколько стоит ускорение

Vercel Turbo можно включить для одного деплоя без смены настроек проекта. Разбираем три способа запуска, стоимость, ограничения и сценарии применения.18 сент. 2026 г.Explained
ChatGPT для Word: документы без копирования между приложениями

ChatGPT для Word: документы без копирования между приложениями

ChatGPT для Word позволяет писать, сокращать и перестраивать документы прямо в редакторе. Разбираем доступ, лимиты, риски и рабочий процесс.18 сент. 2026 г.Explained
Google Antigravity: как перенести локальные задачи до 5 октября

Google Antigravity: как перенести локальные задачи до 5 октября

В Google Antigravity майский агент отключат 5 октября. Разбираем, каким задачам хватит смены ID, а где придётся обновить адаптер локальных инструментов.18 сент. 2026 г.Explained
Трассировка Cloudflare Workers: какой Worker замедлил запрос

Трассировка Cloudflare Workers: какой Worker замедлил запрос

Трассировка Cloudflare Workers связывает RPC-вызовы между Workers и Durable Objects, помогает найти медленный метод и заранее оценить расходы на наблюдаемость.17 сент. 2026 г.Explained
Когда Vercel Hobby удаляет деплои раньше 30 дней

Когда Vercel Hobby удаляет деплои раньше 30 дней

Vercel Hobby может удалить старые деплои до истечения 30 дней, если команда превысила 10GB. Разбираем исключения, риски отката и полную цену Pro.17 сент. 2026 г.Explained
Рассылка

Одно письмо, каждое воскресенье.Работающие системы, а не горячие мнения.

Еженедельно. Без спама. Отписка в любой момент.