Converter áudio em texto com Grok 2.0 custa $0.10/h no modo batch

Entenda como converter áudio em texto com Grok Voice Transcribe 2.0, por que o batch segue em $0.10 por hora e como evitar mudanças silenciosas na API.

Sunday, September 20, 2026Omid Saffari
Tools
Converter áudio em texto com Grok 2.0 custa $0.10/h no modo batch

Converter áudio em texto com o Grok Voice Transcribe 2.0 continua custando $0.10 por hora no modo batch e $0.20 por hora no streaming. O ponto de atenção é que o modelo padrão mudou na documentação atual: assim, a mesma chamada de API sem uma versão fixada pode gerar outro texto de transcrição e alterar todo o trabalho executado depois dela.

O que mudou ao converter áudio em texto

A xAI lançou o Grok Voice Transcribe 2.0 em 18 de setembro de 2026. Ele substitui o Grok Voice Transcribe 1.0 como modelo atual de conversão de fala em texto, ou seja, transforma uma fala gravada ou ao vivo em texto para uso em outro produto ou fluxo de trabalho.

Os dois modos de operação são simples. No batch, um arquivo ou uma URL de áudio é enviado a um endpoint REST depois que a gravação já existe. No streaming, o áudio segue por WebSocket enquanto a pessoa ainda fala, permitindo que legendas, respostas de agentes ou assistência em tempo real reajam antes do fim da chamada.

A página de lançamento afirma que integrações existentes podem receber o modelo 2.0 sem nenhuma mudança no código. Parece uma transição indolor, mas é justamente por isso que as equipes de operação precisam ficar atentas. Quando a requisição não informa um modelo, é o fornecedor que decide quando a saída muda.

A tabela de preços não mudou. O batch permanece em $0.10 por hora de áudio. O streaming continua em $0.20 por hora de áudio. A diarização, que atribui as falas aos respectivos locutores, os timestamps por palavra e o direcionamento por termos-chave estão incluídos nesses valores.

A conta da API fica igual. A do fluxo pode mudar

Na camada da API, a conta é simples:

ModoPreço por hora de áudioCusto de 1,000 horas de áudioQuando usar
Batch$0.10$100A gravação já existe
Streaming$0.20$200A transcrição precisa chegar durante a conversa

O streaming custa o dobro do batch. Em 1,000 horas de áudio, a diferença é de $100. Esse valor se justifica quando esperar o fim da gravação comprometeria o produto, como acontece com legendas ao vivo, assistência durante chamadas ou um agente de voz decidindo o que responder em seguida.

Se o áudio já está armazenado, o streaming por si só não torna a transcrição mais útil. Um arquivo de mídia, um acervo de podcasts, entrevistas gravadas ou uma rotina noturna de revisão de chamadas normalmente deve continuar no batch e aproveitar o preço menor.

A API é apenas uma linha do orçamento. A equação operacional mais útil é:

Custo total da transcrição = gasto com a API de áudio + custo da revisão humana + retrabalho posterior

O primeiro termo já é conhecido pela tabela de preços. O segundo depende do tempo do revisor e de seu custo total por hora. O terceiro aparece quando alterações em palavras, identificação dos locutores, timestamps ou números formatados afetam um arquivo de legenda, uma nota de qualidade, um registro no CRM, um índice de busca ou uma ação automatizada.

Essa é a consequência prática do lançamento. O gasto com áudio pode permanecer exatamente igual enquanto o custo total para chegar a uma transcrição utilizável sobe ou cai. Até que áudios representativos sejam testados, a redução no tempo de correção é apenas uma possibilidade — não uma economia que possa entrar na previsão financeira.

Quem pode usar o modelo — e o que muda em cada caso

Uma liderança de suporte com chamadas gravadas

Uma equipe de suporte pode processar chamadas gravadas em batch por $0.10 por hora de áudio, ativar a diarização e fornecer nomes de produtos como termos-chave. O custo direto da API continua previsível. A questão da migração é saber se o 2.0 reduz ou aumenta os minutos que um revisor gasta corrigindo nomes, dados de contas e identificação dos locutores.

O ganho não está em uma métrica abstrata de precisão. Está em reduzir a fila de correção sem criar mais erros nas etapas seguintes. Meça os dois lados antes de mudar a versão fixada em produção.

Uma equipe de produto com um agente de voz ao vivo

Para um agente de voz, esperar a chamada terminar anula a proposta do produto. O streaming a $0.20 por hora de áudio justifica o preço maior porque a transcrição faz parte do ciclo de controle em tempo real. A equipe deve comparar como os dois modelos lidam com pausas, números, interrupções e termos-chave e, depois, examinar as ações disparadas por essas transcrições.

Uma transcrição pode parecer mais limpa para uma pessoa e ainda assim quebrar um fluxo se um valor formatado mudar uma consulta ou se o limite de um turno fizer o agente responder cedo demais. O teste de aceitação precisa incluir a ação posterior, e não apenas o texto.

Uma operação de mídia que entrega legendas

Uma agência que processa entrevistas ou vídeos de clientes deve usar o batch, manter os timestamps na comparação e testar os mesmos nomes difíceis e as mesmas falas sobrepostas com as duas versões fixadas. O ganho deve ser medido pelo tempo de correção e pela qualidade da entrega das legendas, não pelo benchmark agregado do fornecedor.

Uma API é um componente, não um ambiente de edição. Se a equipe precisa de um editor no navegador, bot de reunião, fluxo para legendas ou escalonamento para revisão humana, consulte o comparativo completo de ferramentas de transcrição.

Uma equipe de suporte SaaS multilíngue

Segundo a xAI, o 2.0 é duas vezes mais preciso que o 1.0 no conjunto de avaliações da empresa. Ela também informa que a taxa de erro por palavra em seu próprio conjunto multilíngue de frases curtas caiu de 20.6% para 6.8%. São comparações conduzidas pelo fornecedor, não testes realizados para este artigo.

Uma equipe de suporte multilíngue deve usar amostras que reflitam sua combinação real de idiomas, sotaques, linhas telefônicas, nomes e alternância entre línguas. Um ganho agregado não mostra se houve melhora nos idiomas que concentram a maior parte dos chamados nem se o tempo de correção mudou o suficiente para afetar o dimensionamento da equipe.

Fixe o modelo e só então teste a saída

A chamada mínima em batch é curta. Este exemplo em cURL reproduz a requisição documentada pela xAI, com o modelo 2.0 definido explicitamente:

Bash
curl -X POST https://api.x.ai/v1/stt \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -F model=grok-voice-transcribe-2.0 \
  -F file=@audio.mp3

A linha decisiva é o campo do modelo. Ao fixar explicitamente grok-voice-transcribe-2.0, a escolha fica sob seu controle. Para criar uma referência temporária, a documentação atual ainda permite grok-voice-transcribe-1.0. Em uma requisição multipart, mantenha o campo do arquivo por último, pois a xAI alerta que campos de opção posteriores podem ser ignorados.

Use as mesmas configurações nos dois lados da verificação de migração. Mudar ao mesmo tempo o modelo, a diarização, a formatação, o tratamento de palavras de preenchimento e os termos-chave impede identificar qual alteração causou a diferença na saída.

  1. Localize todas as requisições sem modelo fixado

    Procure, nos caminhos de batch e streaming do código, chamadas que omitem model. Inclua rotinas em segundo plano, ferramentas internas, staging e integrações de fornecedores que possam encapsular o endpoint. A documentação atual já direciona para o 2.0 quando o modelo é omitido.

  2. Monte um conjunto de áudios representativo

    Escolha exemplos reais das condições encontradas pelo sistema: gravações limpas, chamadas com ruído, falas sobrepostas, sotaques, nomes de produtos, endereços de e-mail, códigos de conta e os idiomas que de fato concentram volume. Remova ou proteja dados sensíveis conforme a política já adotada.

  3. Execute o 1.0 e o 2.0 com configurações idênticas

    Fixe cada modelo explicitamente e mantenha todas as demais opções constantes. Armazene o texto da transcrição, os timestamps, a identificação dos locutores e a saída de qualquer resumo, busca, pontuação ou ação automatizada que consuma esses dados.

  4. Meça as diferenças para pessoas e sistemas

    Registre o tempo de correção do revisor por hora de áudio. Marque erros em nomes, números, identificação de locutores e timestamps. Depois, compare o resultado posterior, pois uma mudança na transcrição só importa quando ajuda ou prejudica o trabalho a que ela se destina.

  5. Escolha a versão para produção

    Fixe o 2.0 depois que ele passar pelos critérios de aceitação. Mantenha o 1.0 apenas como alternativa temporária e documentada enquanto estiver disponível; não monte um plano de longo prazo em torno de uma data de retirada que não foi publicada.

Sem promessas além dos dados

O preço está confirmado. A economia de trabalho, não.

As alegações de precisão da xAI são bons motivos para testar, mas não servem como modelo de dimensionamento da equipe. Combinações diferentes de áudio podem gerar resultados distintos, e uma taxa de erro por palavra menor não significa automaticamente menos minutos de revisão ou uma automação mais segura.

O texto sobre a transição também avançou mais rápido que o anúncio. A página de 18 de setembro diz que a mudança do padrão acontecerá em breve, enquanto a documentação atual já mostra o 2.0 como padrão quando o modelo é omitido. Essa divergência reforça a necessidade de definir o modelo explicitamente em produção, em vez de depender de um alias sujeito a mudanças.

Por fim, os preços de $0.10 e $0.20 cobrem o processamento do áudio. Eles não incluem a fila de revisão, o trabalho de integração, o armazenamento, novas tentativas nem o custo de uma ação posterior incorreta. Mantenha essas linhas separadas para que uma API barata não esconda um fluxo caro.

O que fazer agora

Aja nesta semana se alguma requisição de speech-to-text da xAI omite o modelo ou se a produção está fixada no 1.0. Faça o inventário das chamadas, execute o conjunto representativo e escolha explicitamente a versão de produção.

Use streaming somente quando receber a transcrição durante a fala mudar o resultado do produto. Para gravações que podem esperar, use batch: a diarização, os timestamps e os termos-chave incluídos custam metade na camada de áudio.

Espere se a empresa ainda está apenas avaliando fornecedores e nenhuma transcrição da xAI alimenta um fluxo ativo. Mantenha o 2.0 entre as opções, mas compare o custo total de correção e das etapas posteriores com seus próprios áudios antes da migração.

Nada muda para você se o sistema não usa o speech-to-text da xAI ou se já fixa o 2.0 e teve a saída validada. Uma integração fixada no 1.0 continua estável por enquanto, mas isso não é motivo para adiar o teste de migração, pois a xAI já anunciou a descontinuação.

O próximo passo para segunda-feira é direto: selecione áudios representativos, execute o 1.0 e o 2.0 com as mesmas configurações, meça o tempo de correção e as diferenças nas etapas posteriores e fixe o modelo aprovado. Com a tabela de preços inalterada, o orçamento da API é simples. A verificação da transcrição protege o fluxo que existe ao redor dela.

Para acompanhar análises práticas quando um preço ou fluxo de IA realmente muda, assine a newsletter.

Última atualização
20 de set. de 2026
Categoria
Explained

Prefira este site no Google

Adicionar omidsaffari.com como fonte preferida na Busca do Google

Marque omidsaffari.com como fonte preferida e o Google destaca o site para você em Top Stories, AI Overviews e AI Mode.

Automação de navegador: como investigar falhas no Cloudflare Browser Run

Automação de navegador: como investigar falhas no Cloudflare Browser Run

O novo painel Inspect do Cloudflare Browser Run reúne logs, rede e DOM final para diagnosticar falhas antes de executar a automação de navegador novamente.19 de set. de 2026Explained
Design system privado no v0: componentes reais desde o protótipo

Design system privado no v0: componentes reais desde o protótipo

Veja como conectar um design system privado ao v0 com NPM_TOKEN ou NPM_RC, proteger credenciais e reduzir retrabalho na passagem para produção.19 de set. de 2026Explained
Claude Code preço: como a versão 2.1.278 corta cobranças do modo automático

Claude Code preço: como a versão 2.1.278 corta cobranças do modo automático

Veja quando o Claude Code 2.1.278 deixa de cobrar o classificador do modo automático, como validar a sessão e por que gateways ainda podem gerar custos.19 de set. de 2026Explained
Deploy Vercel com Turbo: mais velocidade só quando importa

Deploy Vercel com Turbo: mais velocidade só quando importa

Aprenda a acelerar um deploy Vercel urgente com Turbo sem mudar a configuração do projeto e calcule quanto o tempo economizado acrescenta à fatura.18 de set. de 2026Explained
ChatGPT Word elimina o copia e cola entre aplicativos

ChatGPT Word elimina o copia e cola entre aplicativos

O ChatGPT Word cria rascunhos, resume e revisa textos sem sair do documento. Veja como instalar, controlar custos e evitar mudanças sem revisão.18 de set. de 2026Explained
Google Antigravity: migre os jobs locais até 5 de outubro

Google Antigravity: migre os jobs locais até 5 de outubro

Mantenha os jobs do Google Antigravity ativos após 5 de outubro: veja quais integrações exigem novo adaptador e quais só precisam trocar o ID do agente.18 de set. de 2026Explained
RPC JavaScript no Cloudflare Workers revela a chamada lenta

RPC JavaScript no Cloudflare Workers revela a chamada lenta

Veja como o tracing de RPC JavaScript conecta Workers e Durable Objects, aponta a chamada lenta e ajuda a calcular o custo antes de ampliar o uso.17 de set. de 2026Explained
Deploy Vercel no Hobby: previews podem sumir antes de 30 dias

Deploy Vercel no Hobby: previews podem sumir antes de 30 dias

Equipes no Vercel Hobby acima de 10GB podem perder previews desprotegidos antes de 30 dias. Veja o que segue protegido e como revisar seus deploys.17 de set. de 2026Explained
Newsletter

Uma carta, todo domingo.Sistemas que funcionam, não hot takes.

Semanal. Sem spam. Cancele quando quiser.