Audio a texto con Grok Voice Transcribe 2.0: mismo precio y nuevo modelo predeterminado
Grok Voice Transcribe 2.0 mantiene el precio por hora, pero cambia el modelo predeterminado. Qué revisar antes de migrar flujos de audio a texto.

Grok Voice Transcribe 2.0 mantiene el costo de pasar audio a texto en $0.10 por hora para el procesamiento por lotes y en $0.20 por hora para streaming. El punto delicado es que el modelo predeterminado ya cambió en la documentación vigente: una misma llamada a la API sin un modelo fijado puede devolver una transcripción distinta y alterar todo el trabajo posterior.
Qué cambió en la práctica
xAI lanzó Grok Voice Transcribe 2.0 el 18 de septiembre de 2026. Sustituye a Grok Voice Transcribe 1.0 como modelo actual de voz a texto, es decir, convierte voz grabada o en directo en texto que otro producto o flujo de trabajo puede utilizar.
Los dos modos de operación son claros. Por lotes envía un archivo o una URL de audio a un endpoint REST una vez que la grabación ya existe. Streaming envía el audio por WebSocket mientras la persona sigue hablando, para que los subtítulos, las respuestas de un agente o la asistencia en vivo reaccionen antes de que termine la llamada.
La página del lanzamiento indica que las integraciones existentes pueden recibir el modelo 2.0 sin cambios de código. Parece una transición sencilla, pero justamente por eso los responsables de la operación deben prestar atención. Si la solicitud no especifica un modelo, el proveedor decide cuándo cambia el resultado.
El tarifario no cambió. El procesamiento por lotes se mantiene en $0.10 por hora de audio. El streaming se mantiene en $0.20 por hora de audio. La diarización de hablantes, que asigna las palabras a cada persona, junto con las marcas de tiempo por palabra y la priorización de términos clave, están incluidas en esas tarifas.
Audio a texto: la tarifa de la API no cambia, pero el flujo sí puede cambiar
En la capa de la API, las cuentas son sencillas:
El streaming cuesta el doble que el procesamiento por lotes. En 1,000 horas de audio, la diferencia es de $100. Ese costo adicional se justifica cuando esperar a que termine la grabación rompería el producto, como sucede con los subtítulos en vivo, la asistencia de llamadas en tiempo real o un agente de voz que debe decidir qué responder a continuación.
Si el audio ya está almacenado, el streaming no vuelve la transcripción más útil por sí solo. Un archivo audiovisual, una colección pendiente de podcasts, una entrevista grabada o un proceso nocturno de revisión de llamadas normalmente deberían quedarse en el modo por lotes y conservar la tarifa más baja.
La API es solo una parte del presupuesto. La ecuación operativa útil es:
Costo total de transcripción = gasto en la API de audio + costo de corrección humana + retrabajo posterior
El primer término se conoce por el tarifario. El segundo depende del tiempo de revisión y del costo total por hora de quien revisa. El tercero aparece cuando los cambios en palabras, etiquetas de hablantes, marcas de tiempo o números con formato alteran un archivo de subtítulos, una puntuación de calidad, una nota del CRM, un índice de búsqueda o una acción automatizada.
Esa es la consecuencia empresarial de este lanzamiento. El gasto en audio puede permanecer exactamente igual mientras el costo total de obtener una transcripción utilizable sube o baja. Hasta probar audio representativo, una reducción del tiempo de corrección es solo una posibilidad, no un ahorro que pueda incluirse en una previsión.
Quién puede usarlo y qué cambia en cada caso
Un responsable de soporte al cliente con llamadas grabadas
Un equipo de soporte puede enviar llamadas grabadas al modo por lotes por $0.10 la hora de audio, activar la diarización y proporcionar los nombres de producto como términos clave. El costo directo de la API sigue siendo predecible. La cuestión al migrar es si 2.0 reduce o aumenta los minutos que una persona dedica a corregir nombres, datos de cuentas y asignaciones de hablantes.
El beneficio no es una puntuación abstracta de precisión. Es una cola de correcciones más pequeña sin sumar errores posteriores. Hay que medir ambas cosas antes de cambiar el modelo fijado en producción.
Un equipo de producto con un agente de voz en vivo
Para un agente de voz, esperar al final de la llamada anula la utilidad del producto. El streaming a $0.20 por hora de audio justifica la tarifa superior porque la transcripción forma parte del ciclo de control en vivo. El equipo debe comparar cómo gestionan ambos modelos las pausas, los números, las interrupciones y los términos clave, y después revisar las acciones que activan esas transcripciones.
Una transcripción puede parecer más limpia a una persona y aun así romper un flujo de trabajo si un solo valor con formato cambia una consulta o si el límite de un turno hace que el agente responda demasiado pronto. La prueba de aceptación debe abarcar la acción posterior, no solo el texto.
Un responsable de operaciones multimedia que publica subtítulos
Una agencia que procesa entrevistas o videos de clientes debería usar el modo por lotes, incluir las marcas de tiempo en la comparación y contrastar los mismos nombres difíciles y hablantes superpuestos con ambos modelos fijados. El resultado se mide en tiempo de corrección y calidad de la entrega de subtítulos, no en la prueba comparativa general del proveedor.
Una API es un componente, no un espacio de edición. Si el equipo necesita un editor web, un bot para reuniones, un flujo de subtítulos o un proceso para pasar el caso a una persona, conviene consultar esta comparativa de herramientas de transcripción.
Un equipo de soporte SaaS multilingüe
xAI afirma que 2.0 es dos veces más preciso que 1.0 en el conjunto de sus evaluaciones. También informa que la tasa de error por palabra en su propia prueba multilingüe de frases cortas bajó de 20.6% a 6.8%. Son comparaciones realizadas por el proveedor, no pruebas hechas para este artículo.
Un equipo de soporte multilingüe debería tomar muestras de su mezcla real de idiomas, acentos, líneas telefónicas, nombres y alternancia entre idiomas. Una mejora general no revela si avanzaron los idiomas que concentran la mayor parte de los tickets ni si el tiempo de corrección cambió lo suficiente para afectar la dotación de personal.
Fija el modelo y después prueba el resultado
La llamada mínima por lotes es breve. Este ejemplo de cURL corresponde a la solicitud documentada por xAI y especifica expresamente el modelo 2.0:
curl -X POST https://api.x.ai/v1/stt \
-H "Authorization: Bearer $XAI_API_KEY" \
-F model=grok-voice-transcribe-2.0 \
-F file=@audio.mp3La línea importante es el campo del modelo. Fijar explícitamente grok-voice-transcribe-2.0 deja la elección en manos del equipo. Para establecer una referencia temporal, la documentación actual todavía permite grok-voice-transcribe-1.0. En una solicitud multipart, el campo del archivo debe quedar al final porque xAI advierte que los campos de opciones posteriores podrían ignorarse.
Usa la misma configuración de solicitud en ambos lados de la prueba de migración. Si se cambian a la vez el modelo, la diarización, el formato, el tratamiento de muletillas y los términos clave, será imposible saber qué modificación causó la diferencia en el resultado.
Localiza todas las solicitudes sin un modelo fijado
Busca en las rutas de código por lotes y de streaming las llamadas que omiten
model. Incluye procesos en segundo plano, herramientas internas, entornos de prueba e integraciones de proveedores que puedan encapsular el endpoint. La documentación vigente ya dirige al modelo 2.0 cualquier solicitud que no lo especifique.Prepara un conjunto de audio representativo
Elige ejemplos reales de las condiciones que recibe el sistema: grabaciones limpias, llamadas con ruido, hablantes superpuestos, acentos, nombres de producto, direcciones de correo electrónico, códigos de cuenta y los idiomas que concentran el volumen real. Elimina o protege los datos confidenciales de acuerdo con la política vigente.
Ejecuta 1.0 y 2.0 con la misma configuración
Fija cada modelo de forma explícita y mantén constantes todas las demás opciones. Guarda el texto de la transcripción, las marcas de tiempo, las asignaciones de hablantes y el resultado de cualquier resumen, búsqueda, puntuación o acción automatizada que consuma esos datos.
Mide las diferencias humanas y del sistema
Registra el tiempo de corrección por hora de audio. Marca los errores en nombres, números, atribución de hablantes y marcas de tiempo. Después compara el resultado posterior, porque un cambio en la transcripción solo importa si ayuda o perjudica la tarea que debe cumplir.
Elige el modelo que quedará fijado en producción
Fija 2.0 cuando supere las pruebas de aceptación. Conserva 1.0 únicamente como alternativa temporal documentada mientras siga disponible, y no bases un plan a largo plazo en una fecha de retiro que no se ha publicado.
La parte honesta
El precio está verificado. El ahorro de trabajo, no.
Las afirmaciones de xAI sobre la precisión son buenos motivos para hacer pruebas, pero no constituyen un modelo de dotación de personal. Mezclas de audio distintas pueden producir resultados diferentes, y una tasa de error por palabra más baja no implica automáticamente menos minutos de revisión ni una automatización más segura.
La comunicación sobre la transición también avanzó más rápido que el anuncio. La página del 18 de septiembre dice que el cambio del modelo predeterminado llegará pronto, mientras que la documentación actual ya muestra 2.0 como opción predeterminada cuando se omite el modelo. Esta discrepancia es otro motivo para especificar el modelo en producción en vez de depender de una referencia cambiante.
Por último, las tarifas de $0.10 y $0.20 cubren el procesamiento del audio. No incluyen la cola de revisión, el trabajo de integración, el almacenamiento, los reintentos ni el costo de una acción posterior equivocada. Mantén esas partidas separadas para que una API barata no oculte un flujo de trabajo costoso.
Qué hacer ahora
Actúa esta semana si alguna solicitud de voz a texto de xAI omite el modelo o si producción está fijada en 1.0. Haz un inventario de las llamadas, ejecuta el conjunto representativo y elige expresamente el modelo de producción.
Usa streaming solo cuando recibir la transcripción mientras se habla cambie el resultado del producto. Para las grabaciones que pueden esperar, usa el procesamiento por lotes: la diarización, las marcas de tiempo y las opciones de términos clave incluidas cuestan la mitad en la capa de audio.
Espera si apenas estás evaluando proveedores y ninguna transcripción de xAI alimenta un flujo de trabajo activo. Mantén 2.0 entre las opciones, pero compara el costo total de corrección y el costo posterior con tu propio audio antes de migrar.
No te afecta si el sistema no utiliza la conversión de voz a texto de xAI, o si ya fija 2.0 y validó su resultado. Una integración fijada en 1.0 es estable por ahora, pero eso no justifica aplazar la prueba de migración: xAI ya anunció que el modelo quedará obsoleto.
La tarea para el lunes es sencilla: toma audio representativo, ejecuta 1.0 y 2.0 con la misma configuración, mide el tiempo de corrección y las diferencias posteriores, y después fija el modelo que supere la prueba. Como el tarifario no cambió, el presupuesto de la API es fácil de calcular. Revisar la transcripción protege el flujo de trabajo que la rodea.
Para recibir un análisis práctico cuando cambia el precio o el flujo de trabajo de una herramienta de IA, suscríbete al boletín.
- Última actualización
- 20 sept 2026
- Categoría
- Explained







