Audio a texto con Grok Voice Transcribe 2.0: mismo precio y nuevo modelo predeterminado

Grok Voice Transcribe 2.0 mantiene el precio por hora, pero cambia el modelo predeterminado. Qué revisar antes de migrar flujos de audio a texto.

Sunday, September 20, 2026Omid Saffari
Tools
Audio a texto con Grok Voice Transcribe 2.0: mismo precio y nuevo modelo predeterminado

Grok Voice Transcribe 2.0 mantiene el costo de pasar audio a texto en $0.10 por hora para el procesamiento por lotes y en $0.20 por hora para streaming. El punto delicado es que el modelo predeterminado ya cambió en la documentación vigente: una misma llamada a la API sin un modelo fijado puede devolver una transcripción distinta y alterar todo el trabajo posterior.

Qué cambió en la práctica

xAI lanzó Grok Voice Transcribe 2.0 el 18 de septiembre de 2026. Sustituye a Grok Voice Transcribe 1.0 como modelo actual de voz a texto, es decir, convierte voz grabada o en directo en texto que otro producto o flujo de trabajo puede utilizar.

Los dos modos de operación son claros. Por lotes envía un archivo o una URL de audio a un endpoint REST una vez que la grabación ya existe. Streaming envía el audio por WebSocket mientras la persona sigue hablando, para que los subtítulos, las respuestas de un agente o la asistencia en vivo reaccionen antes de que termine la llamada.

La página del lanzamiento indica que las integraciones existentes pueden recibir el modelo 2.0 sin cambios de código. Parece una transición sencilla, pero justamente por eso los responsables de la operación deben prestar atención. Si la solicitud no especifica un modelo, el proveedor decide cuándo cambia el resultado.

El tarifario no cambió. El procesamiento por lotes se mantiene en $0.10 por hora de audio. El streaming se mantiene en $0.20 por hora de audio. La diarización de hablantes, que asigna las palabras a cada persona, junto con las marcas de tiempo por palabra y la priorización de términos clave, están incluidas en esas tarifas.

Audio a texto: la tarifa de la API no cambia, pero el flujo sí puede cambiar

En la capa de la API, las cuentas son sencillas:

ModoTarifa por hora de audioCosto de 1,000 horas de audioCuándo usarlo
Por lotes$0.10$100La grabación ya existe
Streaming$0.20$200La transcripción debe llegar durante la conversación

El streaming cuesta el doble que el procesamiento por lotes. En 1,000 horas de audio, la diferencia es de $100. Ese costo adicional se justifica cuando esperar a que termine la grabación rompería el producto, como sucede con los subtítulos en vivo, la asistencia de llamadas en tiempo real o un agente de voz que debe decidir qué responder a continuación.

Si el audio ya está almacenado, el streaming no vuelve la transcripción más útil por sí solo. Un archivo audiovisual, una colección pendiente de podcasts, una entrevista grabada o un proceso nocturno de revisión de llamadas normalmente deberían quedarse en el modo por lotes y conservar la tarifa más baja.

La API es solo una parte del presupuesto. La ecuación operativa útil es:

Costo total de transcripción = gasto en la API de audio + costo de corrección humana + retrabajo posterior

El primer término se conoce por el tarifario. El segundo depende del tiempo de revisión y del costo total por hora de quien revisa. El tercero aparece cuando los cambios en palabras, etiquetas de hablantes, marcas de tiempo o números con formato alteran un archivo de subtítulos, una puntuación de calidad, una nota del CRM, un índice de búsqueda o una acción automatizada.

Esa es la consecuencia empresarial de este lanzamiento. El gasto en audio puede permanecer exactamente igual mientras el costo total de obtener una transcripción utilizable sube o baja. Hasta probar audio representativo, una reducción del tiempo de corrección es solo una posibilidad, no un ahorro que pueda incluirse en una previsión.

Quién puede usarlo y qué cambia en cada caso

Un responsable de soporte al cliente con llamadas grabadas

Un equipo de soporte puede enviar llamadas grabadas al modo por lotes por $0.10 la hora de audio, activar la diarización y proporcionar los nombres de producto como términos clave. El costo directo de la API sigue siendo predecible. La cuestión al migrar es si 2.0 reduce o aumenta los minutos que una persona dedica a corregir nombres, datos de cuentas y asignaciones de hablantes.

El beneficio no es una puntuación abstracta de precisión. Es una cola de correcciones más pequeña sin sumar errores posteriores. Hay que medir ambas cosas antes de cambiar el modelo fijado en producción.

Un equipo de producto con un agente de voz en vivo

Para un agente de voz, esperar al final de la llamada anula la utilidad del producto. El streaming a $0.20 por hora de audio justifica la tarifa superior porque la transcripción forma parte del ciclo de control en vivo. El equipo debe comparar cómo gestionan ambos modelos las pausas, los números, las interrupciones y los términos clave, y después revisar las acciones que activan esas transcripciones.

Una transcripción puede parecer más limpia a una persona y aun así romper un flujo de trabajo si un solo valor con formato cambia una consulta o si el límite de un turno hace que el agente responda demasiado pronto. La prueba de aceptación debe abarcar la acción posterior, no solo el texto.

Un responsable de operaciones multimedia que publica subtítulos

Una agencia que procesa entrevistas o videos de clientes debería usar el modo por lotes, incluir las marcas de tiempo en la comparación y contrastar los mismos nombres difíciles y hablantes superpuestos con ambos modelos fijados. El resultado se mide en tiempo de corrección y calidad de la entrega de subtítulos, no en la prueba comparativa general del proveedor.

Una API es un componente, no un espacio de edición. Si el equipo necesita un editor web, un bot para reuniones, un flujo de subtítulos o un proceso para pasar el caso a una persona, conviene consultar esta comparativa de herramientas de transcripción.

Un equipo de soporte SaaS multilingüe

xAI afirma que 2.0 es dos veces más preciso que 1.0 en el conjunto de sus evaluaciones. También informa que la tasa de error por palabra en su propia prueba multilingüe de frases cortas bajó de 20.6% a 6.8%. Son comparaciones realizadas por el proveedor, no pruebas hechas para este artículo.

Un equipo de soporte multilingüe debería tomar muestras de su mezcla real de idiomas, acentos, líneas telefónicas, nombres y alternancia entre idiomas. Una mejora general no revela si avanzaron los idiomas que concentran la mayor parte de los tickets ni si el tiempo de corrección cambió lo suficiente para afectar la dotación de personal.

Fija el modelo y después prueba el resultado

La llamada mínima por lotes es breve. Este ejemplo de cURL corresponde a la solicitud documentada por xAI y especifica expresamente el modelo 2.0:

Bash
curl -X POST https://api.x.ai/v1/stt \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -F model=grok-voice-transcribe-2.0 \
  -F file=@audio.mp3

La línea importante es el campo del modelo. Fijar explícitamente grok-voice-transcribe-2.0 deja la elección en manos del equipo. Para establecer una referencia temporal, la documentación actual todavía permite grok-voice-transcribe-1.0. En una solicitud multipart, el campo del archivo debe quedar al final porque xAI advierte que los campos de opciones posteriores podrían ignorarse.

Usa la misma configuración de solicitud en ambos lados de la prueba de migración. Si se cambian a la vez el modelo, la diarización, el formato, el tratamiento de muletillas y los términos clave, será imposible saber qué modificación causó la diferencia en el resultado.

  1. Localiza todas las solicitudes sin un modelo fijado

    Busca en las rutas de código por lotes y de streaming las llamadas que omiten model. Incluye procesos en segundo plano, herramientas internas, entornos de prueba e integraciones de proveedores que puedan encapsular el endpoint. La documentación vigente ya dirige al modelo 2.0 cualquier solicitud que no lo especifique.

  2. Prepara un conjunto de audio representativo

    Elige ejemplos reales de las condiciones que recibe el sistema: grabaciones limpias, llamadas con ruido, hablantes superpuestos, acentos, nombres de producto, direcciones de correo electrónico, códigos de cuenta y los idiomas que concentran el volumen real. Elimina o protege los datos confidenciales de acuerdo con la política vigente.

  3. Ejecuta 1.0 y 2.0 con la misma configuración

    Fija cada modelo de forma explícita y mantén constantes todas las demás opciones. Guarda el texto de la transcripción, las marcas de tiempo, las asignaciones de hablantes y el resultado de cualquier resumen, búsqueda, puntuación o acción automatizada que consuma esos datos.

  4. Mide las diferencias humanas y del sistema

    Registra el tiempo de corrección por hora de audio. Marca los errores en nombres, números, atribución de hablantes y marcas de tiempo. Después compara el resultado posterior, porque un cambio en la transcripción solo importa si ayuda o perjudica la tarea que debe cumplir.

  5. Elige el modelo que quedará fijado en producción

    Fija 2.0 cuando supere las pruebas de aceptación. Conserva 1.0 únicamente como alternativa temporal documentada mientras siga disponible, y no bases un plan a largo plazo en una fecha de retiro que no se ha publicado.

La parte honesta

El precio está verificado. El ahorro de trabajo, no.

Las afirmaciones de xAI sobre la precisión son buenos motivos para hacer pruebas, pero no constituyen un modelo de dotación de personal. Mezclas de audio distintas pueden producir resultados diferentes, y una tasa de error por palabra más baja no implica automáticamente menos minutos de revisión ni una automatización más segura.

La comunicación sobre la transición también avanzó más rápido que el anuncio. La página del 18 de septiembre dice que el cambio del modelo predeterminado llegará pronto, mientras que la documentación actual ya muestra 2.0 como opción predeterminada cuando se omite el modelo. Esta discrepancia es otro motivo para especificar el modelo en producción en vez de depender de una referencia cambiante.

Por último, las tarifas de $0.10 y $0.20 cubren el procesamiento del audio. No incluyen la cola de revisión, el trabajo de integración, el almacenamiento, los reintentos ni el costo de una acción posterior equivocada. Mantén esas partidas separadas para que una API barata no oculte un flujo de trabajo costoso.

Qué hacer ahora

Actúa esta semana si alguna solicitud de voz a texto de xAI omite el modelo o si producción está fijada en 1.0. Haz un inventario de las llamadas, ejecuta el conjunto representativo y elige expresamente el modelo de producción.

Usa streaming solo cuando recibir la transcripción mientras se habla cambie el resultado del producto. Para las grabaciones que pueden esperar, usa el procesamiento por lotes: la diarización, las marcas de tiempo y las opciones de términos clave incluidas cuestan la mitad en la capa de audio.

Espera si apenas estás evaluando proveedores y ninguna transcripción de xAI alimenta un flujo de trabajo activo. Mantén 2.0 entre las opciones, pero compara el costo total de corrección y el costo posterior con tu propio audio antes de migrar.

No te afecta si el sistema no utiliza la conversión de voz a texto de xAI, o si ya fija 2.0 y validó su resultado. Una integración fijada en 1.0 es estable por ahora, pero eso no justifica aplazar la prueba de migración: xAI ya anunció que el modelo quedará obsoleto.

La tarea para el lunes es sencilla: toma audio representativo, ejecuta 1.0 y 2.0 con la misma configuración, mide el tiempo de corrección y las diferencias posteriores, y después fija el modelo que supere la prueba. Como el tarifario no cambió, el presupuesto de la API es fácil de calcular. Revisar la transcripción protege el flujo de trabajo que la rodea.

Para recibir un análisis práctico cuando cambia el precio o el flujo de trabajo de una herramienta de IA, suscríbete al boletín.

Última actualización
20 sept 2026
Categoría
Explained

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Cloudflare Browser Run: cómo depurar un trabajo fallido antes de repetirlo

Cloudflare Browser Run: cómo depurar un trabajo fallido antes de repetirlo

Cloudflare Browser Run reúne logs, solicitudes de red y el DOM final para diagnosticar un trabajo fallido antes de volver a ejecutarlo, sin adivinar.19 sept 2026Explained
Cómo usar componentes privados de tu sistema de diseño en v0

Cómo usar componentes privados de tu sistema de diseño en v0

v0 ya instala paquetes npm privados. Aprende a conectar los componentes de tu sistema de diseño, proteger credenciales y medir el trabajo antes de publicar.19 sept 2026Explained
Claude Code precio: Auto Mode elimina cargos del clasificador

Claude Code precio: Auto Mode elimina cargos del clasificador

Claude Code 2.1.278 elimina el cargo separado del clasificador en sesiones elegibles. Aprende a verificar la ruta del servidor antes de ajustar el presupuesto.19 sept 2026Explained
Vercel CLI: activa Turbo en un solo despliegue

Vercel CLI: activa Turbo en un solo despliegue

Activa Vercel Turbo en un despliegue urgente sin cambiar la configuración del proyecto. Compara el costo adicional de compilación con el tiempo ahorrado.18 sept 2026Explained
ChatGPT para Word elimina el copiar y pegar entre aplicaciones

ChatGPT para Word elimina el copiar y pegar entre aplicaciones

ChatGPT para Word permite redactar y revisar sin cambiar de aplicación. Revisa el acceso al complemento, los límites de uso y un flujo práctico.18 sept 2026Explained
Google Antigravity: cómo migrar trabajos locales antes del 5 de octubre

Google Antigravity: cómo migrar trabajos locales antes del 5 de octubre

Google Antigravity cierra el agente de mayo el 5 de octubre. Descubre qué trabajos solo cambian de ID y cuáles requieren adaptar sus herramientas locales.18 sept 2026Explained
Trazas de Cloudflare Workers: detecta la llamada lenta

Trazas de Cloudflare Workers: detecta la llamada lenta

Sigue una solicitud lenta entre Cloudflare Workers y Durable Objects, identifica la llamada que la retrasa y calcula el costo del tracing antes de activarlo.17 sept 2026Explained
Vercel Hobby y el límite de 10GB: qué despliegues están en riesgo

Vercel Hobby y el límite de 10GB: qué despliegues están en riesgo

Vercel Hobby puede borrar previews y puntos de rollback antes de 30 días si el equipo supera 10GB. Descubre qué protege y cómo revisar el historial.17 sept 2026Explained
Newsletter

Una carta, cada domingo.Sistemas que funcionan, no opiniones calientes.

Semanal. Sin spam. Cancele cuando quiera.