Trascrizione audio con Grok Voice 2.0: costi fermi, nuovo default

La trascrizione audio con Grok Voice Transcribe 2.0 mantiene i prezzi, ma cambia il modello predefinito: test, costi e passaggi per migrare senza sorprese.

Sunday, September 20, 2026Omid Saffari
Tools
Trascrizione audio con Grok Voice 2.0: costi fermi, nuovo default

La trascrizione audio con Grok Voice Transcribe 2.0 resta a $0.10 l'ora in batch e $0.20 l'ora in streaming. Il punto critico è che nella documentazione live è cambiato il modello predefinito: la stessa chiamata API senza un modello specificato può quindi produrre un testo diverso e modificare il lavoro che avviene a valle.

Cosa è cambiato davvero

xAI ha rilasciato Grok Voice Transcribe 2.0 il 18 settembre 2026. È il nuovo modello speech-to-text al posto di Grok Voice Transcribe 1.0: converte in testo il parlato registrato o in diretta, così che possa essere utilizzato da un altro prodotto o workflow.

Le due modalità operative sono semplici. In batch, un file o un URL audio viene inviato a un endpoint REST quando la registrazione esiste già. In streaming, l'audio viaggia via WebSocket mentre la persona sta ancora parlando; sottotitoli, risposte di un agente o strumenti di assistenza live possono così reagire prima della fine della chiamata.

La pagina di lancio afferma che le integrazioni esistenti possono passare al modello 2.0 senza modifiche al codice. Sembra una transizione indolore, ma è proprio qui che chi gestisce il servizio deve prestare attenzione. Se la richiesta non indica un modello, è il provider a decidere quando cambia l'output.

Il listino è rimasto invariato. Il batch costa ancora $0.10 per ora di audio; lo streaming $0.20. La diarizzazione dei parlanti, che attribuisce le parole alle diverse voci, i timestamp a livello di singola parola e il bias sui termini chiave sono inclusi nelle tariffe.

Il costo della trascrizione audio resta invariato. Quello del workflow potrebbe cambiare

A livello di API, i conti sono chiari:

ModalitàTariffa per ora di audioCosto per 1,000 ore di audioQuando usarla
Batch$0.10$100La registrazione esiste già
Streaming$0.20$200La trascrizione deve arrivare durante la conversazione

Lo streaming costa il doppio del batch. Su 1,000 ore di audio, la differenza è di $100. È un sovrapprezzo giustificato quando attendere la fine della registrazione comprometterebbe il prodotto, come nel caso di sottotitoli live, assistenza alle chiamate in tempo reale o di un agente vocale che deve decidere subito cosa rispondere.

Se l'audio è già archiviato, lo streaming non rende di per sé più utile la trascrizione. Per un archivio media, una coda di podcast, interviste registrate o l'analisi notturna delle chiamate, in genere conviene restare sul batch e mantenere la tariffa più bassa.

La voce API è soltanto una parte del budget. L'equazione operativa utile è questa:

Costo totale della trascrizione = spesa per l'API audio + costo delle correzioni umane + rilavorazione a valle

Il primo termine deriva direttamente dal listino. Il secondo dipende dal tempo impiegato dai revisori e dal loro costo orario complessivo. Il terzo emerge quando variazioni nelle parole, nell'attribuzione dei parlanti, nei timestamp o nella formattazione dei numeri modificano un file di sottotitoli, un punteggio di qualità, una nota nel CRM, un indice di ricerca o un'azione automatizzata.

Questa è la conseguenza concreta del rilascio. La spesa per l'audio può restare perfettamente stabile, mentre il costo complessivo per ottenere una trascrizione utilizzabile può salire o scendere. Finché non si prova il modello su audio rappresentativo, una riduzione dei tempi di correzione è soltanto una possibilità, non un risparmio da inserire nelle previsioni.

A chi serve e cosa cambia in pratica

Responsabile operativo dell'assistenza clienti con chiamate registrate

Un team di assistenza può inviare le chiamate registrate in batch a $0.10 per ora di audio, attivare la diarizzazione e indicare i nomi dei prodotti come termini chiave. Il costo diretto dell'API resta prevedibile. La vera domanda della migrazione è se 2.0 riduca o aumenti i minuti che un revisore dedica a correggere nomi, dati degli account e attribuzioni dei parlanti.

Il vantaggio non è un punteggio astratto di accuratezza. È una coda di correzioni più corta, senza più errori nei passaggi successivi. Prima di cambiare il modello fissato in produzione, vanno misurati entrambi gli aspetti.

Team di prodotto che gestisce un agente vocale live

Per un agente vocale, attendere la fine della chiamata vanifica il prodotto. Lo streaming a $0.20 per ora di audio giustifica la tariffa più alta perché la trascrizione fa parte del ciclo di controllo in tempo reale. Il team dovrebbe confrontare il comportamento dei due modelli con pause, numeri, interruzioni e termini chiave, quindi verificare le azioni attivate a partire dalle trascrizioni.

Una trascrizione può apparire più pulita a una persona e tuttavia compromettere il workflow, se un valore formattato diversamente altera una ricerca o se la segmentazione di un turno induce l'agente a rispondere troppo presto. Il test di accettazione deve includere l'azione a valle, non soltanto il testo.

Responsabile delle operazioni media che pubblica sottotitoli

Un'agenzia che lavora interviste o video dei clienti dovrebbe usare il batch, includere i timestamp nel confronto e verificare con entrambi i modelli gli stessi nomi difficili e le stesse voci sovrapposte. Il risultato va misurato nel tempo necessario per le correzioni e nella qualità della consegna dei sottotitoli, non nel benchmark aggregato del provider.

Un'API è un componente, non un ambiente di lavoro per l'editing. Se servono un editor nel browser, un bot per le riunioni, un workflow per i sottotitoli o un percorso di escalation a una persona, è più utile il confronto completo degli strumenti di trascrizione.

Team di assistenza SaaS multilingue

Secondo xAI, 2.0 è due volte più accurato di 1.0 nelle sue valutazioni. L'azienda riferisce inoltre che il word error rate sul proprio set multilingue di frasi brevi è sceso dal 20.6% al 6.8%. Sono confronti condotti dal fornitore, non test eseguiti per questo articolo.

Un team di assistenza multilingue dovrebbe campionare il proprio mix reale di lingue, accenti, linee telefoniche, nomi e code-switching. Un miglioramento aggregato non dice se siano progredite le lingue da cui arriva la maggior parte dei ticket, né se il tempo di correzione sia cambiato abbastanza da incidere sull'organico.

Specifica il modello, poi testa l'output

La chiamata batch minima richiede poche righe. Questo esempio cURL riproduce la richiesta documentata da xAI, indicando esplicitamente il modello 2.0:

Bash
curl -X POST https://api.x.ai/v1/stt \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -F model=grok-voice-transcribe-2.0 \
  -F file=@audio.mp3

La riga decisiva è quella del modello. Specificare grok-voice-transcribe-2.0 rende la scelta esplicita. Per creare temporaneamente una baseline, la documentazione attuale permette ancora di indicare grok-voice-transcribe-1.0. Nei multipart, il campo del file va lasciato per ultimo: xAI avverte che i campi delle opzioni inseriti dopo potrebbero essere ignorati.

Per entrambi i lati del test di migrazione vanno usate le stesse impostazioni. Se si cambiano contemporaneamente modello, diarizzazione, formattazione, gestione dei riempitivi e termini chiave, diventa impossibile capire quale modifica abbia causato la differenza nell'output.

  1. Individua tutte le richieste senza un modello specificato

    Cerca nei percorsi batch e streaming le chiamate che omettono model. Includi processi in background, strumenti interni, staging e integrazioni di terze parti che potrebbero fare da wrapper all'endpoint. La documentazione live ora instrada al modello 2.0 le richieste che non ne indicano uno.

  2. Crea un set di audio rappresentativo

    Scegli esempi reali delle condizioni incontrate dal sistema: registrazioni pulite, chiamate rumorose, voci sovrapposte, accenti, nomi di prodotto, indirizzi email, codici account e le lingue che generano un volume effettivo. Rimuovi o proteggi i dati sensibili secondo le regole già in uso.

  3. Esegui 1.0 e 2.0 con impostazioni identiche

    Specifica esplicitamente ciascun modello e mantieni costante ogni altra opzione. Conserva il testo della trascrizione, i timestamp, l'attribuzione dei parlanti e l'output di ogni riepilogo, ricerca, punteggio o azione automatizzata che utilizza quei dati.

  4. Misura le differenze per persone e sistemi

    Registra il tempo di correzione del revisore per ogni ora di audio. Classifica gli errori in nomi, numeri, attribuzione dei parlanti e timestamp. Confronta poi il risultato a valle: una variazione nella trascrizione conta soltanto se migliora o peggiora il compito per cui la trascrizione viene prodotta.

  5. Scegli il modello da fissare in produzione

    Passa a 2.0 dopo che ha superato i controlli di accettazione. Mantieni 1.0 solo come fallback temporaneo e documentato finché resta disponibile; non costruire un piano di lungo periodo attorno a una data di ritiro che non è stata pubblicata.

Il punto da non nascondere

Il prezzo è verificato. Il risparmio sul lavoro umano no.

Le dichiarazioni di xAI sull'accuratezza sono un buon motivo per eseguire un test, ma non costituiscono un modello per pianificare l'organico. Mix audio diversi possono dare risultati diversi e un word error rate più basso non equivale automaticamente a meno minuti di revisione o a un'automazione più sicura.

Anche il messaggio sulla transizione si è mosso più rapidamente dell'annuncio. La pagina del 18 settembre dice che il cambio del modello predefinito avverrà presto, mentre la documentazione attuale mostra già 2.0 come default quando il modello viene omesso. È un motivo in più per specificarlo in produzione, anziché affidarsi a un alias che cambia.

Infine, le tariffe di $0.10 e $0.20 coprono l'elaborazione audio. Non includono la coda di revisione, il lavoro d'integrazione, lo storage, i tentativi ripetuti o il costo di un'azione a valle sbagliata. Tenere separate queste voci evita che un'API economica nasconda un workflow costoso.

Cosa fare adesso

Intervieni questa settimana se una richiesta speech-to-text a xAI omette il modello o se la produzione è fissata su 1.0. Fai l'inventario delle chiamate, esegui il set rappresentativo e scegli esplicitamente il modello di produzione.

Usa lo streaming soltanto quando ricevere la trascrizione mentre qualcuno parla cambia il risultato del prodotto. Per le registrazioni che possono aspettare, scegli il batch: diarizzazione, timestamp e opzioni per i termini chiave sono inclusi, mentre a livello audio il batch costa la metà.

Aspetta se stai soltanto valutando i provider e nessuna trascrizione xAI alimenta un workflow live. Mantieni 2.0 nella rosa dei candidati, ma prima di migrare confronta sui tuoi audio il costo totale delle correzioni e delle attività a valle.

Non cambia nulla per te se il sistema non usa lo speech-to-text di xAI, oppure se hai già fissato 2.0 e ne hai convalidato l'output. Un'integrazione bloccata su 1.0 è stabile per il momento, ma non è un buon motivo per rimandare il test di migrazione: xAI ne ha già annunciato la deprecazione.

L'azione da mettere in calendario lunedì è semplice: prendi audio rappresentativo, esegui 1.0 e 2.0 con le stesse impostazioni, misura il tempo di correzione e le differenze a valle, quindi fissa il modello che supera il test. Con il listino invariato, prevedere il budget API è facile. Verificare le trascrizioni protegge tutto il workflow che le circonda.

Per un'analisi pratica di cosa succede davvero quando cambia il prezzo o il workflow di un prodotto AI, iscriviti alla newsletter.

Ultimo aggiornamento
20 set 2026
Categoria
Explained

Preferisca questo sito su Google

Aggiungi omidsaffari.com come fonte preferita nella Ricerca Google

Segni omidsaffari.com come fonte preferita e Google lo mette in evidenza per lei in Top Stories, AI Overviews e AI Mode.

Cloudflare Browser Run: analizzare un job fallito prima di rieseguirlo

Cloudflare Browser Run: analizzare un job fallito prima di rieseguirlo

Scopri come ispezionare log, richieste di rete, file HAR e DOM finale di un job Cloudflare Browser Run fallito prima di avviare un nuovo tentativo.19 set 2026Explained
v0 collega i prototipi al design system privato del team

v0 collega i prototipi al design system privato del team

v0 installa librerie di componenti private con NPM_TOKEN o NPM_RC. Come usare il design system reale senza esporre le credenziali al modello.19 set 2026Explained
Claude Code Enterprise: l’Auto Mode taglia i costi del classificatore

Claude Code Enterprise: l’Auto Mode taglia i costi del classificatore

Claude Code Enterprise 2.1.278 può spostare sul server i controlli dell’Auto Mode. Ecco quando spariscono i costi separati del classificatore.19 set 2026Explained
Vercel pricing: quanto costa Turbo per un solo deployment

Vercel pricing: quanto costa Turbo per un solo deployment

Vercel pricing e Turbo: costi, requisiti e tre metodi per accelerare un solo deployment urgente senza modificare le impostazioni del progetto.18 set 2026Explained
ChatGPT Word: scrivere e revisionare senza cambiare app

ChatGPT Word: scrivere e revisionare senza cambiare app

ChatGPT Word porta bozze, sintesi e revisioni nella barra laterale di Word. Ecco requisiti, limiti, costi d’uso e un flusso di lavoro concreto.18 set 2026Explained
Google Antigravity: come migrare i job API entro il 5 ottobre

Google Antigravity: come migrare i job API entro il 5 ottobre

Scopri quali job di Google Antigravity richiedono un nuovo adapter, quali necessitano solo del nuovo ID agente e come migrare entro il 5 ottobre.18 set 2026Explained
Tracing Cloudflare Workers: come individuare il servizio che rallenta una richiesta

Tracing Cloudflare Workers: come individuare il servizio che rallenta una richiesta

Il tracing Cloudflare Workers ora segue le chiamate RPC tra Worker e Durable Object: come isolare il servizio lento e stimare costi e conservazione.17 set 2026Explained
Vercel Hobby oltre 10GB: la regola dei 30 giorni non basta più

Vercel Hobby oltre 10GB: la regola dei 30 giorni non basta più

Con Vercel Hobby, superati 10GB di Deployment Storage, preview e rollback non protetti possono sparire prima dei 30 giorni. Ecco cosa proteggere.17 set 2026Explained
Newsletter

Una lettera, ogni domenica.Sistemi che funzionano, non hot take.

Settimanale. Niente spam. Si cancella quando vuole.