Claude Sonnet 5 vs GPT-5.6: Sonnet conviene, Sol offre il massimo

Claude Sonnet 5 vs GPT-5.6: prezzi, benchmark, coding e contesto a confronto per scegliere Sonnet, Terra, Sol o Luna in base al carico reale.

Thursday, September 3, 2026Omid Saffari
Claude Sonnet 5 vs GPT-5.6: Sonnet conviene, Sol offre il massimo

Claude Sonnet 5 vs GPT-5.6: Sonnet è la scelta predefinita più conveniente se si vuole puntare su un solo modello, a $2/$10 per milione di token fino al 31 agosto. Sol offre invece il potenziale più alto a $5/$30, mentre Terra è l’opzione OpenAI più economica a $2.50/$15. Con un carico mensile di 10M token in input e 2M in output, prima della cache si spendono $40 con Sonnet, $55 con Terra o $110 con Sol. Il vincitore, però, cambia ancora in base alla lunghezza del contesto e a come è progettato l’agente.

GPT-5.6 non è l’equivalente diretto di Sonnet, ma una famiglia di tre modelli: Sol privilegia le prestazioni massime, Terra bilancia capacità e costi, Luna gestisce grandi volumi a basso prezzo.

Pagina di lancio di OpenAI GPT-5.6 con Sol, Terra e Luna
OpenAI GPT-5.6

Claude Sonnet 5 è invece un unico modello, con un ampio intervallo di effort, una finestra di contesto da 1M token e un prezzo promozionale di lancio inferiore sia a Sol sia a Terra.

Pagina prodotto di Anthropic Claude Sonnet 5
Claude Sonnet 5

Claude Sonnet 5 vs GPT-5.6: il verdetto

Claude Sonnet 5 è oggi la scelta predefinita migliore per un agente in produzione. GPT-5.6 Sol prevale quando il compito è particolarmente difficile oppure quando gli strumenti di controllo degli agenti di OpenAI giustificano il sovrapprezzo. Per il normale lavoro di produzione, il confronto più sensato in casa OpenAI è con Terra; Luna va posizionato sotto entrambi, come primo passaggio economico da sottoporre a validazione.

ModelloIdeale perPrezzo API per 1M token input / outputContestoOutput massimoLimite principale
Claude Sonnet 5Stack di agenti con un solo modello, Claude Code, input lunghi$2 / $10 fino al 31 agosto, poi $3 / $151M128KCon il nuovo tokenizer, lo stesso testo può valere da 1.0x a 1.35x i token di Sonnet 4.6
GPT-5.6 SolPrestazioni massime, valutazioni difficili, lavoro multi-agent$5 / $301.05M128KÈ il modello con il prezzo di listino più alto; oltre 272K token in input scatta un sovrapprezzo sull’intera richiesta
GPT-5.6 TerraProduzione nell’ecosistema OpenAI con budget più contenuti$2.50 / $151.05M128KNei dati indipendenti attuali è meno capace di Sonnet con le impostazioni di effort confrontate
GPT-5.6 LunaEstrazione, classificazione, sintesi, tentativi economici$1 / $61.05M128KIl prezzo basso non lo rende un sostituto frontier per il lavoro complesso degli agenti

Tutti e quattro accettano testo e immagini e restituiscono testo. La differenza utile non sta nel contesto nominalmente un po’ più ampio di GPT-5.6, ma nel modo in cui ogni modello combina contesto, effort di ragionamento, strumenti e tentativi per portare a termine un’attività.

La recensione completa di GPT-5.6 approfondisce la suddivisione del routing tra Sol, Terra e Luna. La recensione di Claude Sonnet 5 esamina invece il nuovo tokenizer e i cambiamenti necessari per la migrazione.

I benchmark non concordano, ed è proprio questo il dato utile

Nessun benchmark serio assegna una vittoria assoluta a uno dei due modelli. Due confronti indipendenti e diretti arrivano a conclusioni opposte perché misurano tipi di lavoro diversi.

OmniaBench, una nuova valutazione general-agent composta da 1,431 attività e da un sottoinsieme impegnativo di 644 attività, rileva 58.54 Overall Pass@1 per Claude Sonnet 5 e 57.14 per GPT-5.6 Sol. Sonnet è avanti di 1.40 punti. Il distacco è abbastanza ridotto da considerare i modelli sostanzialmente alla pari su questa specifica distribuzione di attività; i punteggi sono anche abbastanza bassi da mettere in evidenza il vero limite: entrambi falliscono ancora una quota consistente dei compiti.

Artificial Analysis dà il verdetto opposto. Nel suo Intelligence Index, GPT-5.6 Sol con effort massimo ottiene 59, contro 53 di Claude Sonnet 5 con adaptive max effort. Nel confronto con Terra a effort medio, Sonnet totalizza 53 e Terra 46. Le impostazioni di effort contano: mettere Sonnet a effort massimo contro Terra a effort medio significa confrontare anche costi e latenza, non soltanto l’intelligenza.

EvidenzaSonnet 5GPT-5.6Cosa dimostra
OmniaBench Overall Pass@158.54Sol 57.14Sonnet ha un leggero vantaggio in questo ampio insieme di attività general-agent
Artificial Analysis Intelligence Index53Sol max 59Sol raggiunge il potenziale misurato più alto in questo indice
Artificial Analysis Intelligence Index53 ad adaptive maxTerra medium 46Sonnet offre più intelligenza misurata; Terra la scambia con velocità e risparmio
SWE-Bench Pro dichiarato dai vendor63.2%Sol 64.6%Solo un segnale di sostanziale parità, perché i vendor hanno usato esecuzioni e configurazioni di valutazione separate
Terminal-Bench 2.1 dichiarato dai vendor80.4%Sol 88.8%, Ultra 91.9%Sol dà il segnale più forte come agente da terminale, ma non è un confronto diretto e controllato

Ecco perché il primo in classifica può perdere nei test di produzione. Ogni benchmark premia il proprio insieme di attività, la configurazione degli strumenti, il tempo concesso, l’impostazione di ragionamento e il criterio di valutazione. Un agente che smista richieste di assistenza può privilegiare output strutturati e tentativi economici. A un agente che lavora su un repository servono patch corrette, test e uso continuativo degli strumenti. Un agente di ricerca deve recuperare le fonti e mantenere i vincoli. Sono prodotti diversi, anche quando condividono lo stesso endpoint del modello.

Per gli agenti di coding vince il sistema di esecuzione

GPT-5.6 Sol è la scelta più promettente per le attività che richiedono un uso intenso del terminale, se servono l’effort massimo e l’orchestrazione degli agenti di OpenAI. Claude Sonnet 5 è invece la soluzione predefinita migliore quando contano insieme il lavoro prolungato sul repository, Claude Code e il controllo dei costi.

Il modello è soltanto il motore di ragionamento. L’agente di coding che lo circonda fornisce la mappa del repository, il terminale, il sistema per applicare patch, il ciclo di test, i permessi e la memoria. Un divario ridotto nella qualità del modello può scomparire se uno dei due sistemi offre un contesto più pulito o intercetta un test fallito prima di consegnare la risposta.

Lo strumento distintivo di OpenAI è Programmatic Tool Calling. GPT-5.6 può scrivere un piccolo programma in memoria che coordina gli strumenti compatibili e filtra i risultati intermedi, riducendo i ripetuti passaggi dal modello. La Responses API offre inoltre l’esecuzione multi-agent in beta, mentre Ultra coordina quattro agenti per impostazione predefinita. È una funzione preziosa per un founder finanziato o un CTO che voglia suddividere una migrazione in flussi indipendenti per codice, test, documentazione e revisione.

L’ambiente che distingue Anthropic è Claude Code con l’adaptive thinking di Sonnet 5. In Claude Code e nella Claude API, Sonnet usa per impostazione predefinita un effort alto; Anthropic lo propone per agenti capaci di pianificare, usare strumenti e completare attività articolate in più passaggi. È disponibile anche tramite Claude Platform, AWS, Google Cloud e Microsoft Foundry: per un’azienda di fascia media già standardizzata su uno di questi cloud, l’approvvigionamento può risultare più semplice.

Per chi sviluppa da solo, la regola pratica è più semplice. Mantieni Sonnet come modello predefinito se completa l’intera modifica a $2/$10. Affida a Sol i fallimenti che richiedono molto terminale o le attività facili da dividere tra più agenti. Se Terra supera gli stessi test di accettazione, instrada lì l’implementazione di routine e riserva Sonnet o Sol alla coda difficile.

In produzione, il problema raramente è la sintassi. Più spesso, il modello imbocca una strada inutile, perde un vincolo dopo varie chiamate agli strumenti, riscrive troppo codice o dichiara concluso il lavoro prima che la suite di test sia passata. Con entrambi i modelli, richiedi un diff, test specifici e una condizione di completamento esplicita. Un ragionamento costoso non sostituisce un agente con confini chiari.

Sonnet vince oggi sui costi, soprattutto con contesti lunghi

Al prezzo di lancio, Claude Sonnet 5 costa meno di Terra e Sol; il vantaggio aumenta quando una richiesta OpenAI supera 272K token in input. Il cambio di prezzo di settembre riduce il margine sui contesti brevi, ma non elimina quello sui contesti lunghi.

Ecco tre tipi di carico calcolati in base agli attuali listini API dei vendor:

CaricoSonnet 5 fino al 31 agostoSonnet 5 dal 1 settembreGPT-5.6 LunaGPT-5.6 TerraGPT-5.6 Sol
Una richiesta: 100K input, 10K output$0.30$0.45$0.16$0.40$0.80
Una richiesta: 300K input, 30K output$0.90$1.35$0.87$2.175$4.35
Mensile: 10M input, 2M output, tutte le richieste sotto 272K$40$60$22$55$110

La riga dei 300K è quella che sfugge alla maggior parte dei confronti. Quando l’input supera 272K token, OpenAI addebita 2x sull’input e 1.5x sull’output per l’intera richiesta. Anthropic include invece tutto il contesto da 1M token di Sonnet alle normali tariffe per token. Una chiamata con 300K token in input e 30K in output costa quindi $2.175 con Terra, ma solo $1.35 con Sonnet anche dopo l’aumento di settembre.

Diagramma a due corsie: il prezzo OpenAI aumenta oltre 272K token in input, mentre Claude mantiene le tariffe standard fino a 1M
Oltre 272K token in input, OpenAI ricalcola il prezzo dell’intera richiesta; Sonnet mantiene la tariffa standard fino a 1M.

La prima riga mostra l’altro lato della medaglia. Con 100K token in input e 10K in output, durante il periodo di lancio Sonnet costa $0.30, Terra $0.40 e Sol $0.80. Dal 1 settembre Sonnet sale a $0.45, perciò Terra diventa più conveniente in questa specifica richiesta a contesto breve. Sul prezzo di listino, Terra passa a essere il modello intermedio più economico; Sonnet può comunque vincere sul costo per attività completata se il suo tasso di successo superiore evita un nuovo tentativo.

Il tokenizer di Sonnet richiede una precisazione. Secondo Anthropic, a seconda del contenuto lo stesso input può diventare da 1.0x a 1.35x il numero di token di Sonnet 4.6. Questo non dimostra un aumento equivalente rispetto a GPT-5.6. I tokenizer segmentano il testo in modo diverso, quindi l’unico confronto corretto tra vendor consiste nel verificare il conteggio comunicato da ciascuna API sullo stesso carico rappresentativo.

Per le durate brevi, i costi della cache sono simili. OpenAI e Anthropic addebitano entrambe 1.25x la tariffa base dell’input per una scrittura standard in cache e 0.1x per una lettura. OpenAI indica una durata minima di 30 minuti per la cache esplicita di GPT-5.6. Anthropic propone una scrittura da 5 minuti a 1.25x oppure da 1 ora a 2x. Con la Batch API asincrona, Anthropic riduce inoltre del 50% i prezzi di input e output, portando la tariffa batch promozionale di Sonnet a $1/$5.

GPT-5.6 è il sistema più potente quando si usa l’intera famiglia

GPT-5.6 giustifica il sovrapprezzo con routing e orchestrazione, non rendendo Sol il modello predefinito per ogni chiamata. OpenAI offre tre endpoint con lo stesso contesto da 1.05M token e un output massimo di 128K, così da adattare il costo del modello alle conseguenze dell’attività.

Ideale per: team già sulla Responses API, in grado di instradare separatamente le attività facili, medie e difficili
Punto di forza: Programmatic Tool Calling e una beta multi-agent, con Sol come opzione ad alte prestazioni
Prezzi: Luna $1/$6, Terra $2.50/$15, Sol $5/$30 per 1M token di input/output
Da evitare se: cerchi un solo endpoint economico per ogni carico oppure la maggior parte delle richieste supera 272K token in input

Luna dovrebbe classificare, estrarre, riassumere e preparare bozze quando un validatore può intercettare gli errori. Terra dovrebbe occuparsi del normale lavoro di produzione. Sol va riservato alle attività in cui la qualità del giudizio o il costo di un errore contano più del costo dei token. L’alias senza suffisso gpt-5.6 seleziona Sol, quindi una migrazione non verificata può scegliere silenziosamente la fascia più costosa.

I punti di forza
Cosa fa bene
8 points

  • Tre fasce di prezzo e capacità permettono un routing esplicito
  • Nell’attuale confronto di Artificial Analysis, Sol raggiunge il potenziale più alto
  • Programmatic Tool Calling può ridurre i passaggi dal modello nei workflow che usano molti strumenti
  • La beta multi-agent e Ultra supportano le attività divisibili in flussi paralleli indipendenti
  • Sol costa $5/$30, molto più delle tariffe attuali e di settembre di Sonnet
  • Il moltiplicatore oltre 272K può più che raddoppiare il vantaggio di Terra o Sol sui documenti lunghi
  • Tre fasce richiedono un lavoro di valutazione e routing che uno stack con un solo modello evita
  • Con effort medio, Terra resta dietro a Sonnet con adaptive max nell’attuale confronto di Artificial Analysis

La famiglia GPT-5.6 è l’architettura giusta per carichi eterogenei. Un CTO di un’azienda di fascia media che gestisce una grande coda di attività di routine e una piccola coda di indagini difficili non dovrebbe pagare il prezzo di Sol per ogni record. La routine va a Luna, i casi ambigui a Terra e soltanto gli errori più costosi a Sol.

Claude Sonnet 5 è la scelta migliore con un solo modello

Claude Sonnet 5 offre a un agente di produzione prestazioni vicine alla frontiera, l’intero contesto da 1M alle tariffe standard e un prezzo attualmente inferiore, senza obbligare a gestire tre percorsi diversi. Questa semplicità ha valore quando il programma di valutazione è ancora agli inizi.

Ideale per: Claude Code, contesti lunghi di repository o documenti e team che vogliono un unico endpoint solido per gli agenti
Punto di forza: 58.54 su OmniaBench a $2/$10 fino al 31 agosto
Prezzi: $2/$10 fino al 31 agosto, poi $3/$15 per 1M token di input/output
Da evitare se: il carico trae un vantaggio specifico da Programmatic Tool Calling, dalla beta multi-agent di OpenAI o dal potenziale misurato più alto di Sol

Grazie all’adaptive thinking, Sonnet può dedicare più lavoro alle richieste difficili senza ricorrere a un endpoint flagship separato. Nell’API e in Claude Code, l’impostazione predefinita è un effort alto. È comodo, ma può far aumentare latenza e consumo di token se l’effort rimane implicito. Conviene impostarlo deliberatamente.

I punti di forza
Cosa fa bene
8 points

  • Il prezzo di listino attuale più basso tra le opzioni serie che puntano su un unico modello in questo confronto
  • L’intero contesto da 1M token resta alle tariffe standard
  • Un leggero vantaggio su Sol nel nuovo insieme general-agent di OmniaBench
  • Claude Code e l’accesso tramite quattro grandi piattaforme cloud riducono gli attriti di integrazione
  • Il prezzo di lancio termina il 31 agosto e sale a $3/$15
  • Con il nuovo tokenizer, lo stesso testo può arrivare fino a 1.35x i token di Sonnet 4.6
  • Un solo endpoint non offre né i volumi economici di Luna né un percorso esplicito verso il potenziale di Sol
  • Sol è avanti nell’attuale confronto dell’Artificial Analysis Intelligence Index

Sonnet è il punto di partenza migliore per un professionista senior che costruisce un agente di ricerca, analisi o gestione documentale con richieste di forma imprevedibile. Offre un’unica base solida ed evita l’impennata dei prezzi OpenAI sui contesti lunghi. Aggiungi un modello meno costoso solo quando nel carico emergono abbastanza attività semplici e ripetibili da giustificare un router.

Quale modello scegliere in ogni scenario

La scelta cambia in base a quattro variabili: conseguenze di un errore, lunghezza dell’input, latenza accettabile e quantità di infrastruttura di routing che si può sostenere.

ScenarioParti daEscalation o fallbackPerché
Founder finanziato che delega strategia, due diligence e ricerca di prodottoSonnet 5Sol per le decisioni con le conseguenze più alteSonnet contiene il costo di base; Sol offre un potenziale misurato superiore quando una singola risposta conta
CTO di un’azienda di fascia media con agenti per repository e policySonnet 5 o TerraSol per migrazioni e incidenti complessiSonnet favorisce i contesti lunghi; Terra si integra in un control plane OpenAI già esistente
Professionista senior che elabora documenti standardizzatiLunaSonnet 5 per i casi ambiguiUna validazione economica rende utile Luna a $1/$6; Sonnet gestisce la coda difficile
Sviluppatore indipendente che lavora in Claude CodeSonnet 5Sol per i fallimenti che richiedono molto terminaleSonnet è la scelta nativa predefinita e oggi offre il rapporto qualità-prezzo migliore
Prodotto nativo OpenAI con molte richieste interattive breviTerraSol solo quando fallisce la valutazioneNell’esempio 100K/10K, Terra costa meno di Sonnet a settembre ed evita il sovrapprezzo generalizzato di Sol
Workflow legale, finanziario o su repository che supera regolarmente 272K inputSonnet 5Sol solo dopo averne misurato il valoreSonnet mantiene le tariffe standard fino a 1M; OpenAI ricalcola il prezzo dell’intera richiesta lunga
Ricerca o sviluppo parallelo con rami indipendentiSol con multi-agentSonnet come fallback di un altro vendorOpenAI espone direttamente il percorso di orchestrazione

Aspetta se nessuno dei due modelli migliora la percentuale di risultati accettati. Un sistema esistente stabile, che supera già le prove sul carico reale, vale più di un nuovo endpoint con regressioni non misurate. Procedi quando il nuovo modello riduce i costi o i tempi di revisione, aumenta il tasso di completamento oppure abilita uno schema di strumenti che il vecchio sistema non supporta.

Una policy di routing pronta anche per la prossima release

Un’architettura durevole parte dalle conseguenze dell’attività, non da un vincitore permanente tra i modelli. Mantieni indipendenti dal provider gli schemi degli strumenti e i test di accettazione, poi instrada il lavoro in base alle evidenze.

Flusso decisionale che instrada il lavoro di routine a Luna, il modello unico e i contesti lunghi a Sonnet, il lavoro bilanciato su OpenAI a Terra e le prestazioni massime a Sol
Il routing segue la forma del carico: validazione economica, contesto lungo, compatibilità con la piattaforma e infine conseguenze.
  1. Imposta Sonnet come baseline solida

    Esegui su claude-sonnet-5, con un’impostazione di effort esplicita, attività rappresentative di coding, ricerca, documentazione e uso degli strumenti. Registra risultato accettato, token, latenza, tentativi e tempo di correzione umana.

  2. Aggiungi Terra e Luna quando validare costa poco

    Affida estrazione strutturata, classificazione, sintesi e implementazione di routine a gpt-5.6-luna o gpt-5.6-terra. Esegui l’escalation in presenza di campi mancanti, test falliti, dubbi sulle policy e output con bassa confidenza.

  3. Riserva Sol a una coda difficile misurata

    Usa gpt-5.6-sol per debugging complesso, analisi ad alto impatto, sicurezza o attività degli agenti parallelizzabili. Non usare l’alias gpt-5.6 se la selezione intenzionale di Sol non è esplicita.

  4. Instrada le richieste lunghe prima di superare 272K

    Misura il numero di token prima della chiamata. Sposta su Sonnet il vero lavoro da un milione di token, recupera un insieme di evidenze più piccolo oppure accetta consapevolmente il moltiplicatore di OpenAI sull’intera richiesta.

  5. Tieni entrambi i provider dietro un unico contratto

    Uniforma i nomi degli strumenti, gli output strutturati, la gestione degli errori e i passaggi di approvazione. Un fallback su un altro vendor protegge il prodotto da limiti di capacità, regressioni e dal prossimo ribaltamento nei benchmark.

Claude Sonnet 5 è migliore di GPT-5.6 per il coding?

Non in assoluto. OpenAI dichiara 64.6% per Sol e Anthropic 63.2% per Sonnet su SWE-Bench Pro, ma si tratta di esecuzioni separate dei due vendor. Sol offre il segnale più forte come agente da terminale; Sonnet è oggi la scelta predefinita più conveniente. Provali entrambi sui tuoi repository, test e criteri di revisione.

Qual è più economico: GPT-5.6 o Claude Sonnet 5?

Fino al 31 agosto, Sonnet 5 a $2/$10 costa meno di Terra a $2.50/$15 e di Sol a $5/$30. Dal 1 settembre, Sonnet passa a $3/$15: Terra diventa più economico in input e ha lo stesso prezzo in output. Luna rimane il più conveniente a $1/$6.

Quale modello offre la finestra di contesto più ampia?

GPT-5.6 dichiara 1.05M token e Sonnet 5 ne dichiara 1M. In genere, Sonnet è la scelta economicamente migliore per i contesti lunghi: Anthropic mantiene le tariffe standard su tutta la finestra, mentre OpenAI addebita 2x sull’input e 1.5x sull’output per l’intera richiesta oltre 272K token in input.

Posso usare Claude Sonnet 5 e GPT-5.6 nella stessa app?

Sì. Metti entrambi dietro un adapter indipendente dal provider per messaggi, strumenti, output strutturati, errori e approvazioni. Instrada in base al tipo di attività e mantieni il secondo provider come fallback, invece di disseminare nel prodotto comportamenti specifici del singolo vendor.

Ultimo aggiornamento

3 set 2026

CategoriaAI

Preferisca questo sito su Google

Aggiungi omidsaffari.com come fonte preferita nella Ricerca Google

Segni omidsaffari.com come fonte preferita e Google lo mette in evidenza per lei in Top Stories, AI Overviews e AI Mode.

Newsletter

Una lettera, ogni domenica. Sistemi che funzionano, non hot take.

Build log, sistemi in produzione e note dal campo da un portafoglio di venture AI.

Settimanale. Niente spam. Si cancella quando vuole.