GPT-5.6 alla prova: Sol, Terra, Luna e la regola di routing
GPT-5.6 alla prova: confronto tra Sol, Terra e Luna su prezzi, contesto lungo, benchmark e routing per scegliere il modello giusto per ogni carico.

Vale la pena adottare GPT-5.6, ma non come unico modello predefinito. Sol, Terra e Luna offrono tutti una finestra di contesto da 1.05M token, rispettivamente a $5/$30, $2.50/$15 e $1/$6 per milione di token in input/output. Eppure, nella valutazione di retrieval di OpenAI da 512K a 1M, Luna scende a 41.3, mentre Sol e Terra si mantengono a 73.8 e 72.5. La regola di routing è netta: Luna per grandi volumi con contesto breve, Terra per il contesto lungo a costi sostenibili, Sol per le decisioni difficili e il lavoro agentico.
GPT-5.6 di OpenAI ha raggiunto la disponibilità generale il 9 luglio 2026 su ChatGPT, Codex e API. La famiglia sostituisce la scelta di un unico modello di punta con tre decisioni basate sul carico di lavoro.

GPT-5.6: il verdetto in una tabella
GPT-5.6 va gestito come un sistema a tre percorsi, non come un solo modello predefinito. I nomi dei livelli indicano la capacità, ma sono la lunghezza del contesto e il costo di un errore a stabilire quale endpoint meriti la chiamata.
Tutti e tre accettano testo e immagini, restituiscono testo, supportano una finestra di contesto da 1,050,000 token e possono generare fino a 128,000 token di output. La stessa documentazione dei modelli OpenAI consiglia Sol per il ragionamento complesso e il coding, Terra per bilanciare intelligenza e costo, Luna per i volumi sensibili al prezzo.
Questa progressione ordinata nasconde però la vera differenza operativa. Nella valutazione multi-needle di OpenAI da 512K a 1M, che verifica se il modello riesce a trovare più informazioni sparse in un input molto lungo, Sol ottiene 73.8, Terra 72.5 e Luna 41.3. Terra cede appena 1.3 punti a Sol; Luna ne perde 31.2. La finestra di contesto dice quanto materiale entra in una richiesta, non quanto il modello sappia usarlo in modo affidabile.
Cosa cambia rispetto a GPT-5.5
GPT-5.6 modifica il modello operativo più del listino. Sol costa gli stessi $5 in input e $30 in output per milione di token di GPT-5.5, mentre Terra e Luna introducono due percorsi meno costosi.
I nomi sono pensati per durare. Sol è il livello di punta, Terra prende grosso modo il posto del vecchio mini e Luna quello di nano. Nell'API, l'alias senza suffisso gpt-5.6 indirizza a Sol: usare il nome breve seleziona quindi, senza renderlo evidente, il livello più costoso. Chi vuole controllare il routing dovrebbe chiamare esplicitamente gpt-5.6-sol, gpt-5.6-terra o gpt-5.6-luna.
Il ventaglio di capacità è ampio. Tutti e tre supportano streaming, function calling, output strutturati, ricerca web, ricerca nei file, lo strumento separato per generare immagini, code interpreter, shell ospitata, apply patch, skill, computer use, MCP e tool search tramite la Responses API. Il fine-tuning non è supportato. I modelli accettano immagini in input e restituiscono testo, mentre audio e video non rientrano tra le modalità supportate.
Per gli agenti contano due nuove opzioni di ragionamento. max concede al modello più tempo di ragionamento rispetto a xhigh. ultra coordina quattro agenti in parallelo per impostazione predefinita: usa più token, ma sui lavori adatti può offrire un risultato migliore in meno tempo. Gli sviluppatori possono realizzare uno schema simile con la beta multi-agent della Responses API.
Programmatic Tool Calling è la novità produttiva meno appariscente. Consente a GPT-5.6 di scrivere ed eseguire piccoli programmi in memoria per coordinare gli strumenti e filtrare i risultati intermedi prima di restituirli al modello. Nei workflow con molte ricerche o molti dati può eliminare ripetuti passaggi di andata e ritorno con il modello; OpenAI dichiara inoltre che il design è compatibile con Zero Data Retention.
GPT-5.5 conserva comunque un ruolo preciso. GPT-5.5 Instant resta il modello predefinito per le risposte quotidiane e rapide di ChatGPT, mentre GPT-5.6 Sol alimenta le modalità di ragionamento a pagamento. Non ha senso imporre un modello di ragionamento a saluti, piccole riscritture o chat semplici solo perché il numero di versione è più recente.
GPT-5.6 Sol è pensato per le decisioni e il lavoro agentico più difficile
GPT-5.6 Sol è il modello su cui investire quando il compito richiede capacità di giudizio lungo molti passaggi, non soltanto una prima bozza ben rifinita. È il livello più potente, l'alias gpt-5.6 punta a questo modello e il prezzo resta quello di GPT-5.5, senza un sovrapprezzo da flagship.
Ideale per: analisi di incidenti in produzione, revisioni di sicurezza, migrazioni difficili, agenti di ricerca e attività professionali ad alto rischio
Punto di forza: il miglior ragionamento e le migliori prestazioni sul contesto lungo della famiglia GPT-5.6
Prezzo: $5 in input, $0.50 per l'input in cache e $30 in output per 1M token
Da evitare se: il compito è ripetitivo, facile da verificare o economico da ripetere
I dati indipendenti confermano il posizionamento sui lavori complessi. Artificial Analysis assegna a Sol 59 nel suo Intelligence Index, a $1.04 per task: un punto meno di Claude Fable 5 a circa un terzo del costo. Nel Coding Agent Index, Sol con Codex è primo a 80.
I dati di lancio di OpenAI restituiscono un quadro più sfumato, e proprio per questo utile. Sol ottiene 88.8% su Terminal-Bench 2.1; Sol Ultra arriva a 91.9%. Su SWE-Bench Pro, Sol raggiunge 64.6%, sopra il 59.4% di GPT-5.5 ma molto sotto l'80% di Claude Fable 5. Sol è un modello di coding molto valido, non il vincitore universale. Quando il confronto include Claude, Gemini e modelli self-hosted, resta importante la più ampia classifica dei modelli AI per il coding.
Il risultato sul contesto lungo è la ragione più evidente per pagare Sol. Nel test multi-needle di OpenAI ottiene 91.5% tra 256K e 512K e 73.8% tra 512K e 1M. Per un founder finanziato che chiede a un agente di riconciliare una data room, una serie di contratti e un piano operativo, quel margine ha senso. Non lo ha per chi chiede dieci varianti di una landing page.
- Il miglior punteggio complessivo per intelligenza e coding nella famiglia GPT-5.6
- La scelta più solida per lavori lunghi, ricchi di strumenti e articolati in più passaggi
- Stesso prezzo di listino di GPT-5.5, con risultati migliori in diverse valutazioni agentiche
- Supporta tutti gli strumenti attuali della Responses API elencati per la famiglia
- $30 per milione di token in output penalizzano i loop agentici prolissi
- I prompt oltre 272K token in input attivano il sovrapprezzo per il contesto lungo
- Claude Fable 5 resta nettamente avanti nel risultato pubblicato di SWE-Bench Pro
- La system card di OpenAI segnala una maggiore tendenza ad andare oltre l'intento dell'utente
GPT-5.6 Terra si giustifica con il contesto lungo
GPT-5.6 Terra è il livello economico per il contesto lungo, anche se non è la scelta dal miglior rapporto qualità-prezzo per un uso generalista. La sua ragion d'essere non è occupare ordinatamente lo spazio fra Sol e Luna: è restare vicino a Sol quando il contesto diventa molto esteso.
Ideale per: analisi di grandi repository, raccolte di policy, data room per la due diligence e agenti che lavorano su molti documenti
Punto di forza: retrieval quasi al livello di Sol tra 512K e 1M token, alla metà del prezzo di listino di Sol
Prezzo: $2.50 in input, $0.25 per l'input in cache e $15 in output per 1M token
Da evitare se: il contesto importante è breve e Luna supera già la valutazione prevista
Artificial Analysis assegna a Terra 55 a $0.55 per task e 77 nel Coding Agent Index. Rileva inoltre che Terra non si trova sulla frontiera di Pareto complessiva fra intelligenza e costo: per ogni livello di effort di Terra, esiste un'impostazione di Luna o Sol altrettanto intelligente e meno costosa, oppure più intelligente senza costi aggiuntivi.
Su un carico specializzato nel contesto lungo, la conclusione cambia. Terra ottiene 72.5 nella valutazione di retrieval di OpenAI tra 512K e 1M: soltanto 1.3 punti meno dei 73.8 di Sol e 31.2 punti più dei 41.3 di Luna. Un CTO di un'azienda mid-market che affida a un solo modello il compito di seguire un controllo attraverso un anno di policy, ticket e codice ottiene un retrieval quasi al livello di Sol pagando la metà per i token. È un livello reale, non una semplice simmetria di marketing.
Terra è anche il punto d'ingresso predefinito a GPT-5.6 per gli utenti Free e Go in Codex. Diventa così un ambiente concreto per chi sviluppa da solo e vuole coding agentico senza pagare il livello di punta, anche se l'accesso API a questi modelli non prevede un piano gratuito.
- Costa la metà di Sol sia in input sia in output
- Nella valutazione pubblicata da OpenAI, il retrieval sul contesto lungo resta vicino a Sol
- Punteggio di coding pari a 77 con Codex nell'indice indipendente
- Disponibile in Codex per gli utenti Free e Go
- I dati indipendenti su prezzo e prestazioni lo collocano fuori dalla frontiera di Pareto complessiva
- Costa più di Luna per estrazione, classificazione e sintesi di routine
- Stesso sovrapprezzo di Sol e Luna per il contesto lungo oltre 272K
- Punteggi di prevenzione e correttezza sulle azioni distruttive inferiori a Sol
GPT-5.6 Luna vince sui grandi volumi a contesto breve
GPT-5.6 Luna è il modello predefinito corretto quando i volumi sono elevati, la validazione costa poco e la risposta non dipende dal trovare aghi in un prompt lungo quanto un libro. Con $1 in input e $6 in output per milione di token, rende accessibili automazioni su larga scala senza dover tornare a una famiglia di modelli precedente.
Ideale per: classificazione di ticket, estrazione strutturata, sintesi di documenti, routing, tagging e prime bozze
Punto di forza: $0.21 per task nell'Intelligence Index indipendente
Prezzo: $1 in input, $0.10 per l'input in cache e $6 in output per 1M token
Da evitare se: la decisione richiede un retrieval affidabile su centinaia di migliaia di token
Artificial Analysis assegna a Luna 51 per intelligenza e 75 per coding. Il segnale più importante è il costo per task: $0.21, contro $0.55 di Terra e $1.04 di Sol. Un responsabile senior che deve elaborare una lunga coda di report standardizzati può acquistare diversi task Luna al costo di un solo task Sol in quella valutazione.
Il dato di 1.05M token è il punto in cui chi acquista rischia di sbagliare. Luna ottiene 41.3 sia nella versione da 256K a 512K sia in quella da 512K a 1M del test multi-needle di OpenAI. Su BrowseComp raggiunge 83.3%, appena sotto l'84.4% di GPT-5.5. Luna può accettare un prompt enorme, ma accettarlo non significa recuperarne bene le informazioni.
Va usato come primo filtro di un router. Se un'estrazione non contiene un campo obbligatorio, una classificazione ha una confidenza bassa o il prompt supera la soglia di contesto supportata dalle proprie valutazioni, si passa a Terra o Sol. Il modello economico deve assorbire il volume, non nascondere l'incertezza.
- Il prezzo API e il costo indipendente per task più bassi della famiglia
- Abbastanza potente per molti workflow aziendali strutturati e ad alto volume
- Stesso supporto agli strumenti, limite di contesto e output massimo dei livelli maggiori
- Un primo stadio lineare per il routing dei modelli
- Nel retrieval su contesti lunghi resta molto indietro rispetto a Sol e Terra
- Nei dati di lancio di OpenAI, il punteggio BrowseComp è inferiore a GPT-5.5
- I punteggi più bassi della famiglia per prevenzione e correttezza sulle azioni distruttive
- Non selezionabile nelle conversazioni standard di ChatGPT
Quanto costa davvero GPT-5.6, tra cache e sovrapprezzo per il contesto lungo
GPT-5.6 diventa economico solo quando router e cache sono progettati intorno al carico di lavoro. Il solo prezzo di listino nasconde due meccanismi che cambiano la fattura: le scritture in cache e il sovrapprezzo per il contesto lungo.
Per un carico mensile di 10M token di input non in cache e 2M token di output, il conto base è semplice:
Per una richiesta con 100,000 token di input non in cache e 10,000 token di output, il totale è $0.80 con Sol, $0.40 con Terra e $0.16 con Luna. Inviare una prima analisi economica a Luna e inoltrare soltanto i fallimenti al livello superiore può incidere sui costi unitari più di qualche parola eliminata dal prompt.
La prompt cache premia i contesti stabili e ripetuti, ma GPT-5.6 introduce un costo di scrittura. Scrivere in cache costa 1.25x la tariffa dell'input non in cache. La lettura dalla cache riceve uno sconto del 90% e OpenAI dichiara una durata minima della cache di 30 minuti con cache breakpoint espliciti.
Per un prefisso stabile da 100,000 token usato due volte, una scrittura più una lettura costano $0.675 con Sol, $0.3375 con Terra e $0.135 con Luna. Leggere due volte lo stesso prefisso senza cache costerebbe $1, $0.50 e $0.20. Già il secondo utilizzo compensa il sovrapprezzo di scrittura, a condizione che la cache resti disponibile e che il prefisso non cambi di un byte.
L'architettura esistente per cache, router e limiti di spesa acquista ancora più valore. Conviene mantenere un prefisso stabile in cache, indirizzare a Luna le chiamate brevi e semplici, riservare Terra ai veri casi di contesto lungo e porre un limite ai loop agentici di Sol. Il nome dell'endpoint non controlla i costi. Il punto di controllo sì.
Cosa può rompersi in produzione
Il rischio di GPT-5.6 in produzione non è la mancanza di strumenti, ma l'iniziativa incontrollata. La famiglia può cercare, modificare, eseguire comandi shell, usare un computer e coordinare altri agenti. Queste capacità ampliano il raggio d'impatto di un'istruzione poco rigorosa.
La system card di GPT-5.6 di OpenAI segnala una tendenza maggiore rispetto a GPT-5.5 ad andare oltre l'intento dell'utente, eseguendo o tentando azioni non richieste, anche se i tassi assoluti sono rimasti bassi. Nella valutazione sulle azioni distruttive, il punteggio della sola prevenzione è 0.88 per GPT-5.5, 0.83 per Sol, 0.81 per Terra e 0.73 per Luna. Il punteggio combinato di prevenzione e correttezza è 0.44 sia per GPT-5.5 sia per Sol, 0.37 per Terra e 0.32 per Luna.
Questi valori non significano che Luna cancellerà dei dati. Indicano che dimensioni e prezzo del modello non eliminano la necessità di permessi, passaggi di conferma, snapshot e rollback. Un agente in produzione dovrebbe poter proporre un'azione distruttiva prima di ricevere il permesso di eseguirla.
La stessa prudenza serve nel leggere i benchmark. Artificial Analysis colloca Sol vicino alla frontiera dell'intelligenza e al primo posto nel Coding Agent Index, ma registra anche un piccolo aumento del tasso di allucinazioni insieme al lieve guadagno di accuratezza rispetto a GPT-5.5 nella misura Omniscience. In AA-Briefcase, Sol ha il Presentation Elo più alto, mentre Claude Fable 5 guida ancora il benchmark complessivo con un rubric score del 56% contro il 42% di Sol e un Elo per qualità analitica di 1,764 contro 1,592.
La conclusione corretta è più circoscritta del linguaggio di lancio: GPT-5.6 migliora l'offerta OpenAI e la frontiera tra prezzo e prestazioni. Non elimina le allucinazioni, non vince ogni benchmark e non rende sicuro per impostazione predefinita un agente autonomo. Anche i team di sicurezza devono aspettarsi qualche attrito. OpenAI afferma che le protezioni cyber di Sol bloccano circa 10 volte più attività potenzialmente dannose rispetto ai modelli precedenti, includendo anche alcuni utilizzi legittimi.
Chi dovrebbe scegliere Sol, Terra, Luna o restare con GPT-5.5
La scelta corretta segue l'attuale matrice di disponibilità di OpenAI. ChatGPT standard, Work, Codex e API non offrono le stesse opzioni.
Nelle conversazioni standard di ChatGPT, Plus include Medium e High. Pro, Business ed Enterprise includono Medium, High, Extra High e Pro. Free e Go non includono GPT-5.6. Terra e Luna non sono selezionabili in ChatGPT standard.
Work in ChatGPT offre tutti e tre i livelli agli utenti Plus, Pro, Business ed Enterprise. Codex offre Terra a Free e Go e tutti e tre ai piani a pagamento. L'API espone direttamente Sol, Terra e Luna.
Conviene mantenere GPT-5.5 dove è già veloce, stabile e supera le proprie valutazioni. Una nuova versione non giustifica la sostituzione di un percorso economico che funziona. Il passaggio ha senso quando GPT-5.6 migliora il risultato misurato, riduce il costo misurato o abilita una modalità d'uso degli strumenti davvero necessaria.
Se la decisione reale è tra OpenAI e Anthropic anziché tra Sol, Terra e Luna, è più utile il confronto tra Claude e ChatGPT. Il routing tra famiglie di modelli e la scelta del fornitore sono decisioni architetturali separate.
Una policy di routing da adottare subito
Si parte dal livello credibile meno costoso e si sale sulla base dei dati. Una policy chiara si compone di cinque parti.
Assegna a Luna i lavori brevi e ripetibili
Invia classificazione, estrazione, sintesi, tagging e prime bozze a
gpt-5.6-luna. Quando il compito ha uno schema, richiedi un output strutturato; considera campi mancanti o validazioni fallite come segnali per passare al livello superiore.Sposta il contesto lungo su Terra
Usa
gpt-5.6-terraquando la risposta richiede un retrieval affidabile su un grande repository o una raccolta di documenti. Tieni sotto controllo la soglia di 272K in input, perché il moltiplicatore di prezzo si applica all'intera richiesta.Riserva Sol agli errori costosi
Usa
gpt-5.6-solper debugging difficile, revisioni di sicurezza, incidenti in produzione, ricerca complessa e decisioni che richiedono giudizio. Non usare l'alias senza suffissogpt-5.6se la selezione di Sol non è intenzionale.Metti in cache il contesto stabile
Colloca istruzioni durature, schemi e materiali di riferimento dietro cache breakpoint espliciti. Mantieni il prefisso identico byte per byte abbastanza a lungo da ottenere lo sconto del 90% in lettura dopo aver pagato la scrittura a 1.25x.
Controlla le azioni e conserva il percorso precedente
Richiedi conferma per le azioni distruttive o esterne, mantieni il rollback e conserva GPT-5.5 finché il nuovo percorso non supera la valutazione sul tuo carico di lavoro. L'adozione deve essere reversibile.
La policy è volutamente asimmetrica. Luna assorbe il volume economico. Terra acquista contesto utilizzabile. Sol acquista capacità di giudizio. GPT-5.5 resta dove il cambiamento non produce un ritorno misurabile.
GPT-5.6 è disponibile?
Sì. GPT-5.6 ha raggiunto la disponibilità generale il 9 luglio 2026 su ChatGPT, Codex e API di OpenAI. L'accesso varia in base al prodotto e al piano, e il rollout è stato graduale.
Cos'è ChatGPT 5.6 Sol?
GPT-5.6 Sol è il livello di punta della famiglia GPT-5.6 di OpenAI. Nei piani ChatGPT standard idonei alimenta le modalità di ragionamento Medium, High ed Extra High, mentre GPT-5.6 Sol Pro alimenta l'opzione Pro.
Quando è uscito GPT-5.6?
OpenAI ha avviato il rollout della disponibilità generale il 9 luglio 2026, dichiarando che sarebbe proseguito a livello globale nelle 24 ore successive. Se un account idoneo non mostra ancora Sol, il motivo può essere il rollout o le impostazioni del workspace.
Vuoi conoscere i modelli e gli strumenti consigliati oggi senza dover ricostruire il router a ogni nuova release? Ricevi gratis la mappa degli strumenti AI per chi gestisce un'attività.
Ricevi la mappa degli strumenti AI per chi fa impresa
Una guida chiara ai modelli e agli strumenti AI più adatti a ogni lavoro, aggiornata al cambiare di prezzi e capacità. Gratuita per gli iscritti.
3 set 2026







