Together AI, prezzi 2026: le PTU servono per la capacità, non per risparmiare

Quanto costa Together AI nel 2026? Prezzi serverless, PTU, GPU dedicate e costi nascosti, con calcoli pratici per scegliere la soluzione più adatta.

Wednesday, September 2, 2026Omid Saffari
Together AI, prezzi 2026: le PTU servono per la capacità, non per risparmiare

La soluzione più economica di Together AI è il serverless, mentre la nuova opzione da $0.05 per PTU al minuto non rappresenta uno sconto rispetto alle tariffe a token della stessa piattaforma. Una PTU riservata senza interruzioni costa $2,160 in un mese di 30 giorni: conviene acquistarla per la capacità garantita e lo SLA di uptime del 99%, non per pagare meno i token quando resta inutilizzata.

Together AI: prezzi e costi in sintesi

Il modo più sensato di acquistare Together AI è procedere per gradi: partire dal serverless prepagato, spostare il traffico stabile e sensibile all'affidabilità su Provisioned Throughput e riservare hardware dedicato solo quando il carico richiede controllo single-tenant o modelli personalizzati. L'errore più costoso è considerare questi passaggi come sconti per grandi volumi. Misurano risorse diverse e trasferiscono rischi operativi diversi.

Pagina dei prezzi aggiornata di Together AI con serverless, Provisioned Throughput, inferenza dedicata, cluster GPU, sandbox, storage e fine-tuning
Prezzi Together AI verificati il 22 agosto 2026

Together AI non propone una semplice scala Free, Pro e Business. Vende token serverless e output multimediali, capacità di token riservata, GPU dedicate gestite, cluster GPU grezzi, capacità di calcolo sandbox, storage e fine-tuning. Un solo prodotto può attivare più contatori: un agente, per esempio, può generare costi per i token del modello, per CPU e memoria della sandbox e per un endpoint fine-tuned che continua a fatturare anche tra una richiesta e l'altra.

ProdottoPrezzo di listino attualeImpegnoIdeale per
Inferenza serverlessModelli di testo da $0 a $15/M token; per i media si paga per immagine, video, minuto o carattereAcquisto prepagato di $5 per l'accesso, poi a consumoPrototipi, traffico variabile, valutazione dei modelli
Provisioned Throughput$0.05/PTU al minuto, oppure $2,160 per PTU in un mese di 30 giorniMinimo un meseTraffico di produzione stabile che richiede capacità riservata e uno SLA di uptime del 99%
Dedicated InferenceH100 $5.49/GPU-ora; B200 $8.99/GPU-oraFatturazione finché è in esecuzione; condizioni di prenotazione su preventivoModelli fine-tuned o personalizzati, latenza prevedibile, controllo single-tenant
Cluster GPUH100 $3.99/GPU-ora on demand oppure $3.19 per 91-180 giorni; H200 e B200 costano di piùOn demand oppure prenotazioni pubblicate da 7-180 giorniTeam che gestiscono in proprio lo stack di training o inferenza
Sandbox e storage$0.0446/vCPU-ora, $0.0149/GiB RAM-ora, $0.16/GiB-mese di storageA consumoEsecuzione di codice per agenti e dati persistenti
Fine-tuningStandard $0.48-$8/M token elaborati; specializzato $3-$100/M, oltre ai minimi per jobPer job; hosting separatoComportamenti personalizzati che giustificano il costo di training e deployment

Tutti i prezzi e i limiti riportati in questa pagina sono stati verificati sulla pagina dei prezzi aggiornata di Together AI, nella documentazione di fatturazione e in quella di prodotto il 22 agosto 2026. La data conta: la pagina attuale differisce già in modo sostanziale dalle analisi dei prezzi di giugno, perché include MiniMax M3, Kimi K3, GLM-5.2, tariffe live più basse per l'hardware dedicato e il nuovo livello Provisioned Throughput.

La prima regola decisionale è semplice. Il serverless va usato quando la domanda è incerta o presenta picchi. Una PTU ha senso quando un modello ben definito sostiene un carico di base stabile e la capacità riservata ha un valore per il business. Dedicated Inference serve quando occorrono un modello personalizzato, hardware single-tenant o controllo sulla configurazione. Un cluster GPU è adatto solo alle aziende che vogliono gestire la capacità di calcolo sottostante, invece di acquistare un risultato di inferenza gestito.

Flusso decisionale che indirizza i carichi con picchi al serverless, quelli stabili con SLA alle PTU e i modelli personalizzati all'inferenza dedicata
Scegliere il contatore in base alla forma del carico, non soltanto alla fattura mensile

Questa distinzione rende Together AI interessante per un founder finanziato che desidera un unico percorso API dall'esperimento all'infrastruttura riservata. È meno adatta a chi lavora da solo e insegue la tariffa spot per token più bassa, oppure a un team incapace di prevedere anche solo un mese di domanda. La flessibilità è il prodotto serverless; l'impegno è un acquisto distinto.

L'inferenza serverless è il punto di partenza, ma il modello decide la spesa

Il serverless è il punto di partenza corretto perché non prevede costi di provisioning né un consumo minimo oltre all'acquisto di $5 per accedere alla piattaforma. Le richieste vengono inviate a una flotta condivisa e si paga il lavoro completato. Il modello, la direzione dei token, la tariffa della cache e la lunghezza dell'output incidono sulla fattura molto più del nome Together AI.

Il catalogo chat attuale copre una fascia molto ampia. LFM2.5-8B-A1B costa $0.03 per milione di token in input e $0.12 per milione di token in output. DeepSeek V4 Flash 0731 costa $0.14 per l'input, $0.03 per l'input in cache e $0.28 per l'output. gpt-oss-120B costa $0.15 in input e $0.60 in output. All'estremo più caro dell'elenco di testo mostrato, Kimi K3 costa $3 per l'input, $0.30 per l'input in cache e $15 per l'output, sempre per milione di token.

La tariffa di DeepSeek ospitato da Together è specifica del provider. L'analisi separata dei prezzi di DeepSeek esamina l'economia del modello acquistato direttamente; per una fattura Together va usata la pagina aggiornata di Together.

Tra la tariffa di output da $0.12 di LFM e quella da $15 di Kimi K3 c'è una differenza di 125x. Ottimizzare il provider ignorando il routing dei modelli equivale a negoziare un piccolo sconto sul trasporto e poi spedire ogni pacco per via aerea. Il primo intervento sui costi consiste nell'assegnare a ogni attività il modello più economico che supera la soglia di qualità richiesta.

Un carico tipico per un agente rende il confronto concreto. Supponiamo che 1,000 chiamate consumino ciascuna 8,000 token in input e producano 1,000 token in output. Il totale è di 8 milioni di token in input e 1 milione in output:

  • DeepSeek V4 Flash 0731 costa $1.40 in totale, pari a $0.0014 per chiamata.
  • gpt-oss-120B costa $1.80 in totale, pari a $0.0018 per chiamata.
  • MiniMax M3 costa $3.60 in totale, pari a $0.0036 per chiamata.
  • GLM-5.2 costa $15.60 in totale, pari a $0.0156 per chiamata.
  • Kimi K3 costa $39 in totale, pari a $0.039 per chiamata.

La differenza maggiore non dipende dal sovrapprezzo del provider, ma dal modello scelto e dalla quantità di output costoso che produce. Un classificatore per l'assistenza clienti che restituisce una sola etichetta non richiede lo stesso budget di output di un agente di ricerca incaricato di redigere una risposta lunga. Prima di cercare un endpoint meno caro, va imposto un limite rigido all'output del lavoro circoscritto.

Per questo un confronto più ampio tra le API di AI più economiche diventa utile solo dopo aver normalizzato il lavoro. Confrontare provider usando prompt, risposte, ipotesi sulla cache o modelli differenti produce un numero ordinato ma inutile per governare il budget.

L'input in cache può ridurre il costo del prefisso ripetuto

Quando i prompt si ripetono, l'input in cache è lo sconto self-service più efficace. Together riconosce un prefisso invariato, come una lunga istruzione di sistema o un contesto di riferimento stabile, e sui modelli supportati fattura quei token a una tariffa inferiore.

Per lo stesso carico da 1,000 chiamate, ipotizziamo che l'80% degli 8 milioni di token in input possa usufruire della tariffa cache. MiniMax M3 scende da $3.60 a $2.064; GLM-5.2 da $15.60 a $8.304; Kimi K3 da $39 a $21.72. Le riduzioni sono rispettivamente del 42.7%, 46.8% e 44.3%.

L'impatto operativo supera la percentuale di sconto. Chi gestisce il sistema dovrebbe separare il prefisso stabile dal contesto specifico di ogni richiesta, registrare indipendentemente i token in cache e quelli fuori cache e controllare le modifiche ai prompt che invalidano la cache. Una riscrittura del prompt può aumentare la spesa senza alcuna crescita del traffico: sembra un problema di prezzo finché i dati della cache non ne mostrano la causa.

Batch costa meno solo se modello e workflow sono idonei

La Batch API di Together AI offre su alcuni modelli serverless uno sconto fino al 50%, in cambio di un'elaborazione asincrona. È il contatore giusto per classificazioni offline, dati sintetici, valutazioni e riepiloghi in massa. Non è adatta a una chat live, a un assistente per il checkout o a un flusso di assistenza clienti che attende la risposta successiva.

Il contratto Batch attuale accetta fino a 50,000 richieste in un file di input da 100 MB e fino a 30 miliardi di token in coda per modello. La finestra di completamento è fissata a 24 ore ed è un obiettivo best effort. Together consiglia batch da 1,000 a 10,000 richieste. Le risposte riuscite vengono fatturate, quelle fallite no; annullare un batch non cancella il costo delle risposte già completate.

Lo sconto del 50% non vale in ogni caso. Solo alcuni modelli serverless ricevono la tariffa ridotta e altri non possono essere eseguiti tramite Batch. Gli endpoint dedicati possono accettare job Batch, ma lì lo sconto non si applica. Prima di preparare una previsione, va controllato l'elenco aggiornato dei modelli Batch.

Come esempio aggiornato con sconto, 8 milioni di token in input più 1 milione in output su Llama 3.3 70B costano $9.36 alle tariffe di $1.04 per input e output. Un batch idoneo con sconto del 50% costa $4.68. Il risparmio esiste perché il lavoro accetta un completamento differito, non perché ogni richiesta serverless sia diventata più economica.

Immagini, video, audio e storage usano unità diverse

Il serverless non si ferma al testo. Nel catalogo aggiornato, le immagini vanno da $0.0017 a $0.134 per immagine o megapixel nei modelli mostrati. I video vanno da $0.115 a $3.20 per video generato. Lo speech-to-text costa da $0.0015 a $0.0045 per minuto audio, mentre il text-to-speech va da $4 a $65 per milione di caratteri. Gli embedding Multilingual e5 large instruct costano $0.02 per milione di token e la moderazione Llama Guard 4 12B costa $0.20 per milione di token.

Questi intervalli non sono intercambiabili. Together precisa che i prezzi mostrati per immagini e video adottano la risoluzione o la durata minima indicate e che superare il numero predefinito di passaggi di generazione può aumentare il costo. Per preventivare 100,000 brevi video, un product manager deve conoscere modello, durata, risoluzione, impostazione audio e tasso di retry esatti. Moltiplicare il prezzo della miniatura più economica per il volume di produzione sottostima la voce di spesa.

Per la maggior parte dei nuovi carichi, il serverless resta comunque la scelta iniziale corretta. Il suo limite non è la tariffa dei token, bensì la capacità condivisa, i rate limit dinamici e l'assenza di un impegno pubblico sull'uptime equivalente a quello del prodotto Provisioned. Quando questo diventa un rischio per il cliente, la decisione successiva riguarda la capacità, non un generico upgrade.

Provisioned Throughput trasforma la capacità in un impegno mensile

Provisioned Throughput conviene solo quando la capacità di token riservata risolve un problema di business. Together AI lo ha lanciato l'8 luglio 2026 come livello intermedio tra il serverless best effort e Dedicated Inference, completamente configurabile. Offre uno SLA di uptime del 99%, richiede almeno un mese e ha un prezzo di listino pubblico di $0.05 al minuto per Provisioned Throughput Unit, o PTU.

Una PTU non è un pacchetto di token. È una velocità di elaborazione riservata, espressa in token al minuto per un singolo modello supportato e tenuta a disposizione del cliente. Input, input in cache e output consumano questa capacità a velocità diverse. La pagina aggiornata presenta tre profili pubblici:

MiniMax M3 eroga 166,667 token in input, 833,333 token in cache oppure 41,667 token in output al minuto per PTU. Kimi K3 eroga 16,667 token in input, 166,667 in cache oppure 3,333 in output. GLM-5.2 eroga 35,714 token in input, 192,308 in cache oppure 11,364 in output. Una richiesta mista consuma una combinazione di queste capacità.

A $0.05 al minuto, una PTU costa $3 all'ora, $72 al giorno e $2,160 in un mese di 30 giorni. La nota del calcolatore Together usa circa 43,800 minuti per un provisioning continuo nel mese medio, arrivando a circa $2,190. Per la finanza contano il contratto e il mese di calendario effettivi, non l'ipotesi che ogni mese equivalga sempre a $2,160.

Il test di occupazione delle PTU

Il calcolo rivelatore consiste nel chiedersi quanto sarebbe costata la capacità di una PTU con il contatore serverless di Together. Se una PTU MiniMax M3 viene dedicata all'input per 30 giorni, può elaborare circa 7.2 miliardi di token in input. Alla tariffa serverless di $0.30 per milione, quella capacità vale circa $2,160. Se viene dedicata all'output, può elaborare circa 1.8 miliardi di token in output; a $1.20 per milione, il valore è ancora circa $2,160. Anche il percorso dell'input in cache arriva allo stesso risultato, salvo arrotondamenti.

Kimi K3 e GLM-5.2 sono calibrati nello stesso modo. La capacità PTU pubblica raggiunge la parità con i prezzi serverless pubblici sostanzialmente a piena occupazione per un mese di 30 giorni. Il calcolatore pubblicato può mostrare forti risparmi rispetto a un modello commerciale selezionato, ma confronta esplicitamente la spesa PTU con il prezzo di listino di quel modello esterno. Non dimostra uno sconto generalizzato rispetto alle tariffe serverless di Together.

Questo è il test di occupazione delle PTU: il valore della capacità e quello serverless coincidono solo quando l'unità riservata è utilizzata per intero. Con un utilizzo del 50%, le tariffe effettive di MiniMax M3 raddoppiano a $0.60 per milione di token in input, $0.12 per milione di token in cache oppure $2.40 per milione di token in output. Al 25% quadruplicano a $1.20, $0.24 e $4.80. Al 70%, la tariffa effettiva è circa 1.43x quella serverless: all'incirca $0.43 per l'input e $1.71 per l'output.

Indicatore di occupazione di una PTU MiniMax M3 con il prezzo effettivo dell'output al 25, 50 e 100 percento di utilizzo
Una PTU da $2,160 raggiunge la parità con i prezzi serverless di Together solo a piena occupazione per 30 giorni

Questo non rende le PTU un cattivo prodotto: ne chiarisce la funzione. Il CTO di un'azienda di medie dimensioni che gestisce un agente rivolto ai clienti può accettare razionalmente il 20% di capacità inattiva se il canale riservato riduce il rischio di throttling e lo SLA di uptime del 99% ha valore contrattuale. Un founder con domanda limitata ai giorni feriali non dovrebbe invece pagare notti e fine settimana, a meno che la garanzia di capacità protegga ricavi sufficienti a coprire il sovrapprezzo.

La pagina pubblica afferma che livelli di impegno superiori possono ottenere sconti, ma non ne pubblica la struttura. Uno sconto negoziato sposta il pareggio sotto il 100% di occupazione. Finché il commerciale non inserisce quella tariffa in un ordine, il modello deve usare il prezzo di listino pubblico e considerare l'eventuale sconto come un vantaggio aggiuntivo.

Anche uno SLA del 99% va interpretato in termini di business

Un obiettivo di uptime mensile del 99% consente circa 7 ore e 18 minuti di inattività in un mese di 30.4 giorni. È più solido di un accesso best effort, ma il livello enterprise Performance di Groq pubblica il 99.9%; il 99% non è quindi l'impegno più forte tra le alternative considerate. L'azienda deve confrontare rimedi contrattuali, esclusioni per manutenzione, architettura regionale e percorso di fallback, non fermarsi alla presenza di tre caratteri e un segno percentuale.

Provisioned Throughput si difende meglio quando l'applicazione ha un carico di base stabile, una scelta di modello prevedibile e una promessa al cliente che il throttling della flotta condivisa può compromettere. È meno convincente quando il traffico oscilla di 10x, il modello cambia ogni settimana o il lavoro offline può passare a Batch. In questi casi la prenotazione trasforma l'incertezza in tempo inattivo a pagamento.

La scelta cambia la conversazione di budget del lunedì

Prima dell'8 luglio, un team che sceglieva Together affrontava un salto considerevole dal serverless condiviso a token all'infrastruttura GPU dedicata. Le PTU aggiungono una voce intermedia al budget: capacità del modello riservata senza assumersi il dimensionamento delle GPU né uno stack di serving personalizzato. La finanza può così approvare un tetto mensile fisso di capacità, mentre l'ingegneria continua a usare la stessa API di inferenza.

Ne deriva una nuova metrica operativa. La sola spesa per token non basta più. Il responsabile deve conoscere il picco di richieste al secondo, il mix di token in input e output, il cache hit rate, l'occupazione della capacità, le richieste soggette a throttling e gli esiti accettati. Se la dashboard non mostra queste sei misure, l'azienda non può stabilire se una PTU sia protezione o spreco.

Una PTU MiniMax M3 acquista circa 600,000 chiamate di un agente

Una PTU può sostenere circa 600,000 chiamate MiniMax M3 in un mese di 30 giorni quando ogni chiamata usa 8,000 token in input fuori cache e produce 1,000 token in output. È lo stesso carico di esempio calcolato in precedenza a $0.0036 per chiamata serverless: 600,000 chiamate serverless costano quindi $2,160. A piena occupazione, i contatori della capacità e dei token si incontrano per costruzione.

Il calcolo della capacità considera entrambi i lati della richiesta. Ottomila token in input consumano circa 0.048 minuti-PTU secondo il profilo MiniMax M3 da 166,667 token di input al minuto. Mille token in output consumano altri 0.024 minuti-PTU alla velocità di 41,667 token in output al minuto. La richiesta completa consuma quindi circa 0.072 minuti-PTU. Dividendo i 43,200 minuti-PTU del mese per l'impronta della richiesta si ottengono circa 600,000 chiamate.

Il risultato è un budget operativo utilizzabile per decidere:

All'80% di occupazione, la PTU sostiene circa 480,000 chiamate. La fattura serverless equivalente è di $1,728, con un sovrapprezzo mensile di prenotazione pari a $432. La PTU costa il 25% in più rispetto al lavoro serverless effettivamente consumato. Un prodotto rivolto ai clienti può accettare questo sovrapprezzo se capacità riservata e SLA del 99% proteggono più di $432 in ricavi, tempo dell'assistenza o danno reputazionale.

Al 70% di occupazione, sostiene circa 420,000 chiamate. Il serverless costa $1,512 e il sovrapprezzo per la capacità è quindi $648. Al 50%, sostiene 300,000 chiamate e il serverless costa $1,080: metà della fattura PTU paga capacità inattiva.

La cache modifica il numero di chiamate che entrano nell'unità. Se l'80% dell'input è in cache, ogni richiesta usa circa 0.04128 minuti-PTU invece di 0.072. Una PTU può così sostenere circa 1.0465 milioni delle stesse chiamate a piena occupazione. Contemporaneamente il prezzo serverless scende da $0.0036 a $0.002064 per chiamata, quindi il costo a pieno carico continua a convergere vicino a $2,160.

Il vantaggio della cache per il business riguarda dunque sia il throughput sia il costo unitario. Un prefisso di sistema lungo e stabile permette alla stessa capacità riservata di gestire più lavoro dei clienti. Una modifica al prompt che elimina il riuso della cache riduce il margine della PTU e aumenta allo stesso tempo la spesa serverless.

Ora portiamo la decisione a una vera voce di budget. Dieci PTU costano $21,600 per un mese di 30 giorni e sostengono circa 6 milioni delle chiamate di esempio fuori cache a piena occupazione. Al 70%, ne sostengono 4.2 milioni. La fattura serverless equivalente è di $15,120, con un sovrapprezzo mensile di $6,480 per capacità riservata e SLA.

È questo il valore che un CTO deve giustificare: $6,480. Se il throttling della flotta condivisa mette a rischio più di $6,480 tra margine lordo, carico sull'assistenza o penali contrattuali, la prenotazione può meritare il proprio posto. In caso contrario, il serverless lascia gli stessi $6,480 disponibili per il prodotto. Un generico «spendiamo $15,000 in token» non consente mai di arrivare a questa decisione.

Dedicated Inference non offre un punto di pareggio pubblico altrettanto pulito per i token, perché il throughput di output dipende da modello, quantizzazione, forma del batch, numero di componenti hardware e configurazione. Qualsiasi articolo divida il prezzo mensile di una GPU per una tariffa generica dei token e dichiari un crossover universale nasconde proprio la variabile che determina la risposta. Bisogna misurare il modello candidato sull'endpoint previsto e confrontare poi il costo per risultato accettato all'utilizzo osservato.

Dedicated Inference e cluster GPU risolvono problemi diversi

Dedicated Inference è la scelta giusta quando il controllo conta più della flessibilità self-service. Together assegna hardware single-tenant, supporta modelli personalizzati e offre autoscaling e gestione dei picchi di traffico. Il prezzo aggiornato è di $5.49 per GPU-ora per una NVIDIA HGX H100 e $8.99 per una HGX B200. I prezzi di H200, B300, GB200 NVL72 e GB300 NVL72 richiedono un contatto commerciale.

Con un utilizzo continuo per 30 giorni, una H100 costa $3,952.80 e una B200 $6,472.80. Sono importi per singola GPU, prima di qualsiasi requisito multi-GPU. L'endpoint viene fatturato finché resta in esecuzione, indipendentemente dal volume delle richieste: anche un deployment inattivo rimane una voce di budget attiva.

Per prevedere il costo dell'hardware non va usata la documentazione meno recente sugli endpoint dedicati. Al momento, i documenti mostrano cifre per H100, H200 e B200 in conflitto con la pagina dei prezzi aggiornata. Quest'ultima è la fonte più recente ed è quella verificata qui. È proprio il motivo per cui ogni prezzo infrastrutturale deve avere una data.

Dedicated Inference giustifica il costo quando un modello fine-tuned o caricato non può essere eseguito sul serverless condiviso, quando la latenza p99 richiede hardware stabile, quando il serving del modello necessita di impostazioni personalizzate oppure quando un utilizzo elevato e costante rende più conveniente una GPU riservata. Non conviene quando l'endpoint passa gran parte della giornata in attesa.

I cluster GPU sono più grezzi e possono sembrare economici per il motivo sbagliato

I cluster GPU affidano una parte maggiore dello stack all'acquirente. Le tariffe on demand attuali sono $3.99 per GPU-ora per H100, $5.99 per H200 e $8.19 per B200. L'equivalente di 30 giorni per una H100 è $2,872.80, ma non si tratta di un sostituto più economico della H100 Dedicated da $3,952.80: chi acquista il cluster si assume più lavoro per deployment, serving, orchestrazione, osservabilità e utilizzo.

Le tariffe dei cluster riservati diminuiscono con l'impegno. H100 scende a $3.69 per 7-30 giorni, $3.45 per 31-90 giorni e $3.19 per 91-180 giorni. Negli stessi intervalli, H200 passa da $4.99 a $4.15 e poi a $3.99. B200 passa da $7.99 a $7.79 e quindi a $6.79. Per periodi di 181 giorni o più serve un preventivo.

Lo sconto ha vincoli rigidi. La documentazione di fatturazione GPU di Together indica che l'intera prenotazione viene addebitata in anticipo o detratta al momento del provisioning. Le prenotazioni non sono rimborsabili, non ammettono rimborsi parziali e non possono essere sospese. Se il cluster supera la capacità riservata, la capacità aggiuntiva viene fatturata alle tariffe on demand.

Per una prenotazione H100 di 91-180 giorni, il mese normalizzato da 720 ore costa $2,296.80 per GPU: $576 in meno rispetto all'equivalente on demand. Il risparmio vale solo se la GPU resta utilmente occupata. Una prenotazione da quattro GPU lasciata inattiva per metà del tempo non diventa conveniente solo perché la tariffa oraria è inferiore.

Anche lo storage ha un proprio ciclo di vita. Lo storage condiviso costa $0.16 per GiB-mese, quindi 1 TiB equivale a circa $163.84 al mese. Il volume persiste e continua a essere fatturato dopo la terminazione del cluster, finché qualcuno non lo elimina. È utile per ricreare la capacità di calcolo attorno a dati durevoli, ma trasforma anche i volumi abbandonati in una spesa silenziosa.

Il fine-tuning può costare poco nel training e molto nel mantenimento

Il fine-tuning genera due costi distinti: il job di training e il successivo deployment del modello. La voce di training può sembrare minima; l'hosting del risultato può diventare la spesa mensile dominante.

Together calcola il training standard moltiplicando i token del dataset per le epoche, più gli eventuali token di valutazione moltiplicati per le esecuzioni di valutazione. Per modelli fino a 16B parametri, il supervised fine-tuning costa $0.48 per milione di token elaborati con LoRA e $0.54 con fine-tuning completo. La Direct Preference Optimization, o DPO, costa $1.20 con LoRA e $1.35 con tuning completo.

Per i modelli da 17B-69B, le quattro tariffe sono $1.50, $1.65, $3.75 e $4.12. Per quelli da 70B-100B, sono $2.90, $3.20, $7.25 e $8. Il costo minimo di un job standard è $4.

I modelli più grandi e quelli nominati adottano prezzi specializzati. Il LoRA di DeepSeek V4 Flash costa $6 per milione di token elaborati nel supervised fine-tuning e $15 per la DPO, con un minimo di $12. gpt-oss-120B costa $5 e $12.50, con un minimo di $6. Kimi K2.6 o K2.7-Code costa $15 e $37.50, con un minimo di $60. GLM-5.2 costa $40 e $100, con un minimo di $60.

Questa differenza specifica per modello cambia il costo di un esperimento apparentemente semplice. Un dataset da 20 milioni di token eseguito per tre epoche elabora 60 milioni di token. Su un job LoRA standard fino a 16B, il supervised training costa $28.80. Sul LoRA specializzato per GLM-5.2, lo stesso numero di token elaborati costa $2,400. Le dimensioni del dataset non sono cambiate; è cambiato il prezzo del modello di base.

Il job di training non rappresenta ancora il costo dell'intero ciclo di vita. Un modello fine-tuned richiede capacità di deployment e un saldo prepagato sufficiente. Una singola H100 Dedicated alle tariffe attuali, lasciata in esecuzione per 30 giorni, costa $3,952.80. Un team può spendere $28.80 per creare un piccolo adapter e poi più di 137x quella cifra ogni mese per mantenere attiva una H100.

È qui che spesso il budget di un prototipo salta. Il data scientist comunica il costo del training; in seguito la finanza scopre la fattura del serving. L'esperimento va approvato insieme a un piano di deployment che indichi ore previste online, numero di GPU, soglia minima di autoscaling, volume delle richieste e responsabile dello spegnimento.

Un training annullato prevede un rimborso più limitato di quanto molti acquirenti si aspettino. Together addebita gli step completati e rimborsa solo il lavoro non eseguito. In base alle condizioni, le normali commissioni della piattaforma non sono altrimenti rimborsabili per impostazione predefinita. Un job di training va trattato come capacità di calcolo consumata, non come un abbonamento software reversibile.

Sandbox e Code Interpreter hanno contatori separati per gli agenti

Code Sandbox costa $0.0446 per vCPU-ora più $0.0149 per GiB di RAM all'ora. Una sandbox in esecuzione con 2 vCPU e 8 GiB per 160 ore costa circa $33.34. Code Interpreter usa un contatore diverso: $0.03 per sessione di 60 minuti.

In un prodotto basato su agenti, questi costi si aggiungono all'inferenza del modello. Se 10,000 esecuzioni mensili aprono ciascuna una sessione dell'interprete di un'ora, il solo interprete costa $300 prima dei token del modello. Se le sessioni possono essere riutilizzate in sicurezza, l'architettura del prodotto modifica il costo per job completato. Se restano aperte dopo la fine del lavoro, l'esecuzione inattiva diventa l'equivalente della capacità GPU inattiva, su scala più piccola.

L'unità corretta è quindi il costo per esito accettato, non quello per milione di token. La chiamata MiniMax M3 dell'esempio costa $0.0036; aggiungendo una sessione Code Interpreter da $0.03, il percorso costa almeno $0.0336 prima di retry o altre chiamate agli strumenti. Va misurato l'intero percorso.

Together AI non è gratis, anche quando un modello mostra token a $0

Together AI non offre attualmente una prova gratuita e richiede un acquisto minimo di $5 in credito prepagato prima di accedere alla piattaforma. La risposta sulla gratuità è quindi netta: per usare l'API non esiste un account gratuito senza alcun pagamento.

Il catalogo aggiornato include però Ternary Bonsai 27B a $0 per milione di token in input e $0 per milione di token in output. Finché l'offerta resta disponibile, l'inferenza continuativa può quindi costare $0, ma l'account richiede comunque l'acquisto di accesso da $5. Questi $5 non vengono descritti come abbonamento mensile. Al momento, i crediti prepagati acquistati non scadono.

Chi potrebbe non pagare mai oltre i primi $5? Un hobbista o un valutatore che usa esclusivamente l'attuale modello a prezzo zero, rimane entro i rate limit e non avvia alcun servizio a pagamento potrebbe lasciare intatto il saldo acquistato. È un caso ristretto, non un free tier di produzione. Disponibilità, capacità e prezzi del modello possono cambiare; un prodotto non dovrebbe promettere ai clienti che un endpoint promozionale o gratuito resterà per sempre il suo backend.

I crediti gratuiti di registrazione offerti in passato sono terminati. La policy di assistenza attuale di Together impone agli utenti di acquistare almeno $5 e collegare un metodo di pagamento. Nel normale accesso prepagato non è previsto un saldo negativo: quando il credito acquistato arriva a zero, l'accesso API viene sospeso finché non viene ricaricato. I clienti con contratto seguono le condizioni del proprio ordine.

I crediti non scadono, ma non sono un conto di risparmio rimborsabile

Al momento, i crediti acquistati non hanno una data di scadenza. È una condizione più favorevole rispetto a una policy di scadenza annuale, ma non rende innocuo caricare fondi in eccesso. Le condizioni di Together stabiliscono che, per impostazione predefinita, le somme pagate non sono rimborsabili, gli obblighi di pagamento non possono essere annullati e i mesi parziali non vengono riproporzionati, salvo diversa indicazione in un ordine.

La ricarica automatica richiede una configurazione attenta. La documentazione di fatturazione indica un importo di ricarica predefinito di $25 e avverte che una soglia superiore al saldo corrente può innescare acquisti immediati e ripetuti finché la differenza non viene colmata. La soglia va collegata al consumo previsto, ogni acquisto deve generare un avviso e il budget del progetto deve essere gestito anche al di fuori del saldo crediti.

I Build Tier aumentano i limiti in base alla spesa cumulativa

I cinque Build Tier di Together sono fasce di rate limit basate sulla spesa complessiva sostenuta nel tempo, non piani mensili con funzioni diverse. Tier 1 parte da $5 e indica 600 richieste LLM al minuto. Tier 2 parte da $50 e ne indica 1,800. Tier 3 parte da $100 e ne indica 3,000. Tier 4 parte da $250 e ne indica 4,500. Tier 5 parte da $1,000 e ne indica 6,000.

I limiti per gli embedding salgono da 3,000 RPM al Tier 1 a 10,000 nei Tier 4 e 5. La disponibilità di rerank aumenta da 500,000 a 5,000,000 nei cinque livelli. Non sono promesse universali per ogni modello: Together può applicare restrizioni specifiche e la documentazione serverless attuale descrive anche limiti dinamici che reagiscono alla capacità disponibile e al traffico recente andato a buon fine.

Questa combinazione è importante al momento del lancio. Anche un account Tier 5 può ricevere una risposta 429 se un modello molto richiesto ha una capacità più limitata oppure se il traffico cresce molto oltre il profilo recente. Il serverless elimina il provisioning, non ogni tipo di picco. Le vie d'uscita sono Batch, PTU o Dedicated Inference, ciascuna con un compromesso diverso tra costi e latenza.

I costi nascosti di Together AI sono soprattutto contatori inattivi e vincoli contrattuali

I prezzi visibili dei token di Together AI sono in genere chiari. Le sorprese più costose si annidano tra i prodotti, negli impegni, nelle risorse inattive e nelle ipotesi che sembrano universali ma non lo sono.

Calcolo del calendario PTU: $0.05 al minuto diventano $2,160 in un mese di 30 giorni. La nota del calcolatore aggiornato usa circa 43,800 minuti, che producono circa $2,190. Quella differenza di $30 per PTU diventa $3,000 su 100 PTU. Va applicata la convenzione di fatturazione del contratto.

PTU sottoutilizzate: una PTU pubblica è calibrata per eguagliare il valore del serverless Together a piena occupazione per 30 giorni. Al 50% di occupazione, il costo effettivo dei token raddoppia. Capacità e SLA possono comunque giustificare il sovrapprezzo, ma questo deve essere visibile.

Tempo inattivo dedicato: Dedicated Inference fattura l'hardware assegnato finché è in esecuzione, anche con zero richieste. L'hosting di un modello fine-tuned deve rientrare nella previsione mensile, non soltanto nel ticket dell'esperimento.

Prenotazioni non rimborsabili: i cluster GPU riservati vengono addebitati per l'intera durata, non possono essere sospesi e non ammettono rimborsi parziali. Un errore di previsione diventa spesa impegnata.

Eccedenza on demand per i picchi: la capacità che supera le GPU riservate viene fatturata alla tariffa on demand, più alta. Anche una base stabile può generare una sorpresa se le ipotesi sui picchi sono troppo basse.

Storage persistente: lo storage sopravvive alla terminazione del cluster e continua a essere fatturato finché non viene eliminato. Ogni dismissione di un cluster richiede una decisione esplicita: conservare o cancellare.

Idoneità a Batch: lo sconto è specifico per modello, la finestra di 24 ore è best effort e le risposte completate restano fatturabili dopo l'annullamento. Il 50% non va applicato a un intero budget offline senza controllare l'elenco aggiornato.

Valori predefiniti dei contenuti multimediali: i prezzi di immagini e video possono riferirsi alla risoluzione, alla durata o al numero di passaggi predefinito più basso. Le impostazioni di qualità per la produzione e i retry cambiano il costo per risorsa utilizzabile.

Comportamento della ricarica automatica: una soglia aggressiva può provocare acquisti immediati e le normali commissioni non sono rimborsabili. La ricarica automatica va trattata come un controllo di continuità della produzione con avvisi, non come un'impostazione da configurare e dimenticare.

Variazione dell'output: una modifica al prompt o al modello che produce risposte più lunghe aumenta la spesa anche a traffico costante. Input, input in cache, output e risultati accettati vanno misurati separatamente.

Variazione dei rate limit: i limiti serverless possono essere dinamici e specifici del modello. Raggiungere il Tier 5 tramite la spesa cumulativa non riserva la flotta sottostante.

Non esiste uno sconto self-service annuale standard da inserire nel modello. Il serverless è prepagato e a consumo, le PTU richiedono almeno un mese, le prenotazioni GPU pubblicano fasce di 7-30, 31-90 e 91-180 giorni e gli impegni più lunghi passano dal commerciale. Il rischio di vincolo annuale si trova in un ordine personalizzato o in una sequenza di prenotazioni infrastrutturali, non in un piano annuale pubblico per un'app.

Alternative a Together AI: prima normalizzare lo stesso modello

Together AI non è sempre il provider più economico per ogni modello condiviso. Per gpt-oss-120B, il suo prezzo serverless pubblico coincide esattamente con quello di Fireworks AI e Groq: $0.15 per milione di token in input e $0.60 per milione di token in output. Un job con 1 milione di token in input e 250,000 in output costa $0.30 presso ciascun provider, prima di eventuali vantaggi dell'input in cache o accordi specifici dell'account.

Questa parità è utile: elimina il prezzo dei token come fattore decisivo e obbliga l'acquirente a confrontare tariffe della cache, rate limit, latenza, controllo sul provider, comportamento del fallback, percorsi di deployment e struttura degli SLA.

Fireworks AI eguaglia la tariffa di base e offre una cache meno cara

Fireworks AI quota gpt-oss-120B Standard serverless a $0.15 per l'input, $0.015 per l'input in cache e $0.60 per l'output, sempre per milione di token. Il job normalizzato fuori cache costa gli stessi $0.30 di Together. Fireworks pubblicizza inoltre $1 in crediti iniziali.

Documentazione dei prezzi serverless di Fireworks AI con le tariffe di gpt-oss-120B
Prezzi serverless di Fireworks AI

In questo confronto ristretto, Fireworks prevale quando il carico contiene un grande prefisso riutilizzabile, perché la tariffa attuale per l'input in cache di gpt-oss è esplicita e bassa. Offre anche i livelli serverless Standard, Priority e Fast, aggiungendo un'altra scelta tra latenza e prezzo. Il limite è che questi livelli complicano un confronto apparentemente semplice, mentre il prezzo delle GPU dedicate appartiene a un prodotto diverso dalle PTU di Together.

Fireworks è indicato quando il requisito principale è un serverless per modelli open source con un uso intenso della cache e i suoi controlli sul livello di servizio si adattano all'applicazione. Together è preferibile quando conta di più poter passare, con la stessa API, a PTU, inferenza dedicata del modello, fine-tuning, sandbox o cluster grezzi.

Groq vende velocità alla stessa tariffa per token

Groq quota gpt-oss-120B agli stessi $0.15 per l'input e $0.60 per l'output, quindi anche il job normalizzato costa $0.30. La pagina attuale del modello indica circa 500 token al secondo, un limite del piano Developer di 250,000 token al minuto e 1,000 richieste al minuto per questo modello.

Documentazione dei modelli supportati da Groq con prezzo, velocità e rate limit di gpt-oss-120B
Prezzi e limiti dei modelli Groq

Groq è la voce più incisiva della shortlist quando una bassa latenza di generazione è la promessa del prodotto. Il livello enterprise Performance aggiunge throughput riservato con uno SLA di disponibilità del 99.9%, ma il prezzo pubblico non è disponibile. Il costo self-service dei token è quindi facile da confrontare, quello della capacità riservata impossibile da normalizzare senza un preventivo.

Groq va scelto per un percorso interattivo in cui i modelli supportati e la velocità contano più del più ampio stack di training e infrastruttura di Together. Va scartato quando il carico richiede fine-tuning, cluster GPU, sandbox o il percorso PTU pubblico di Together sotto un unico account.

OpenRouter può costare meno, accettando il compromesso di un aggregatore

OpenRouter quota attualmente gpt-oss-120B a $0.03 per l'input, $0.03 per l'input in cache e $0.17 per l'output, per milione di token. Il job normalizzato da 1 milione di token in input e 250,000 in output costa $0.0725 prima delle commissioni sull'acquisto dei crediti. Ripartendo la commissione del 5.5% su crediti usati interamente, il costo sale a circa $0.0765, anche se la commissione minima di $0.80 pesa soprattutto sulle piccole ricariche.

Pagina del modello gpt-oss-120B su OpenRouter con prezzi aggiornati dei token e routing dei provider
Prezzi di gpt-oss-120B su OpenRouter

Nell'esempio spot, OpenRouter vince instradando le richieste tra provider a monte. Offre inoltre fallback automatico e un catalogo di modelli molto più ampio. Non è però lo stesso prodotto della capacità riservata di Together o della scelta di un singolo provider infrastrutturale: selezione del routing, policy sui dati, latenza, disponibilità a monte e cambi di provider entrano nell'architettura.

Il suo free tier è più accessibile di quello di Together: la pagina dei prezzi attuale elenca più di 25 modelli gratuiti e 50 richieste al giorno. In cambio, offre limiti gratuiti bassi, applica una commissione pay-as-you-go del 5.5% e si riserva il diritto di far scadere i crediti inutilizzati dopo un anno. Together afferma invece che, al momento, i crediti acquistati non scadono.

OpenRouter è adatto quando contano soprattutto l'accesso a molti modelli, i fallback e il prezzo spot instradato attuale. Together è preferibile quando controllo diretto sul provider, percorso prevedibile verso capacità riservata, training del modello o infrastruttura dedicata valgono più della singola richiesta instradata al minor costo.

Il risultato normalizzato è netto. Per gpt-oss-120B, Together, Fireworks e Groq hanno lo stesso prezzo dei token fuori cache. OpenRouter costa meno in questa fotografia, ma cambia il rapporto con il fornitore. La scelta dipende dal requisito operativo, non dall'affermazione generica che una piattaforma sia più economica.

Chi dovrebbe scegliere Together AI e chi dovrebbe evitarla

Together AI è la piattaforma giusta per un'azienda che prevede di far evolvere il proprio carico basato su modelli open source, dalle chiamate incerte a un piano deliberato di capacità. Non è la scelta automatica per ogni sviluppatore in cerca di un'API economica.

Chi sviluppa da solo dovrebbe partire dal serverless e limitare il primo acquisto a $5. Un'attività circoscritta può essere instradata su DeepSeek V4 Flash, gpt-oss-120B o un altro modello che supera la soglia di qualità. PTU e hardware dedicato vanno evitati finché i log di produzione non dimostrano una domanda stabile. Se l'unico obiettivo è provare molti modelli o ottenere accesso gratuito, OpenRouter può essere il primo account più semplice.

Un founder finanziato dovrebbe usare Together quando la scala di deployment riduce le future migrazioni. Il serverless può validare il prodotto, le PTU possono riservare un modello open source stabile dietro la stessa API e Dedicated Inference può ospitare un modello fine-tuned o personalizzato. Questa continuità vale più di una piccola differenza per token quando la roadmap punta già alla capacità riservata.

Il CTO di un'azienda di medie dimensioni dovrebbe acquistare PTU per un impegno di servizio, non perché la fattura è alta. Deve prevedere l'occupazione, confrontare lo SLA del 99% con la promessa fatta al cliente e valutare la prenotazione di capacità rispetto a transazioni perse o escalation dell'assistenza. Se l'applicazione richiede una disponibilità del 99.9%, una clausola del 99% da sola non basta: serve un fallback progettato o un contratto negoziato.

Un responsabile operativo esperto dovrebbe spostare i volumi offline su Batch prima di riservare capacità. Classificazione, arricchimento, valutazioni e job di dati sintetici possono ottenere fino al 50% di sconto sui modelli idonei. È uno sconto diretto in cambio della latenza. Una PTU acquista capacità e dovrebbe arrivare dopo.

Un team di ricerca o dedicato ai modelli dovrebbe usare Dedicated Inference o cluster GPU solo assegnando un responsabile all'utilizzo. Training, serving personalizzato e controllo di basso livello possono giustificare lo stack. Un team incapace di monitorare ore-GPU, repliche inattive, consumo nei picchi e volumi persistenti sta acquistando un'infrastruttura che non sa governare.

Together AI va evitata quando si verifica una di quattro condizioni. L'unica priorità è il token instradato più economico; il traffico è troppo irregolare per una prenotazione mensile; il modello richiesto è disponibile altrove; oppure l'azienda necessita di uno SLA pubblico più forte senza una trattativa commerciale. Fireworks, Groq, OpenRouter o il fornitore diretto del modello possono essere più adatti.

I punti di forza
Cosa fa bene
9 points

  • Un solo account comprende serverless, capacità di token riservata, inferenza dedicata, fine-tuning, cluster GPU, capacità di calcolo sandbox e storage.
  • Le tariffe serverless attuali sono competitive per diversi modelli open source, con sconti sostanziali sull'input in cache negli endpoint supportati.
  • Al momento, i crediti prepagati acquistati non scadono.
  • Provisioned Throughput aggiunge un percorso pubblico da $0.05/PTU al minuto tra inferenza condivisa e dedicata.
  • Non esiste una prova gratuita senza pagamento: per accedere alla piattaforma occorre acquistare $5.
  • Prima degli sconti negoziati, il prezzo di listino pubblico delle PTU eguaglia il serverless Together soltanto a piena occupazione.
  • Uno SLA di uptime PTU del 99% può essere insufficiente per percorsi critici rivolti ai clienti in assenza di fallback.
  • Deployment dedicati, GPU riservate, storage e modelli fine-tuned possono continuare a fatturare anche quando il volume delle richieste è zero.
  • I prezzi aggiornati possono essere in conflitto con documenti di prodotto più vecchi, quindi gli acquisti devono basarsi su una fonte datata.

La mossa del lunedì: misurare un carico prima di riservare capacità

Lunedì va scelto un solo workflow di produzione ben delimitato e va costruito un registro dei costi per sette giorni. Lo scopo non è provare ogni modello, ma capire se il carico appartiene a serverless, Batch, PTU o capacità dedicata.

  1. Definire un risultato accettato

    Scegliere un'attività con un esito valutabile: una classificazione valida, una modifica al codice che supera i test, una bozza di assistenza approvata o un'estrazione completata. La metrica di business è il costo per risultato accettato.

  2. Registrare l'intero profilo di utilizzo

    Per sette giorni vanno raccolti numero di richieste, input fuori cache, input in cache, output, retry, picco di richieste al secondo, risposte 429, latenza, tempo in sandbox e risultati accettati. I picchi nei giorni feriali vanno separati da notti e fine settimana.

  3. Calcolare la baseline serverless

    Applicare le tariffe aggiornate del modello al mix di token misurato. Spostare il lavoro offline idoneo su Batch e ricalcolare. Limitare l'output superfluo e conservare prefissi di prompt stabili, così la baseline include i risparmi ottenibili dalla cache.

  4. Eseguire il test di occupazione delle PTU

    Usare il calcolatore PTU aggiornato con picco delle richieste, cache hit rate e mix di token. Confrontare il numero di PTU necessario con l'uso medio. All'80% di occupazione, il prezzo di listino pubblico comporta un sovrapprezzo effettivo per token del 25%: occorre decidere se capacità riservata e SLA del 99% lo giustificano.

  5. Passare di livello solo per un requisito preciso

    Scegliere Dedicated Inference per modelli personalizzati, controllo single-tenant o prestazioni hardware stabili. Passare ai cluster GPU solo quando il team possiede lo stack di serving o training. Accanto al responsabile del budget vanno indicati anche i responsabili dello spegnimento e della pulizia dello storage.

La decisione finale deve stare in una frase condivisibile da finanza e ingegneria: «Questo carico resta serverless», «questo flusso offline passa a Batch» oppure «questo percorso cliente riserva N PTU perché la garanzia di capacità vale il sovrapprezzo misurato per l'inattività». È un'azione da lunedì, non una migrazione infrastrutturale avviata da un titolo sui prezzi.

FAQ sui prezzi di Together AI

Quanto costano 1,000 token su Together AI?

La tariffa per milione del modello va divisa per 1,000, calcolando separatamente input e output. MiniMax M3 costa $0.0003 per 1,000 token in input fuori cache e $0.0012 per 1,000 token in output. Kimi K3 costa $0.003 in input e $0.015 in output per 1,000 token.

Quanto costa Together AI al mese?

Il serverless non prevede un abbonamento mensile fisso: dopo l'acquisto di accesso da $5, il costo mensile segue l'utilizzo. Una PTU costa $2,160 in un mese di 30 giorni oppure circa $2,190 adottando l'ipotesi di 43,800 minuti per il mese medio usata nella pagina dei prezzi. Una H100 Dedicated in esecuzione continua costa $3,952.80 per 720 ore alla tariffa attuale di $5.49 l'ora.

Together AI è gratis?

No. Together AI attualmente non offre una prova gratuita e richiede un acquisto minimo di $5 in credito prepagato per accedere alla piattaforma. Il catalogo aggiornato quota Ternary Bonsai 27B a $0 per i token in input e output, ma l'account richiede comunque l'acquisto da $5.

Together AI offre crediti gratuiti?

Non come offerta permanente di registrazione. Le promozioni precedenti sono terminate e l'accesso attuale richiede un acquisto di $5. Together gestisce anche un programma di crediti per la ricerca, solo su invito, destinato a progetti studenteschi esterni ai corsi formali; non è però ampiamente disponibile.

Quali sono i limiti del free tier di Together AI?

Non esiste un free tier convenzionale. Un saldo acquistato di $5 colloca l'account nel Build Tier 1, che attualmente indica 600 richieste LLM al minuto, 3,000 richieste di embedding al minuto e un limite di rerank pari a 500,000. I limiti dinamici e specifici del modello possono essere inferiori.

Quali sono le migliori alternative a Together AI?

Fireworks AI è l'alternativa più vicina per un'offerta ampia di inferenza e fine-tuning su modelli open source; Groq è interessante per i modelli supportati a bassa latenza; OpenRouter eccelle nel routing e nei fallback su molti modelli. Su gpt-oss-120B, Together, Fireworks e Groq applicano attualmente la stessa tariffa di $0.15 in input e $0.60 in output per milione di token. Il prezzo instradato di OpenRouter è più basso in questa fotografia, ma aggiunge una commissione sull'acquisto dei crediti e un livello di aggregazione.

Together AI offre uno sconto per studenti?

Together AI non pubblica una fascia di prezzo permanente per studenti. Il suo programma di crediti per la ricerca, accessibile solo su invito, concede piccoli finanziamenti a studenti impegnati in progetti esterni ai corsi formali e chiede ai beneficiari di citare Together AI nel lavoro.

Qual è la politica di rimborso di Together AI?

Le condizioni di Together stabiliscono che, per impostazione predefinita, le somme versate non sono rimborsabili e gli obblighi di pagamento non sono annullabili né riproporzionabili, salvo diversa indicazione in un ordine. Le prenotazioni GPU non sono rimborsabili. Se un job di fine-tuning viene annullato, gli step completati vengono addebitati e solo la parte non eseguita viene rimborsata.

I crediti Together AI scadono?

Al momento, i crediti prepagati acquistati non scadono. È una questione distinta dalla rimborsabilità: i crediti possono restare utilizzabili senza essere rimborsabili e quelli acquistati dopo l'emissione di una fattura non possono saldare un debito precedente scaduto.

I prezzi di Together AI sono cambiati nel 2026?

Sì. Together AI ha lanciato Provisioned Throughput l'8 luglio 2026, introducendo capacità di token riservata a $0.05 per PTU al minuto, un minimo di un mese e uno SLA di uptime del 99%. Anche il catalogo serverless e le tariffe dell'hardware dedicato sono cambiati da giugno; per questo la pagina riporta la data di verifica del 22 agosto.

Provisioned Throughput costa meno del serverless Together?

Non automaticamente. Ai prezzi di listino pubblici, una PTU utilizzata per intero corrisponde quasi esattamente allo stesso valore della sua capacità serverless Together su 30 giorni. Il sottoutilizzo aumenta il prezzo effettivo dei token. Le PTU acquistano capacità riservata e uno SLA; uno sconto negoziato sull'impegno può migliorare la tariffa, ma Together non ne pubblica la struttura.

Ottieni la Mappa degli strumenti AI per imprenditori

La Mappa degli strumenti AI per imprenditori trasforma i prezzi dei modelli in uno stack pratico per l'adozione, indicando soglia di qualità, ruolo nel routing e livello di costo che giustifica ciascuno strumento. Iscriviti per ricevere gratuitamente la prossima edizione.

Ultimo aggiornamento

2 set 2026

CategoriaAI

Preferisca questo sito su Google

Aggiungi omidsaffari.com come fonte preferita nella Ricerca Google

Segni omidsaffari.com come fonte preferita e Google lo mette in evidenza per lei in Top Stories, AI Overviews e AI Mode.

Newsletter

Una lettera, ogni domenica. Sistemi che funzionano, non hot take.

Build log, sistemi in produzione e note dal campo da un portafoglio di venture AI.

Settimanale. Niente spam. Si cancella quando vuole.