Preços da Together AI (2026): PTUs dão capacidade, não desconto
Preços da Together AI verificados em agosto de 2026: tokens serverless, PTUs de $0.05, GPUs, custos ocultos, pontos de equilíbrio e alternativas.

Nos preços da Together AI, o caminho mais barato é o serverless, e a nova opção de $0.05 por minuto de PTU não representa um desconto de tabela em relação às próprias tarifas por token. Uma PTU reservada continuamente custa $2,160 em um mês de 30 dias; contrate-a pela capacidade garantida e pelo SLA de disponibilidade de 99%, não por tokens ociosos mais baratos.
Preços da Together AI: visão geral
A melhor forma de contratar a Together AI é por etapas: comece pelo uso serverless pré-pago, migre o tráfego estável e sensível à confiabilidade para Provisioned Throughput e só reserve hardware dedicado quando a carga exigir controle single-tenant ou modelos personalizados. O erro caro é interpretar essas etapas como descontos por volume. Cada uma mede algo diferente e transfere riscos operacionais distintos.

A Together AI não oferece uma escada simples de planos Free, Pro e Business. Ela vende tokens e saídas de mídia em serverless, capacidade de tokens reservada, GPUs dedicadas gerenciadas, clusters de GPU brutos, computação em sandbox, armazenamento e fine-tuning. Um único produto pode acionar vários medidores. Um agente pode gerar cobrança por tokens do modelo, CPU e memória do sandbox e um endpoint com fine-tuning que continua sendo cobrado entre as requisições.
Todos os preços e limites desta página foram verificados na página de preços ao vivo da Together AI, na documentação de cobrança e na documentação dos produtos em 22 de agosto de 2026. A data importa. A página atual já difere de forma relevante das análises de preços publicadas em junho: ela inclui MiniMax M3, Kimi K3, GLM-5.2, tarifas atuais mais baixas para hardware dedicado e a nova camada Provisioned Throughput.
A primeira regra de decisão é simples. Use serverless quando a demanda for incerta ou vier em picos. Considere uma PTU quando um modelo definido sustentar uma carga-base estável e a capacidade reservada tiver valor para o negócio. Escolha Dedicated Inference quando precisar de um modelo personalizado, hardware single-tenant ou controle de configuração. Escolha um cluster de GPU apenas se a empresa quiser operar a computação subjacente em vez de comprar um resultado de inferência gerenciado.

Essa distinção torna a Together AI atraente para um fundador com capital que deseja um único caminho de API, do experimento à infraestrutura reservada. Ela é menos atraente para quem desenvolve sozinho em busca da menor tarifa spot por token ou para uma equipe incapaz de prever sequer um mês de demanda. Flexibilidade é o produto serverless. Compromisso é outra compra.
A inferência serverless é o padrão — e o modelo domina a conta
Serverless é o ponto de partida certo porque não há custo de provisionamento nem uso mínimo além da compra de $5 para acessar a plataforma. As requisições vão para uma frota compartilhada, e a cobrança corresponde ao trabalho concluído. O modelo, a direção dos tokens, a tarifa de cache e o tamanho da saída pesam muito mais na fatura do que a marca Together AI impressa nela.
O catálogo atual de chat cobre uma faixa ampla. O LFM2.5-8B-A1B custa $0.03 por milhão de tokens de entrada e $0.12 por milhão de tokens de saída. O DeepSeek V4 Flash 0731 custa $0.14 pela entrada, $0.03 pela entrada em cache e $0.28 pela saída. O gpt-oss-120B custa $0.15 pela entrada e $0.60 pela saída. Na ponta mais cara da lista de texto exibida, o Kimi K3 custa $3 pela entrada, $0.30 pela entrada em cache e $15 pela saída por milhão de tokens.
Essa tarifa do DeepSeek hospedado pela Together é específica do provedor. A análise separada dos preços da DeepSeek detalha a economia do modelo contratado diretamente; para uma fatura da Together, consulte a página ao vivo da empresa.
Isso representa uma diferença de 125x entre os $0.12 da saída do LFM e os $15 da saída do Kimi K3. Otimizar o provedor e ignorar o roteamento de modelos é como negociar um pequeno desconto no frete e enviar todos os pacotes por avião. O primeiro controle de custos é atribuir a cada tarefa o modelo mais barato que atinja o nível mínimo de qualidade.
Uma carga típica de agente deixa isso concreto. Suponha que 1,000 chamadas consumam 8,000 tokens de entrada cada e produzam 1,000 tokens de saída. São 8 milhões de tokens de entrada e 1 milhão de tokens de saída:
- DeepSeek V4 Flash 0731 custa $1.40 no total, ou $0.0014 por chamada.
- gpt-oss-120B custa $1.80 no total, ou $0.0018 por chamada.
- MiniMax M3 custa $3.60 no total, ou $0.0036 por chamada.
- GLM-5.2 custa $15.60 no total, ou $0.0156 por chamada.
- Kimi K3 custa $39 no total, ou $0.039 por chamada.
A maior diferença não vem do overhead do provedor, mas do modelo escolhido e da quantidade de saída cara que ele produz. Um classificador de atendimento que retorna um único rótulo não precisa do mesmo orçamento de saída que um agente de pesquisa redigindo uma resposta longa. Defina um limite rígido de saída para a tarefa delimitada antes de procurar um endpoint mais barato.
Por isso, uma comparação mais ampla das APIs de IA mais baratas só é útil depois que a tarefa é normalizada. Comparar provedores com tamanhos diferentes de prompt e resposta, premissas distintas de cache ou modelos diferentes gera um número elegante que não serve para orientar o orçamento.
A entrada em cache pode baratear o prefixo repetido
A entrada em cache é o desconto self-service mais forte quando os prompts se repetem. Isso significa que a Together reconhece um prefixo inalterado — como uma instrução de sistema longa ou um contexto de referência estável — e cobra esses tokens por uma tarifa menor nos modelos compatíveis.
Para a mesma carga de 1,000 chamadas, suponha que 80% dos 8 milhões de tokens de entrada se qualifiquem para a tarifa de cache. O MiniMax M3 cai de $3.60 para $2.064. O GLM-5.2 cai de $15.60 para $8.304. O Kimi K3 cai de $39 para $21.72. As reduções são de 42.7%, 46.8% e 44.3%, respectivamente.
A consequência operacional é maior do que o percentual do desconto. Um operador sênior deve separar o prefixo estável do contexto específico de cada requisição, registrar tokens em cache e fora do cache de forma independente e observar mudanças no prompt que invalidem o cache. Uma reescrita do prompt pode aumentar o gasto sem alterar o tráfego; isso parece um problema de preço até os dados de cache explicarem a causa.
O Batch só fica mais barato quando modelo e workflow se qualificam
A Batch API da Together AI oferece até 50% de desconto em modelos serverless selecionados em troca de processamento assíncrono. É o medidor certo para classificação offline, dados sintéticos, avaliações e resumos em massa. Não serve para chat ao vivo, assistente de checkout ou atendimento ao cliente que depende da próxima resposta.
O contrato atual do Batch permite até 50,000 requisições em um arquivo de entrada de 100 MB e até 30 bilhões de tokens enfileirados por modelo. A janela de conclusão é fixa em 24 horas e funciona como uma meta de melhor esforço. A Together recomenda lotes de 1,000 a 10,000 requisições. Respostas concluídas com sucesso são cobradas, requisições com falha não são, e cancelar um lote não apaga o custo das respostas já concluídas.
O desconto anunciado de 50% não vale para tudo. Apenas alguns modelos serverless recebem a tarifa reduzida, e certos modelos nem sequer podem rodar via Batch. Endpoints dedicados aceitam jobs em lote, mas o desconto não se aplica a eles. Confira a lista atual de modelos para Batch antes de montar uma projeção.
Em um exemplo atual com desconto, 8 milhões de tokens de entrada mais 1 milhão de tokens de saída no Llama 3.3 70B custam $9.36 pelas tarifas de $1.04 tanto para entrada quanto para saída. Um lote elegível com 50% de desconto custa $4.68. A economia é relevante porque o job aceita uma conclusão mais lenta, não porque toda requisição serverless ficou mais barata.
Imagem, vídeo, áudio e armazenamento usam unidades diferentes
Serverless não se limita a texto. O catálogo atual de imagens vai de $0.0017 a $0.134 por imagem ou megapixel entre os modelos exibidos. A lista de vídeos varia de $0.115 a $3.20 por vídeo gerado. A transcrição de fala em texto custa de $0.0015 a $0.0045 por minuto de áudio, enquanto a síntese de texto em voz varia de $4 a $65 por milhão de caracteres. Os embeddings multilingual e5 large instruct custam $0.02 por milhão de tokens, e a moderação com Llama Guard 4 12B custa $0.20 por milhão de tokens.
Essas faixas não são intercambiáveis. A Together informa que os preços exibidos de imagem e vídeo usam a menor resolução ou duração listada e que ultrapassar o número padrão de etapas de geração pode aumentar o custo. Um gerente de produto que orça 100,000 gerações de vídeos curtos precisa definir o modelo exato, a duração, a resolução, a configuração de áudio e a taxa de novas tentativas. Multiplicar o preço da miniatura mais barata pelo volume de produção subestima a despesa.
Serverless ainda é o padrão certo para a maioria das cargas novas. Seu limite não é a tarifa por token, mas a capacidade compartilhada, os limites dinâmicos de requisições e a ausência de um compromisso público de disponibilidade equivalente ao produto Provisioned. Quando isso vira um risco para o cliente, a próxima decisão é sobre capacidade, não sobre um upgrade genérico.
Provisioned Throughput transforma capacidade em compromisso mensal
Provisioned Throughput só vale a compra quando reservar capacidade de tokens resolve um problema de negócio. A Together AI lançou o produto em 8 de julho de 2026 como uma camada intermediária entre o serverless de melhor esforço e o Dedicated Inference totalmente configurável. Ele inclui SLA de disponibilidade de 99%, compromisso mínimo de um mês e preço público de tabela de $0.05 por Provisioned Throughput Unit, ou PTU, por minuto.
Uma PTU não é um pacote de tokens. É uma taxa reservada de tokens por minuto para um modelo compatível, mantida para o cliente. Entrada, entrada em cache e saída consomem essa capacidade em velocidades diferentes. A página atual publica três perfis de capacidade:
O MiniMax M3 entrega 166,667 tokens de entrada, 833,333 tokens de entrada em cache ou 41,667 tokens de saída por minuto e por PTU. O Kimi K3 entrega 16,667 de entrada, 166,667 de entrada em cache ou 3,333 de saída. O GLM-5.2 entrega 35,714 de entrada, 192,308 de entrada em cache ou 11,364 de saída. Uma requisição mista consome uma combinação dessas capacidades.
Por $0.05 por minuto, uma PTU custa $3 por hora, $72 por dia e $2,160 ao longo de um mês de 30 dias. A observação de rodapé da calculadora da Together usa cerca de 43,800 minutos para o provisionamento contínuo de um mês médio, chegando a aproximadamente $2,190. O financeiro deve usar o contrato exato e o mês do calendário em vez de pressupor que todo mês custa invariavelmente $2,160.
O teste de ocupação da PTU
O cálculo revelador é quanto uma PTU custaria no próprio medidor serverless da Together. Dedique uma PTU do MiniMax M3 à entrada por 30 dias e ela poderá entregar cerca de 7.2 bilhões de tokens de entrada. Pela tarifa serverless de $0.30 por milhão, essa capacidade vale aproximadamente $2,160. Dedique-a à saída e ela poderá entregar cerca de 1.8 bilhão de tokens de saída. A $1.20 por milhão, o valor também fica em torno de $2,160. O caminho da entrada em cache chega ao mesmo ponto, dentro do arredondamento.
Kimi K3 e GLM-5.2 seguem a mesma calibração. A capacidade pública de uma PTU atinge a paridade com o preço público serverless praticamente em ocupação total durante um mês de 30 dias. A calculadora publicada pode mostrar uma grande economia em relação a um modelo comercial selecionado, mas compara explicitamente o gasto com PTU ao preço de tabela desse modelo externo. Ela não demonstra um desconto geral em relação às próprias tarifas serverless da Together.
Este é o teste de ocupação da PTU: o valor da capacidade só iguala o valor serverless quando a unidade reservada é usada por completo. Com 50% de utilização, as tarifas efetivas do MiniMax M3 dobram para $0.60 por milhão de tokens de entrada, $0.12 por milhão de tokens de entrada em cache ou $2.40 por milhão de tokens de saída. Com 25%, quadruplicam para $1.20, $0.24 e $4.80. Com 70%, a tarifa efetiva fica em torno de 1.43x a serverless, aproximadamente $0.43 para entrada e $1.71 para saída.

Isso não torna as PTUs um produto ruim; apenas deixa claro o que elas oferecem. Um CTO de uma empresa de médio porte que opera um agente voltado ao cliente pode aceitar racionalmente 20% de capacidade ociosa se o canal reservado reduzir o risco de limitação e o SLA de disponibilidade de 99% tiver valor contratual. Um fundador com demanda apenas em dias úteis não deve pagar por noites e fins de semana, a menos que a garantia de capacidade proteja receita suficiente para cobrir o prêmio.
A página pública afirma que compromissos maiores podem receber descontos, mas não divulga a tabela. Um desconto negociado reduz o ponto de equilíbrio para menos de 100% de ocupação. Até que a equipe comercial coloque essa tarifa em um pedido, modele o preço público de tabela e trate qualquer desconto como ganho adicional.
Um SLA de 99% ainda precisa de interpretação comercial
Uma meta mensal de disponibilidade de 99% permite cerca de 7 horas e 18 minutos de indisponibilidade em um mês de 30.4 dias. Isso é mais forte que o acesso de melhor esforço, mas o nível empresarial Performance da Groq publica 99.9%; portanto, 99% não é o compromisso mais forte desta seleção. A empresa deve comparar a compensação prevista por escrito, as exclusões de manutenção, o desenho regional e a rota de fallback, em vez de parar na presença de três caracteres e um sinal de porcentagem.
Provisioned Throughput é mais defensável quando a aplicação tem carga-base estável, escolha previsível de modelo e uma promessa ao cliente que a limitação da frota compartilhada pode quebrar. Faz menos sentido quando o tráfego varia 10x, o modelo muda toda semana ou o trabalho offline pode migrar para Batch. Nesses casos, a reserva transforma incerteza em tempo ocioso pago.
A escolha muda a conversa de orçamento na segunda-feira
Antes de 8 de julho, uma equipe que escolhia a Together precisava dar um salto amplo do serverless compartilhado, cobrado por token, para uma infraestrutura dedicada de GPU. As PTUs acrescentam uma linha intermediária ao orçamento: throughput reservado do modelo sem assumir o dimensionamento de GPUs nem uma stack personalizada de serving. Assim, o financeiro pode aprovar um teto mensal fixo de capacidade enquanto a engenharia mantém a mesma API de inferência.
A consequência é uma nova métrica operacional. Só acompanhar o gasto com tokens já não basta. O responsável precisa medir o pico de requisições por segundo, a combinação de tokens de entrada e saída, a taxa de acerto do cache, a ocupação da capacidade, as requisições limitadas e os resultados aceitos. Se o dashboard não exibe essas seis medidas, a empresa não consegue saber se a PTU é proteção ou desperdício.
Uma PTU do MiniMax M3 rende cerca de 600,000 chamadas de agente
Uma PTU comporta cerca de 600,000 chamadas do MiniMax M3 em um mês de 30 dias quando cada chamada usa 8,000 tokens de entrada fora do cache e produz 1,000 tokens de saída. É a mesma carga do exemplo anterior, precificada em $0.0036 por chamada serverless; portanto, 600,000 chamadas serverless custam $2,160. Por definição, os medidores de capacidade e de tokens se encontram na ocupação total.
O cálculo de capacidade considera os dois lados da requisição. Oito mil tokens de entrada consomem cerca de 0.048 minuto de PTU na capacidade de 166,667 tokens de entrada por minuto do MiniMax M3. Mil tokens de saída consomem mais 0.024 minuto de PTU na taxa de 41,667 tokens de saída por minuto. A requisição completa, portanto, consome cerca de 0.072 minuto de PTU. Divida os 43,200 minutos de PTU do mês pelo consumo da requisição e o resultado será de aproximadamente 600,000 chamadas.
Isso cria um orçamento operacional pronto para orientar a decisão:
Com 80% de ocupação, a PTU comporta cerca de 480,000 chamadas. A conta serverless equivalente é de $1,728, deixando um prêmio mensal de reserva de $432. A PTU custa 25% mais que o trabalho serverless consumido. Um produto voltado ao cliente pode aceitar esse prêmio se a capacidade reservada e o SLA de 99% protegerem mais de $432 em receita, tempo de suporte ou custo reputacional.
Com 70% de ocupação, ela comporta cerca de 420,000 chamadas. Serverless custa $1,512, então o prêmio da capacidade é de $648. Com 50%, ela comporta 300,000 chamadas e serverless custa $1,080, deixando metade da conta da PTU como capacidade ociosa paga.
O cache muda quantas chamadas cabem na unidade. Se 80% da entrada estiver em cache, cada requisição usará cerca de 0.04128 minuto de PTU, em vez de 0.072. Uma PTU poderá então processar aproximadamente 1.0465 milhão dessas mesmas chamadas em ocupação total. O preço serverless cai ao mesmo tempo, de $0.0036 para $0.002064 por chamada; assim, o custo com carga total ainda converge para perto de $2,160.
O ganho comercial do cache envolve, portanto, throughput e custo unitário. Um prefixo de sistema longo e estável permite que a mesma capacidade reservada processe mais trabalho dos clientes. Uma mudança de prompt que elimine o reaproveitamento do cache reduz a folga da PTU e aumenta o gasto serverless ao mesmo tempo.
Agora amplie a decisão para uma linha orçamentária. Dez PTUs custam $21,600 em um mês de 30 dias e comportam cerca de 6 milhões das chamadas sem cache do exemplo em ocupação total. Com 70%, processam 4.2 milhões de chamadas. A conta serverless equivalente é de $15,120, deixando um prêmio mensal de $6,480 pela capacidade reservada e pelo SLA.
Esses $6,480 são o valor que um CTO deve defender. Se a limitação da frota compartilhada ameaçar mais de $6,480 em margem bruta, carga de suporte ou penalidades contratuais, a reserva pode justificar seu lugar. Caso contrário, serverless mantém os mesmos $6,480 disponíveis para investir no produto. Um argumento genérico de “estamos gastando $15,000 em tokens” nunca chega a essa decisão.
Dedicated Inference não tem um ponto de equilíbrio público por token igualmente claro porque o throughput de saída depende do modelo, da quantização, do formato do lote, da quantidade de hardware e da configuração. Qualquer artigo que divida o preço mensal de uma GPU por uma tarifa genérica de tokens e anuncie um ponto de virada universal está escondendo a variável que define a resposta. Meça o modelo candidato no endpoint pretendido e então compare o custo por resultado aceito na utilização observada.
Dedicated Inference e clusters de GPU resolvem problemas diferentes
Dedicated Inference é a escolha certa quando o controle importa mais que a flexibilidade self-service. A Together aloca hardware single-tenant, aceita modelos personalizados e oferece autoscaling e tratamento de picos de tráfego. O preço atual é de $5.49 por hora de GPU para uma NVIDIA HGX H100 e $8.99 para uma HGX B200. Os preços de H200, B300, GB200 NVL72 e GB300 NVL72 exigem contato com a equipe comercial.
Em uso contínuo por 30 dias, uma H100 custa $3,952.80 e uma B200 custa $6,472.80. Esses valores são por GPU, antes de qualquer exigência de múltiplas GPUs. O endpoint é cobrado enquanto estiver em execução, independentemente do volume de requisições; portanto, uma implantação ociosa continua sendo uma despesa ativa.
Não use uma documentação antiga de endpoints dedicados para projetar a conta de hardware. Atualmente, a documentação mostra valores de H100, H200 e B200 que entram em conflito com a página de preços ao vivo. A página de preços atual é a fonte mais recente e a verificada aqui. É exatamente por isso que um preço de infraestrutura precisa vir acompanhado de uma data.
Dedicated Inference justifica a conta quando um modelo com fine-tuning ou enviado pelo cliente não pode rodar no serverless compartilhado, quando a latência p99 exige hardware estável, quando o serving do modelo demanda configurações personalizadas ou quando a utilização alta e constante torna uma GPU reservada economicamente superior. Ele perde quando o endpoint passa boa parte do dia esperando.
Clusters de GPU entregam uma camada mais bruta — e podem parecer mais baratos pelo motivo errado
Os clusters de GPU deixam uma parte maior da stack sob responsabilidade do comprador. As tarifas atuais sob demanda são de $3.99 por hora de GPU para H100, $5.99 para H200 e $8.19 para B200. O equivalente de uma H100 por 30 dias é $2,872.80, mas isso não a torna uma substituta mais barata da H100 Dedicated de $3,952.80. Quem compra o cluster assume mais trabalho de implantação, serving, orquestração, observabilidade e utilização.
As tarifas de clusters reservados diminuem conforme o compromisso aumenta. A H100 cai para $3.69 em 7-30 dias, $3.45 em 31-90 dias e $3.19 em 91-180 dias. A H200 cai de $4.99 para $4.15 e depois para $3.99 nas mesmas faixas. A B200 cai de $7.99 para $7.79 e depois para $6.79. Prazos de 181 dias ou mais exigem uma cotação.
O desconto vem com limites rígidos. A documentação de cobrança de GPU da Together afirma que a reserva inteira é cobrada antecipadamente ou descontada assim que provisionada. As reservas não são reembolsáveis, não admitem reembolso parcial e não podem ser pausadas. Se o cluster ultrapassar a capacidade reservada, a capacidade adicional será cobrada pela tarifa sob demanda.
Para uma reserva de H100 por 91-180 dias, o mês normalizado de 720 horas custa $2,296.80 por GPU. Isso representa $576 a menos que o equivalente sob demanda. A economia só tem valor se a GPU permanecer ocupada com trabalho útil. Uma reserva de quatro GPUs usada pela metade não se torna econômica só porque a linha por hora é menor.
O armazenamento também tem ciclo de vida próprio. O armazenamento compartilhado custa $0.16 por mês para cada GiB, o que leva 1 TiB a cerca de $163.84 por mês. O volume persiste e continua gerando cobrança depois que um cluster é encerrado, até que alguém o exclua. Isso é operacionalmente útil para recriar a computação em torno de dados duráveis, mas também transforma volumes abandonados em gastos silenciosos.
O fine-tuning pode ser barato para treinar e caro para manter no ar
O fine-tuning tem dois custos separados: o job de treinamento e a implantação posterior do modelo. A linha de treinamento pode parecer pequena. Hospedar o resultado pode se tornar a principal despesa mensal.
A Together calcula o treinamento padrão multiplicando os tokens do conjunto de dados pelas épocas, além dos tokens opcionais de avaliação multiplicados pelas execuções de avaliação. Para modelos de até 16B parâmetros, o fine-tuning supervisionado custa $0.48 por milhão de tokens processados com LoRA e $0.54 com fine-tuning completo. Direct Preference Optimization, ou DPO, custa $1.20 com LoRA e $1.35 com ajuste completo.
Para modelos de 17B-69B, as quatro tarifas são $1.50, $1.65, $3.75 e $4.12. Para modelos de 70B-100B, elas são $2.90, $3.20, $7.25 e $8. O valor mínimo padrão por job é $4.
Modelos maiores e determinados modelos específicos usam preços especializados. O LoRA do DeepSeek V4 Flash custa $6 por milhão de tokens processados no fine-tuning supervisionado e $15 no DPO, com mínimo de $12. O gpt-oss-120B custa $5 e $12.50, com mínimo de $6. O Kimi K2.6 ou K2.7-Code custa $15 e $37.50, com mínimo de $60. O GLM-5.2 custa $40 e $100, com mínimo de $60.
Essa variação por modelo muda um experimento aparentemente simples. Um conjunto de dados de 20 milhões de tokens executado por três épocas processa 60 milhões de tokens. Em um job LoRA padrão de até 16B, o treinamento supervisionado custa $28.80. No LoRA especializado do GLM-5.2, a mesma quantidade de tokens processados custa $2,400. O tamanho do conjunto de dados não mudou; mudou o preço do modelo-base.
O job de treinamento ainda não representa o custo do ciclo de vida. Um modelo com fine-tuning exige capacidade de implantação e saldo pré-pago suficiente. Uma única H100 Dedicated atual mantida em execução por 30 dias custa $3,952.80. Uma equipe pode gastar $28.80 para criar um adaptador pequeno e depois desembolsar mensalmente mais de 137x esse valor para manter uma H100 ativa.
É aqui que o orçamento de um protótipo costuma estourar. O cientista de dados registra o job de treinamento. Mais tarde, o financeiro encontra a conta de serving. Aprove o experimento com um plano de implantação anexado: horas previstas no ar, quantidade de GPUs, piso de autoscaling, volume de requisições e responsável pelo desligamento.
O reembolso por um treinamento cancelado é mais restrito do que muitos compradores imaginam. A Together cobra as etapas concluídas e reembolsa apenas o trabalho não realizado. As tarifas padrão da plataforma também não são reembolsáveis por padrão, segundo os termos. Trate um job de treinamento como computação consumida, não como uma assinatura de software reversível.
Sandbox e Code Interpreter são medidores separados para agentes
O Code Sandbox custa $0.0446 por hora de vCPU mais $0.0149 por GiB de RAM por hora. Um sandbox executado com 2 vCPUs e 8 GiB por 160 horas custa cerca de $33.34. O Code Interpreter usa outro medidor: $0.03 por sessão de 60 minutos.
Em um produto com agentes, essas cobranças ficam ao lado da inferência do modelo. Se 10,000 execuções mensais do agente abrirem, cada uma, uma sessão de uma hora no interpreter, só essa linha custará $300 antes dos tokens do modelo. Se for possível reutilizar sessões com segurança, a arquitetura do produto altera o custo por job concluído. Se elas permanecerem abertas depois que o trabalho acabar, a execução ociosa vira o equivalente, em escala menor, à capacidade ociosa de GPU.
A unidade correta, portanto, é o custo por resultado aceito, não o custo por milhão de tokens. A chamada do MiniMax M3 usada no exemplo custa $0.0036; acrescente uma sessão de Code Interpreter de $0.03 e o caminho custará pelo menos $0.0336 antes de novas tentativas ou outras chamadas de ferramentas. Instrumente o caminho completo.
A Together AI não é grátis, mesmo quando um modelo mostra $0 em tokens
A Together AI não oferece atualmente um teste grátis e exige a compra mínima de $5 em créditos pré-pagos para liberar o acesso à plataforma. A resposta sobre plano gratuito, portanto, é inequívoca: não existe conta grátis sem pagamento para usar a API.
O catálogo ao vivo inclui o Ternary Bonsai 27B a $0 por milhão de tokens de entrada e $0 por milhão de tokens de saída. Enquanto essa oferta estiver disponível, a inferência contínua pode custar $0, mas a conta ainda exige a compra inicial de $5. Os $5 não são descritos como assinatura mensal. Atualmente, os créditos pré-pagos comprados não expiram.
Quem nunca precisaria pagar além dos primeiros $5? Um entusiasta ou avaliador que use apenas o modelo atual com preço zero, permaneça dentro dos limites de requisição e jamais inicie um serviço pago pode deixar o saldo comprado intacto. É um caso restrito, não um nível gratuito para produção. A disponibilidade, a capacidade e o preço do modelo podem mudar, e nenhum produto deve prometer aos clientes que um endpoint promocional ou gratuito continuará para sempre como backend.
Os créditos grátis de cadastro oferecidos no passado acabaram. A política atual de suporte da Together informa que os usuários precisam comprar ao menos $5 e conectar uma forma de pagamento. Não há saldo negativo no acesso pré-pago comum; quando o saldo comprado chega a zero, o acesso à API é suspenso até a adição de novos créditos. Clientes com contrato seguem os termos de seus pedidos.
Créditos não expiram, mas também não são uma poupança reembolsável
Atualmente, os créditos comprados não têm data de validade. Isso é mais favorável que uma política de vencimento anual, mas não torna inofensivo carregar saldo em excesso. Os termos da Together dizem que, por padrão, as tarifas pagas não são reembolsáveis, as obrigações de pagamento não podem ser canceladas e meses parciais não são rateados, salvo disposição contrária em um pedido.
A recarga automática exige configuração cuidadosa. A documentação de cobrança informa um valor padrão de recarga de $25 e alerta que definir um limite acima do saldo atual pode disparar compras repetidas imediatas até cobrir a diferença. Use um limite alinhado ao consumo previsto, gere um alerta para cada compra e mantenha um orçamento por projeto fora do saldo de créditos.
Os Build Tiers elevam limites com base no gasto acumulado
Os cinco Build Tiers da Together são faixas de limites de requisição definidas pelo gasto acumulado, não planos mensais com recursos. O Tier 1 começa em $5 e lista 600 requisições de LLM por minuto. O Tier 2 começa em $50 e lista 1,800. O Tier 3 começa em $100 e lista 3,000. O Tier 4 começa em $250 e lista 4,500. O Tier 5 começa em $1,000 e lista 6,000.
Os limites de embeddings sobem de 3,000 RPM no Tier 1 para 10,000 nos Tiers 4 e 5. O limite de rerank sobe de 500,000 para 5,000,000 ao longo dos cinco níveis. Essas não são promessas universais para todos os modelos. A Together pode aplicar restrições específicas por modelo, e a documentação serverless atual também descreve limites dinâmicos que reagem à capacidade ao vivo e ao tráfego recente concluído com sucesso.
Essa combinação importa em um lançamento. Uma conta Tier 5 ainda pode receber uma resposta 429 se um modelo popular tiver capacidade mais restrita ou se o tráfego saltar muito além de seu padrão recente. Serverless resolve o provisionamento, não todos os picos. Batch, PTUs ou Dedicated Inference são as rotas de saída, cada uma com um equilíbrio diferente entre custo e latência.
Os custos ocultos estão sobretudo na ociosidade e nas regras de cobrança
Os preços visíveis por token da Together AI são, em geral, claros. As surpresas caras aparecem nas transições entre produtos, nos compromissos, nos recursos ociosos e nas premissas que parecem universais, mas não são.
Aritmética do calendário da PTU: $0.05 por minuto resulta em $2,160 em um mês de 30 dias. A observação de rodapé da calculadora ao vivo usa cerca de 43,800 minutos, chegando a aproximadamente $2,190. A diferença de $30 por PTU vira $3,000 em 100 PTUs. Use a convenção de cobrança do contrato.
Subutilização da PTU: uma PTU pública é calibrada para equivaler ao valor serverless da Together em ocupação total por 30 dias. Com 50% de ocupação, o custo efetivo por token dobra. A capacidade e o SLA ainda podem justificar esse prêmio, mas ele precisa estar visível.
Ociosidade dedicada: Dedicated Inference cobra pelo hardware alocado enquanto ele estiver em execução, mesmo com zero requisições. A hospedagem de modelos com fine-tuning deve entrar na projeção mensal, não apenas no ticket do experimento.
Reservas não reembolsáveis: as reservas de clusters de GPU são cobradas pelo prazo integral, não podem ser pausadas e não admitem reembolso parcial. Um erro de projeção vira gasto comprometido.
Excedente de pico sob demanda: escalar além da capacidade reservada de GPU aciona a tarifa sob demanda, mais alta. Mesmo uma base estável pode gerar surpresa quando a premissa de pico é baixa demais.
Armazenamento persistente: o armazenamento sobrevive ao encerramento do cluster e continua sendo cobrado até a exclusão. Todo desligamento de cluster precisa de uma decisão explícita entre manter e excluir.
Elegibilidade para Batch: o desconto depende do modelo, a janela de 24 horas é de melhor esforço e respostas concluídas continuam sendo cobradas após o cancelamento. Não aplique 50% a todo o orçamento offline sem conferir a lista ao vivo.
Padrões de multimídia: os preços de imagem e vídeo podem se referir à menor resolução, duração ou quantidade padrão de etapas. Configurações com qualidade de produção e novas tentativas alteram o custo por ativo utilizável.
Comportamento da recarga automática: um limite agressivo pode provocar compras imediatas, e as tarifas comuns não são reembolsáveis. Trate a recarga automática como um controle de continuidade em produção, com alertas, não como uma conveniência para configurar e esquecer.
Variação da saída: uma atualização de prompt ou modelo que produza respostas mais longas aumenta o gasto mesmo com volume estável de requisições. Acompanhe separadamente entrada, entrada em cache, saída e resultados aceitos.
Variação dos limites de requisição: os limites serverless podem ser dinâmicos e específicos por modelo. Comprar o Tier 5 por gasto acumulado não reserva a frota subjacente.
Não há um desconto anual self-service padrão para incluir no modelo. Serverless funciona por uso pré-pago, PTUs exigem compromisso mínimo de um mês, reservas de GPU publicam faixas de 7-30, 31-90 e 91-180 dias, e compromissos mais longos vão para a equipe comercial. O risco de fidelização anual fica em um pedido personalizado ou em uma sequência de reservas de infraestrutura, não em um plano anual público de aplicativo.
Alternativas à Together AI: normalize o mesmo modelo antes de escolher
A Together AI não é a opção mais barata para todos os modelos compartilhados. No gpt-oss-120B, seu preço público serverless é exatamente igual ao da Fireworks AI e da Groq: $0.15 por milhão de tokens de entrada e $0.60 por milhão de tokens de saída. Um job com 1 milhão de tokens de entrada e 250,000 tokens de saída custa $0.30 em cada provedor, antes de qualquer vantagem da entrada em cache ou acordo específico da conta.
Essa paridade é útil. Ela elimina o preço por token como critério decisivo e obriga o comprador a comparar preço do cache, limites de requisição, latência, controle sobre o provedor, comportamento do fallback, caminhos de implantação e formato do SLA.
Fireworks AI iguala a tarifa-base e oferece cache mais barato
A Fireworks AI lista o gpt-oss-120B Standard serverless a $0.15 pela entrada, $0.015 pela entrada em cache e $0.60 pela saída por milhão de tokens. O job normalizado sem cache custa os mesmos $0.30 da Together. A Fireworks também anuncia $1 em créditos iniciais.

A Fireworks vence essa comparação específica quando a carga tem um prefixo grande e reutilizável, pois sua tarifa atual de entrada em cache para o gpt-oss é explícita e baixa. A empresa também oferece os níveis serverless Standard, Priority e Fast, criando outra escolha entre latência e preço. A ressalva é que esses níveis extras complicam uma comparação que parecia simples, e o preço de GPU dedicada é um produto diferente da PTU da Together.
Escolha Fireworks quando serverless com modelos abertos e uso intenso de cache for a principal necessidade, e os controles dos níveis de serviço se encaixarem na aplicação. Escolha Together quando o maior valor estratégico estiver no caminho da mesma API para PTUs, inferência de modelo dedicada, fine-tuning, sandboxes ou clusters brutos.
Groq vende velocidade pela mesma tarifa de tokens
A Groq lista o gpt-oss-120B pelas mesmas tarifas de $0.15 para entrada e $0.60 para saída; portanto, o job normalizado também custa $0.30. A página atual do modelo informa cerca de 500 tokens por segundo, limite de 250,000 tokens por minuto no plano Developer e 1,000 requisições por minuto para esse modelo.

A Groq é a opção mais forte desta seleção quando a baixa latência de geração é a promessa do produto. Seu nível empresarial Performance acrescenta throughput provisionado com SLA de disponibilidade de 99.9%, mas não publica o preço. Isso facilita comparar o custo self-service por token e impede normalizar o custo da capacidade reservada sem pedir uma cotação.
Escolha Groq para uma experiência interativa em que o conjunto de modelos compatíveis e a velocidade pesem mais que a stack mais ampla da Together para treinamento e infraestrutura. Descarte-a quando a carga exigir o fine-tuning, o cluster de GPU, o sandbox ou o caminho público de PTU da Together em uma só conta.
OpenRouter pode sair mais barata, com o custo de usar um agregador
A OpenRouter lista atualmente o gpt-oss-120B a $0.03 pela entrada, $0.03 pela entrada em cache e $0.17 pela saída por milhão de tokens. O job normalizado de 1 milhão de tokens de entrada e 250,000 tokens de saída custa $0.0725 antes das tarifas de compra de créditos. Ao distribuir sua tarifa de 5.5% por créditos totalmente utilizados, o valor chega a cerca de $0.0765, embora a tarifa mínima de $0.80 domine recargas pequenas.

A OpenRouter vence o exemplo de preço spot ao rotear entre provedores upstream. Ela também oferece fallback automático e um catálogo de modelos muito mais amplo. Não é o mesmo produto que reservar capacidade na Together ou escolher um único provedor de infraestrutura. A seleção da rota, a política de dados, a latência, a disponibilidade upstream e as mudanças de provedor passam a fazer parte da arquitetura.
Seu nível gratuito é mais acessível que o da Together: a página de preços atual lista mais de 25 modelos grátis e 50 requisições por dia. As contrapartidas incluem limites gratuitos baixos, tarifa de plataforma de 5.5% no pagamento conforme o uso e a possibilidade de créditos não utilizados expirarem depois de um ano. Atualmente, a Together informa que os créditos comprados não expiram.
Escolha OpenRouter quando o acesso a muitos modelos, os fallbacks e o preço spot roteado atual forem as prioridades. Escolha Together quando o controle direto do provedor, um caminho previsível para capacidade reservada, o treinamento de modelos ou a infraestrutura dedicada forem mais importantes que a requisição roteada mais barata.
O resultado normalizado é direto. Para o gpt-oss-120B, Together, Fireworks e Groq empatam no preço de tokens fora do cache. A OpenRouter é mais barata neste recorte, mas muda a relação com o fornecedor. A escolha se inverte conforme a exigência operacional, não por uma afirmação genérica de que uma plataforma é mais barata.
Quem deve escolher a Together AI — e quem deve procurar outra opção
A Together AI é a plataforma certa para uma empresa que espera transformar uma carga imprevisível com modelos abertos em um plano deliberado de capacidade. Ela não é a escolha automática de todo desenvolvedor que busca uma API de baixo custo.
Quem desenvolve sozinho deve começar no serverless e limitar a primeira compra a $5. Direcione uma tarefa delimitada ao DeepSeek V4 Flash, ao gpt-oss-120B ou a outro modelo que atinja o patamar mínimo de qualidade. Evite PTUs e hardware dedicado até que os logs de produção comprovem uma demanda estável. Se a única meta for testar muitos modelos ou conseguir acesso gratuito, a OpenRouter pode ser a primeira conta mais simples.
Um fundador com capital deve usar a Together quando a trajetória de implantação reduzir migrações futuras. Serverless pode validar o produto, PTUs podem reservar um modelo aberto estável por trás da mesma API e Dedicated Inference pode hospedar um modelo com fine-tuning ou personalizado. Essa continuidade vale mais que uma pequena diferença por token quando o roadmap do produto já aponta para capacidade reservada.
O CTO de uma empresa de médio porte deve comprar PTUs por um compromisso de serviço, não por uma fatura alta. Projete a ocupação, compare o SLA de 99% à promessa feita ao cliente e avalie a reserva de capacidade diante de transações perdidas ou escaladas de suporte. Se a aplicação exige disponibilidade de 99.9%, um compromisso de 99% não basta sozinho; desenhe um fallback ou negocie o contrato.
Um operador sênior deve levar o volume offline para Batch antes de reservar capacidade. Jobs de classificação, enriquecimento, avaliação e dados sintéticos podem receber até 50% de desconto nos modelos elegíveis. É um desconto direto em troca de latência. Uma PTU é uma compra de capacidade e deve vir depois.
Uma equipe de pesquisa ou modelos só deve usar Dedicated Inference ou clusters de GPU com um responsável pela utilização. Treinamento, serving personalizado e controle de baixo nível podem justificar a stack. Uma equipe incapaz de monitorar horas de GPU, réplicas ociosas, uso em picos e volumes persistentes está comprando uma infraestrutura que não consegue governar.
Evite a Together AI quando uma destas quatro condições ocorrer. O token roteado mais barato é a única prioridade; o tráfego é errático demais para uma reserva de um mês; o modelo necessário está em outro lugar; ou a empresa precisa de um SLA público mais forte sem negociar com a equipe comercial. Fireworks, Groq, OpenRouter ou o fornecedor direto do modelo podem servir melhor.
- Uma conta reúne serverless, capacidade reservada de tokens, inferência dedicada, fine-tuning, clusters de GPU, computação em sandbox e armazenamento.
- As tarifas serverless atuais são competitivas em vários modelos abertos, com descontos substanciais para entrada em cache nos endpoints compatíveis.
- Atualmente, os créditos pré-pagos comprados não expiram.
- Provisioned Throughput cria um caminho público de $0.05 por minuto de PTU entre a inferência compartilhada e a dedicada.
- Não há teste grátis sem pagamento; o acesso à plataforma exige uma compra de $5.
- O preço público de tabela da PTU só atinge paridade com o serverless da Together em ocupação total, antes de descontos negociados.
- Um SLA de disponibilidade de 99% para PTUs pode ser insuficiente em jornadas críticas do cliente sem fallback.
- Recursos dedicados, GPUs reservadas, armazenamento e implantações com fine-tuning podem continuar gerando cobrança mesmo com volume zero de requisições.
- Preços ao vivo podem entrar em conflito com documentação antiga dos produtos; por isso, compras corporativas precisam de uma fonte datada.
A ação de segunda-feira: meça uma carga antes de reservar qualquer coisa
Na segunda-feira, escolha um workflow de produção delimitado e monte um registro de custos de sete dias. A meta não é testar todos os modelos, mas descobrir se a carga deve ficar em serverless, Batch, PTU ou capacidade dedicada.
Defina um resultado aceito
Escolha uma tarefa com resultado avaliável: uma classificação válida, uma alteração de código aprovada, um rascunho de suporte aceito ou uma extração concluída. O custo por resultado aceito é a métrica do negócio.
Registre o perfil completo de uso
Por sete dias, capture a quantidade de requisições, entrada fora do cache, entrada em cache, saída, novas tentativas, pico de requisições por segundo, respostas 429, latência, tempo de sandbox e resultados aceitos. Separe os picos dos dias úteis das noites e dos fins de semana.
Calcule a linha de base serverless
Aplique as tarifas atuais do modelo à combinação medida de tokens. Mova o trabalho offline elegível para Batch e recalcule. Limite saídas desnecessárias e preserve prefixos estáveis de prompt para que a linha de base inclua economias de cache alcançáveis.
Faça o teste de ocupação da PTU
Use a calculadora atual de PTU com a taxa de pico de requisições, a taxa de acerto do cache e a combinação de tokens. Compare a quantidade necessária de PTUs ao uso médio. Com 80% de ocupação, o preço público de tabela traz um prêmio efetivo de 25% por token; decida se a capacidade reservada e o SLA de 99% justificam esse valor.
Escale apenas por uma exigência explícita
Passe para Dedicated Inference por modelos personalizados, controle single-tenant ou desempenho estável do hardware. Migre para clusters de GPU apenas quando a equipe for responsável pela stack de serving ou treinamento. Coloque o responsável pelo desligamento e pela limpeza do armazenamento ao lado do responsável pelo orçamento.
O resultado da decisão cabe em uma frase compartilhada por financeiro e engenharia: “Esta carga fica no serverless”, “esta frente offline vai para Batch” ou “esta jornada do cliente reserva N PTUs porque a garantia de capacidade vale o prêmio medido pela ociosidade”. Essa é uma ação para segunda-feira, não uma migração de infraestrutura baseada em uma chamada de preço.
FAQ sobre preços da Together AI
Quanto custam 1,000 tokens na Together AI?
Divida a tarifa por milhão do modelo por 1,000 e calcule entrada e saída separadamente. O MiniMax M3 custa $0.0003 por 1,000 tokens de entrada fora do cache e $0.0012 por 1,000 tokens de saída. O Kimi K3 custa $0.003 pela entrada e $0.015 pela saída a cada 1,000 tokens.
Quanto custa a Together AI por mês?
Serverless não tem assinatura mensal fixa; depois da compra de $5 para acesso, o custo mensal acompanha o uso. Uma PTU custa $2,160 em um mês de 30 dias ou cerca de $2,190 pela premissa de mês médio com 43,800 minutos usada na página de preços. Uma H100 Dedicated mantida continuamente em execução custa $3,952.80 por 720 horas, à tarifa atual de $5.49 por hora.
A Together AI é grátis?
Não. Atualmente, a Together AI não oferece teste grátis e exige uma compra mínima de $5 em créditos pré-pagos para acessar a plataforma. O catálogo ao vivo lista o Ternary Bonsai 27B com tarifas de $0 para tokens de entrada e saída, mas a conta ainda exige a compra de $5.
A Together AI oferece créditos grátis?
Não como oferta permanente de cadastro. As promoções anteriores de inscrição terminaram, e o acesso atual exige uma compra de $5. A Together também mantém um programa de créditos de pesquisa apenas por convite para projetos de estudantes fora de disciplinas formais, mas a disponibilidade é restrita.
Quais são os limites do nível gratuito da Together AI?
Não existe um nível gratuito convencional. Um saldo comprado de $5 coloca a conta no Build Tier 1, que atualmente lista 600 requisições de LLM por minuto, 3,000 requisições de embeddings por minuto e limite de rerank de 500,000. Limites específicos por modelo e dinâmicos podem ser menores.
Quais são as melhores alternativas à Together AI?
A Fireworks AI é a alternativa ampla mais próxima para inferência e fine-tuning de modelos abertos; a Groq se destaca em modelos compatíveis de baixa latência; e a OpenRouter é a opção mais forte para roteamento amplo de modelos e fallbacks. No gpt-oss-120B, Together, Fireworks e Groq oferecem atualmente as mesmas tarifas de $0.15 para entrada e $0.60 para saída por milhão de tokens; o preço roteado da OpenRouter é menor neste recorte, mas acrescenta uma tarifa de compra de créditos e uma camada de agregação.
A Together AI oferece desconto para estudantes?
A Together AI não publica um nível permanente de preços para estudantes. Seu programa de créditos de pesquisa apenas por convite oferece pequenos subsídios a estudantes que desenvolvem projetos fora de disciplinas formais e pede que os beneficiários mencionem a Together AI no trabalho.
Qual é a política de reembolso da Together AI?
Os termos da Together dizem que, por padrão, as tarifas não são reembolsáveis, e que as obrigações de pagamento não podem ser canceladas nem rateadas, salvo disposição contrária em um pedido. Reservas de GPU não são reembolsáveis. Ao cancelar um job de fine-tuning, as etapas concluídas são cobradas e apenas a parte não executada é reembolsada.
Os créditos da Together AI expiram?
Atualmente, os créditos pré-pagos comprados não expiram. Isso não é o mesmo que reembolso: os créditos podem continuar válidos sem serem reembolsáveis, e créditos comprados depois da emissão de uma fatura não quitam um saldo vencido anterior.
Os preços da Together AI mudaram em 2026?
Sim. A Together AI lançou Provisioned Throughput em 8 de julho de 2026, acrescentando capacidade reservada de tokens a $0.05 por minuto de PTU, compromisso mínimo de um mês e SLA de disponibilidade de 99%. O catálogo serverless atual e as tarifas de hardware dedicado também mudaram desde junho; por isso, esta página traz a data de verificação de 22 de agosto.
Provisioned Throughput é mais barato que o serverless da Together?
Não automaticamente. Pelas tarifas públicas de tabela, uma PTU totalmente ocupada corresponde quase exatamente ao mesmo valor de 30 dias de sua capacidade serverless na Together. A subutilização eleva o preço efetivo por token. PTUs compram capacidade reservada e um SLA; um desconto negociado por compromisso pode melhorar a tarifa, mas a Together não publica essa tabela.
Receba o Mapa de Ferramentas de IA para Donos de Negócios
O Mapa de Ferramentas de IA para Donos de Negócios transforma preços de modelos em uma stack prática de adoção, com o patamar de qualidade, o papel no roteamento e o gatilho de custo de cada ferramenta. Assine para receber grátis a próxima edição.
2 de set. de 2026







