Together AI pricing en 2026: precios de PTU, GPU y tokens

Together AI pricing al detalle: comparativa de serverless, PTU, GPU, fine-tuning y gastos ocultos para decidir cuándo pagar por capacidad reservada.

Wednesday, September 2, 2026Omid Saffari
Together AI pricing en 2026: precios de PTU, GPU y tokens

En esta guía de Together AI pricing, la opción más económica es serverless. Su nueva tarifa de $0.05 por PTU-minuto no rebaja el precio de lista frente a sus propias tarifas por token. Reservar un PTU de forma continua cuesta $2,160 en un mes de 30 días: se paga por capacidad garantizada y un SLA de disponibilidad del 99%, no por tokens ociosos más baratos.

Together AI pricing: precios en resumen

La forma más sensata de contratar Together AI es avanzar por etapas: comenzar con consumo serverless prepagado, trasladar a Provisioned Throughput el tráfico estable que exige fiabilidad y reservar hardware dedicado solo cuando la carga necesita control de inquilino único o modelos personalizados. El error costoso es interpretar esas etapas como descuentos por volumen. Cada una mide algo distinto y traslada riesgos operativos diferentes.

Página de precios en vivo de Together AI con serverless, Provisioned Throughput, inferencia dedicada, clústeres GPU, sandbox, almacenamiento y fine-tuning
Precios de Together AI, verificados el 22 de agosto de 2026

Together AI no ofrece una escalera sencilla de planes Free, Pro y Business. Vende tokens y resultados multimedia serverless, capacidad de tokens reservada, GPU dedicadas administradas, clústeres GPU sin esa capa de gestión, cómputo en sandbox, almacenamiento y fine-tuning. Un solo producto puede activar varios medidores. Un agente puede generar cargos por tokens del modelo, CPU y memoria del sandbox y un endpoint con fine-tuning que continúa facturando entre solicitudes.

ProductoPrecio de lista actualCompromisoCaso de uso ideal
Inferencia serverlessModelos de texto desde $0 hasta $15/M de tokens; los medios se cobran por imagen, video, minuto o carácterCompra prepagada de acceso de $5; después, pago por usoPrototipos, tráfico variable, evaluación de modelos
Provisioned Throughput$0.05/PTU-minuto, o $2,160 por PTU en un mes de 30 díasMínimo de un mesTráfico estable de producción que necesita capacidad reservada y un SLA de disponibilidad del 99%
Dedicated InferenceH100 a $5.49/GPU-hora; B200 a $8.99/GPU-horaSe factura mientras está en ejecución; plazos reservados mediante cotizaciónModelos personalizados o con fine-tuning, latencia predecible y control de inquilino único
Clústeres GPUH100 a $3.99/GPU-hora bajo demanda o $3.19 con 91-180 días; H200 y B200 cuestan másBajo demanda o reservas publicadas de 7-180 díasEquipos que operan su propia plataforma de entrenamiento o inferencia
Sandbox y almacenamiento$0.0446/vCPU-hora, $0.0149/GiB de RAM-hora y $0.16/GiB-mes de almacenamientoPago por usoEjecución de código de agentes y datos persistentes
Fine-tuningEstándar: $0.48-$8/M de tokens procesados; especializado: $3-$100/M, más mínimos por trabajoPor trabajo; el alojamiento se cobra aparteComportamiento personalizado cuyo coste de entrenamiento y despliegue se justifica

Todos los precios y límites de esta página se verificaron en la página de precios en vivo de Together AI, su documentación de facturación y la documentación de sus productos el 22 de agosto de 2026. La fecha importa. La página actual ya difiere de forma sustancial de la cobertura de precios de junio: incluye MiniMax M3, Kimi K3 y GLM-5.2, tarifas activas más bajas para hardware dedicado y la nueva capa Provisioned Throughput.

La primera regla de decisión es sencilla. Conviene usar serverless cuando la demanda es incierta o llega por ráfagas. Un PTU tiene sentido cuando un modelo bien delimitado mantiene una carga base estable y la capacidad reservada aporta valor al negocio. Dedicated Inference es la opción adecuada cuando se necesita un modelo personalizado, hardware de inquilino único o control sobre la configuración. Un clúster GPU solo encaja si la empresa quiere operar el cómputo subyacente en vez de comprar un resultado de inferencia administrado.

Flujo de decisión que dirige las cargas irregulares a serverless, las cargas estables con SLA a PTU y los modelos personalizados a inferencia dedicada
El medidor se elige según el perfil de la carga, no solo por la factura mensual

Esa diferencia hace que Together AI resulte atractivo para una startup con financiación que busca una única ruta de API desde el experimento hasta la infraestructura reservada. Es menos conveniente para quien desarrolla en solitario y persigue la tarifa puntual más baja por token, o para un equipo incapaz de prever siquiera un mes de demanda. La flexibilidad pertenece al producto serverless. El compromiso se compra aparte.

La inferencia serverless es el punto de partida y el modelo domina la factura

Serverless es el inicio adecuado porque no exige coste de aprovisionamiento ni consumo mínimo, más allá de la compra de $5 para acceder a la plataforma. Las solicitudes se envían a una flota compartida y se paga por el trabajo completado. El modelo, la dirección de los tokens, la tarifa de caché y la longitud de la salida pesan mucho más en la factura que el nombre Together AI.

El catálogo actual de chat cubre un rango muy amplio. LFM2.5-8B-A1B cuesta $0.03 por millón de tokens de entrada y $0.12 por millón de tokens de salida. DeepSeek V4 Flash 0731 cuesta $0.14 de entrada, $0.03 de entrada en caché y $0.28 de salida. gpt-oss-120B cuesta $0.15 de entrada y $0.60 de salida. En el extremo superior de la lista de texto mostrada, Kimi K3 cuesta $3 de entrada, $0.30 de entrada en caché y $15 de salida por millón de tokens.

La tarifa de DeepSeek alojado por Together es un medidor específico de este proveedor. El análisis independiente de los precios de DeepSeek explica la economía directa del modelo; para calcular una factura de Together, hay que usar su página en vivo.

Entre la salida de LFM a $0.12 y la de Kimi K3 a $15 existe una diferencia de 125x. Optimizar el proveedor sin atender al enrutamiento de modelos equivale a negociar un pequeño descuento de transporte mientras todos los paquetes se envían por avión. El primer control de costes consiste en asignar a cada tarea el modelo más barato que supere el umbral de calidad.

Una carga típica de agentes permite verlo con claridad. Supongamos 1,000 llamadas, cada una con 8,000 tokens de entrada y 1,000 tokens de salida. En total son 8 millones de tokens de entrada y 1 millón de salida:

  • DeepSeek V4 Flash 0731 cuesta $1.40 en total, o $0.0014 por llamada.
  • gpt-oss-120B cuesta $1.80 en total, o $0.0018 por llamada.
  • MiniMax M3 cuesta $3.60 en total, o $0.0036 por llamada.
  • GLM-5.2 cuesta $15.60 en total, o $0.0156 por llamada.
  • Kimi K3 cuesta $39 en total, o $0.039 por llamada.

La mayor diferencia no proviene del margen del proveedor, sino del modelo elegido y de cuánto texto costoso produce. Un clasificador de atención al cliente que devuelve una sola etiqueta no necesita el mismo presupuesto de salida que un agente de investigación que redacta una respuesta extensa. Antes de buscar un endpoint más barato, hay que imponer un límite estricto de salida a las tareas acotadas.

Por eso una comparativa general de las API de IA más baratas solo es útil después de normalizar el trabajo. Comparar proveedores con distinta longitud de prompt, respuesta, supuestos de caché o modelos genera una cifra ordenada, pero inútil para decidir un presupuesto.

La entrada en caché puede abaratar el prefijo repetido

La entrada en caché es el descuento de autoservicio más potente cuando los prompts se repiten. Together reconoce un prefijo sin cambios —por ejemplo, una instrucción de sistema extensa o un contexto de referencia estable— y, en los modelos compatibles, factura esos tokens a una tarifa menor.

Para la misma carga de 1,000 llamadas, supongamos que el 80% de los 8 millones de tokens de entrada cumple los requisitos de la tarifa en caché. MiniMax M3 baja de $3.60 a $2.064. GLM-5.2 pasa de $15.60 a $8.304. Kimi K3 cae de $39 a $21.72. Las reducciones son del 42.7%, 46.8% y 44.3%, respectivamente.

La consecuencia operativa importa más que el porcentaje de descuento. Un operador sénior debe separar el prefijo estable del contexto específico de cada solicitud, registrar por separado los tokens con y sin caché y vigilar los cambios de prompt que invalidan la caché. Una reescritura del prompt puede elevar el gasto sin aumentar el tráfico; parecerá un problema de precios hasta que los datos de caché lo expliquen.

Batch solo cuesta menos cuando el modelo y el flujo son compatibles

La Batch API de Together AI aplica a determinados modelos serverless un descuento de hasta el 50% a cambio de completar el trabajo de forma asíncrona. Es el medidor apropiado para clasificación sin conexión, datos sintéticos, evaluaciones y resúmenes masivos. No sirve para un chat en vivo, un asistente de compra o una atención al cliente que espera la siguiente respuesta.

El contrato actual de Batch admite hasta 50,000 solicitudes en un archivo de entrada de 100 MB y hasta 30 mil millones de tokens en cola por modelo. La ventana de finalización está fijada en 24 horas y es un objetivo sujeto al mejor esfuerzo. Together recomienda lotes de 1,000 a 10,000 solicitudes. Las respuestas correctas se facturan y las solicitudes fallidas no; cancelar un lote tampoco elimina el coste de las respuestas ya completadas.

El 50% anunciado no es universal. Solo algunos modelos serverless reciben la tarifa reducida y otros ni siquiera pueden ejecutarse mediante Batch. Los endpoints dedicados aceptan trabajos por lotes, pero allí no se aplica el descuento. Conviene revisar la lista activa de modelos para Batch antes de elaborar una previsión.

Como ejemplo actual con descuento, 8 millones de tokens de entrada más 1 millón de salida en Llama 3.3 70B cuestan $9.36 con sus tarifas de $1.04 tanto para entrada como para salida. Un lote que cumple las condiciones y obtiene un 50% de descuento cuesta $4.68. El ahorro existe porque el trabajo admite una entrega diferida, no porque todas las solicitudes serverless se hayan abaratado.

Imágenes, video, audio y almacenamiento se cobran con unidades distintas

Serverless no se limita al texto. El catálogo de imágenes en vivo va de $0.0017 a $0.134 por imagen o megapíxel entre los modelos mostrados. La lista de video oscila entre $0.115 y $3.20 por video generado. La conversión de voz a texto cuesta entre $0.0015 y $0.0045 por minuto de audio, mientras que el texto a voz va de $4 a $65 por millón de caracteres. Los embeddings multilingual e5 large instruct cuestan $0.02 por millón de tokens y la moderación con Llama Guard 4 12B cuesta $0.20 por millón de tokens.

Esos rangos no son intercambiables. Together advierte que los precios mostrados para imagen y video corresponden a la resolución o duración mínima indicada, y que superar los pasos de generación predeterminados puede añadir costes. Para presupuestar 100,000 videos breves, un product manager necesita el modelo, la duración, la resolución, la configuración de audio y la tasa de reintentos exactos. Multiplicar la tarifa de la miniatura más barata por el volumen de producción subestimará la partida.

Serverless sigue siendo la mejor opción predeterminada para la mayoría de las cargas nuevas. Su límite no es la tarifa por token, sino la capacidad compartida, los límites dinámicos y la ausencia de un compromiso público de disponibilidad equivalente al producto Provisioned. Cuando eso se convierte en un riesgo de cara al cliente, la siguiente decisión gira en torno a la capacidad, no a una mejora genérica de plan.

Provisioned Throughput convierte la capacidad en un compromiso mensual

Provisioned Throughput solo merece la pena cuando reservar capacidad de tokens resuelve un problema de negocio. Together AI lo lanzó el 8 de julio de 2026 como capa intermedia entre serverless de mejor esfuerzo y Dedicated Inference totalmente configurable. Incluye un SLA de disponibilidad del 99%, un mínimo de un mes y un precio público de lista de $0.05 por Provisioned Throughput Unit, o PTU, por minuto.

Un PTU no es un paquete de tokens. Es una tasa reservada de tokens por minuto para un modelo compatible, apartada para el cliente. La entrada, la entrada en caché y la salida consumen esa capacidad a ritmos distintos. La página activa presenta tres esquemas públicos:

MiniMax M3 entrega 166,667 tokens de entrada, 833,333 tokens de entrada en caché o 41,667 tokens de salida por minuto y PTU. Kimi K3 entrega 16,667 de entrada, 166,667 de entrada en caché o 3,333 de salida. GLM-5.2 entrega 35,714 de entrada, 192,308 de entrada en caché o 11,364 de salida. Una solicitud mixta consume una combinación de esas capacidades.

A $0.05 por minuto, un PTU cuesta $3 por hora, $72 por día y $2,160 durante un mes de 30 días. La nota al pie de la calculadora de Together usa cerca de 43,800 minutos para un aprovisionamiento continuo en un mes promedio, lo que arroja unos $2,190. Finanzas debe usar el contrato y el mes calendario exactos en lugar de suponer que todos los meses equivalen a $2,160.

La prueba de ocupación del PTU

El cálculo revelador consiste en valorar un PTU con el propio medidor serverless de Together. Dedicado a entrada durante 30 días, un PTU de MiniMax M3 puede entregar unos 7.2 mil millones de tokens de entrada. Con la tarifa serverless de $0.30 por millón, esa capacidad vale cerca de $2,160. Dedicado a salida, puede entregar unos 1.8 mil millones de tokens. A $1.20 por millón, el valor vuelve a ser de unos $2,160. La ruta de entrada en caché llega al mismo resultado, dentro del margen de redondeo.

Kimi K3 y GLM-5.2 están calibrados de igual manera. La capacidad pública del PTU alcanza la paridad con el precio público serverless prácticamente a plena ocupación durante un mes de 30 días. La calculadora publicada puede mostrar grandes ahorros frente a un modelo comercial seleccionado, pero indica expresamente que compara el gasto en PTU con el precio de lista de ese modelo externo. No demuestra un descuento general frente a las propias tarifas serverless de Together.

Esta es la prueba de ocupación del PTU: el valor de la capacidad solo iguala el valor serverless cuando se utiliza por completo la unidad reservada. Con una utilización del 50%, las tarifas efectivas de MiniMax M3 se duplican: $0.60 por millón de tokens de entrada, $0.12 por millón de tokens de entrada en caché o $2.40 por millón de tokens de salida. Al 25%, se cuadruplican hasta $1.20, $0.24 y $4.80. Al 70%, la tarifa efectiva equivale a cerca de 1.43x la serverless: aproximadamente $0.43 de entrada y $1.71 de salida.

Indicador de ocupación de un PTU de MiniMax M3 con el precio efectivo de salida al 25, 50 y 100 por ciento de utilización
Un PTU de $2,160 solo alcanza la paridad con el precio serverless de Together cuando permanece ocupado todo el mes de 30 días

Eso no convierte al PTU en un mal producto; aclara qué se está comprando. Un CTO de una empresa mediana que opera un agente de cara al cliente puede aceptar racionalmente un 20% de capacidad ociosa si la vía reservada reduce el riesgo de limitación y el SLA de disponibilidad del 99% tiene valor contractual. Una startup con demanda solo entre semana no debería pagar noches y fines de semana, salvo que la capacidad garantizada proteja ingresos suficientes para cubrir la prima.

La página pública afirma que los compromisos mayores pueden obtener descuentos, pero no publica la escala. Un descuento negociado reduce el punto de equilibrio por debajo del 100% de ocupación. Hasta que ventas lo incluya en una orden de compra, conviene modelar el precio público de lista y tratar cualquier descuento como una ventaja adicional.

Un SLA del 99% aún exige una lectura de negocio

Un objetivo mensual de disponibilidad del 99% permite aproximadamente 7 horas y 18 minutos de inactividad en un mes de 30.4 días. Supera al acceso de mejor esfuerzo, pero el nivel empresarial Performance de Groq publica un 99.9%; por tanto, el 99% no es el compromiso más sólido de esta selección. La empresa debe comparar la compensación escrita, las exclusiones por mantenimiento, el diseño regional y la ruta de respaldo, no limitarse a ver tres caracteres y un signo de porcentaje.

Provisioned Throughput se justifica mejor cuando la aplicación mantiene una carga base estable, usa un modelo predecible y asume una promesa al cliente que la limitación de la flota compartida podría romper. Tiene menos sentido si el tráfico varía 10x, el modelo cambia cada semana o el trabajo sin conexión puede pasar a Batch. En esos casos, la reserva transforma la incertidumbre en tiempo ocioso pagado.

La decisión cambia la conversación presupuestaria del lunes

Antes del 8 de julio, un equipo que elegía Together afrontaba un gran salto desde el servicio serverless compartido y cobrado por token hasta una infraestructura GPU dedicada. Los PTU añaden una partida intermedia: rendimiento reservado del modelo sin asumir el dimensionamiento de GPU ni una plataforma propia de servicio. Así, finanzas puede aprobar una dotación mensual fija de capacidad mientras ingeniería conserva la misma API de inferencia.

Esto introduce una nueva métrica operativa. Ya no basta con medir el gasto en tokens. La persona responsable necesita conocer las solicitudes máximas por segundo, la mezcla de tokens de entrada y salida, la tasa de aciertos de caché, la ocupación de la capacidad, las solicitudes limitadas y los resultados aceptados. Si el panel no muestra esas seis medidas, la empresa no puede saber si el PTU aporta protección o desperdicio.

Un PTU de MiniMax M3 cubre unas 600,000 llamadas completas de agente

Un PTU puede atender unas 600,000 llamadas de MiniMax M3 en un mes de 30 días cuando cada llamada consume 8,000 tokens de entrada sin caché y genera 1,000 tokens de salida. Es la misma carga práctica calculada antes a $0.0036 por llamada serverless, de modo que 600,000 llamadas serverless cuestan $2,160. A plena ocupación, los medidores de capacidad y de tokens coinciden por diseño.

El cálculo de capacidad incluye ambos lados de la solicitud. Ocho mil tokens de entrada consumen cerca de 0.048 PTU-minutos con el esquema de MiniMax M3 de 166,667 tokens de entrada por minuto. Mil tokens de salida añaden otros 0.024 PTU-minutos a 41,667 tokens de salida por minuto. La solicitud completa consume, por tanto, unos 0.072 PTU-minutos. Al dividir los 43,200 PTU-minutos del mes entre esa carga por solicitud, el resultado ronda las 600,000 llamadas.

Así se obtiene un presupuesto operativo listo para decidir:

Al 80% de ocupación, el PTU admite unas 480,000 llamadas. La factura serverless equivalente es de $1,728, lo que deja una prima mensual de reserva de $432. El PTU cuesta un 25% más que el trabajo serverless consumido. Un producto orientado al cliente puede aceptar esa prima si la capacidad reservada y el SLA del 99% protegen más de $432 en ingresos, tiempo de soporte o coste reputacional.

Al 70% de ocupación, admite unas 420,000 llamadas. Serverless cuesta $1,512, así que la prima de capacidad es de $648. Al 50%, cubre 300,000 llamadas y serverless cuesta $1,080: la mitad de la factura del PTU queda como capacidad ociosa pagada.

La caché modifica el número de llamadas que caben en la unidad. Si el 80% de la entrada está en caché, cada solicitud usa cerca de 0.04128 PTU-minutos en vez de 0.072. A plena ocupación, un PTU puede llevar entonces aproximadamente 1.0465 millones de esas mismas llamadas. A la vez, el precio serverless baja de $0.0036 a $0.002064 por llamada, por lo que el coste a plena carga sigue convergiendo cerca de $2,160.

La caché aporta al negocio tanto rendimiento como menor coste unitario. Un prefijo de sistema largo y estable permite atender más trabajo de clientes con la misma capacidad reservada. Un cambio de prompt que destruya la reutilización de caché reduce el margen del PTU y eleva al mismo tiempo el gasto serverless.

Llevemos ahora la decisión a una partida presupuestaria. Diez PTU cuestan $21,600 por un mes de 30 días y, a plena ocupación, transportan alrededor de 6 millones de las llamadas sin caché del ejemplo. Al 70%, cubren 4.2 millones de llamadas. La factura serverless equivalente es de $15,120, lo que deja una prima mensual de $6,480 por la capacidad reservada y el SLA.

Esos $6,480 son la cifra que un CTO debe defender. Si la limitación de la flota compartida amenaza más de $6,480 de margen bruto, carga de soporte o penalizaciones contractuales, la reserva puede justificar su lugar. De lo contrario, serverless conserva esos mismos $6,480 para trabajar en el producto. El argumento genérico «gastamos $15,000 en tokens» nunca permite tomar esta decisión.

Dedicated Inference no ofrece un punto de equilibrio público por token igual de claro, porque el rendimiento de salida depende del modelo, la cuantización, la forma del lote, el número de dispositivos y la configuración. Cualquier artículo que divida el precio mensual de una GPU entre una tarifa genérica de tokens y proclame un cruce universal estará ocultando la variable que decide el resultado. Hay que medir el modelo candidato en el endpoint previsto y comparar el coste por resultado aceptado con la utilización observada.

Dedicated Inference y los clústeres GPU resuelven problemas distintos

Dedicated Inference es el paso correcto cuando el control importa más que la flexibilidad de autoservicio. Together asigna hardware de inquilino único, admite modelos personalizados y ofrece escalado automático y gestión de picos de tráfico. El precio en vivo es de $5.49 por GPU-hora para una NVIDIA HGX H100 y de $8.99 para una HGX B200. Los precios de H200, B300, GB200 NVL72 y GB300 NVL72 requieren contactar con ventas.

Con uso continuo durante 30 días, una H100 cuesta $3,952.80 y una B200, $6,472.80. Son importes por GPU, antes de cualquier requisito de varias GPU. El endpoint se factura mientras está en ejecución, sin importar el volumen de solicitudes; por tanto, un despliegue ocioso sigue siendo una partida activa.

No conviene usar documentación antigua de endpoints dedicados para proyectar la factura de hardware. En este momento, la documentación muestra cifras de H100, H200 y B200 que contradicen la página de precios en vivo. La página actual es la fuente más reciente y la verificada aquí. Por eso todo precio de infraestructura debe incluir una fecha.

Dedicated Inference justifica su coste cuando un modelo cargado o con fine-tuning no puede ejecutarse en serverless compartido, cuando la latencia p99 exige hardware estable, cuando el servicio del modelo necesita ajustes personalizados o cuando una utilización alta y constante hace que una GPU reservada resulte económicamente superior. Pierde sentido si el endpoint pasa gran parte del día esperando.

Los clústeres GPU son más básicos y pueden parecer baratos por el motivo equivocado

Los clústeres GPU entregan una parte mayor de la plataforma al comprador. Las tarifas actuales bajo demanda son de $3.99 por GPU-hora para H100, $5.99 para H200 y $8.19 para B200. El equivalente de una H100 durante 30 días es de $2,872.80, pero no constituye un sustituto más barato de la H100 dedicada de $3,952.80. Quien compra el clúster asume más trabajo de despliegue, servicio, orquestación, observabilidad y utilización.

Las tarifas de clúster reservado disminuyen al ampliar el compromiso. H100 baja a $3.69 para 7-30 días, $3.45 para 31-90 días y $3.19 para 91-180 días. H200 desciende de $4.99 a $4.15 y después a $3.99 en esos mismos tramos. B200 pasa de $7.99 a $7.79 y luego a $6.79. Los plazos de 181 días o más requieren una cotización.

El descuento tiene condiciones estrictas. La documentación de facturación de GPU de Together señala que la reserva completa se cobra por adelantado o se descuenta una vez aprovisionada. Las reservas no son reembolsables, no admiten reembolsos parciales y no se pueden pausar. Si el clúster supera la capacidad reservada al escalar, el excedente se factura con tarifas bajo demanda.

Para una reserva H100 de 91-180 días, el mes normalizado de 720 horas cuesta $2,296.80 por GPU. Son $576 menos que el equivalente bajo demanda. El ahorro solo vale si la GPU mantiene una ocupación útil. Una reserva de cuatro GPU con la mitad de su capacidad ociosa no se vuelve rentable porque la línea horaria sea menor.

El almacenamiento también tiene su propio ciclo de vida. El almacenamiento compartido cuesta $0.16 por GiB-mes, por lo que 1 TiB equivale a unos $163.84 al mes. El volumen persiste y sigue facturándose después de terminar el clúster, hasta que alguien lo elimina. Esto permite recrear el cómputo alrededor de datos duraderos, pero también convierte los volúmenes abandonados en gasto silencioso.

El fine-tuning puede costar poco al entrenar y mucho al mantenerse activo

El fine-tuning tiene dos costes separados: el trabajo de entrenamiento y el despliegue posterior del modelo. La partida de entrenamiento puede parecer mínima. Alojar el resultado puede convertirse en el principal gasto mensual.

Together calcula el entrenamiento estándar multiplicando los tokens del conjunto de datos por las épocas, más los tokens opcionales de evaluación multiplicados por las ejecuciones de evaluación. En modelos de hasta 16B parámetros, el fine-tuning supervisado cuesta $0.48 por millón de tokens procesados con LoRA y $0.54 con fine-tuning completo. Direct Preference Optimization, o DPO, cuesta $1.20 con LoRA y $1.35 con ajuste completo.

Para modelos de 17B-69B, las cuatro tarifas son $1.50, $1.65, $3.75 y $4.12. Para modelos de 70B-100B, son $2.90, $3.20, $7.25 y $8. El cargo mínimo estándar por trabajo es de $4.

Los modelos más grandes y los modelos designados tienen precios especializados. DeepSeek V4 Flash LoRA cuesta $6 por millón de tokens procesados para fine-tuning supervisado y $15 para DPO, con un mínimo de $12. gpt-oss-120B cuesta $5 y $12.50, con un mínimo de $6. Kimi K2.6 o K2.7-Code cuesta $15 y $37.50, con un mínimo de $60. GLM-5.2 cuesta $40 y $100, con un mínimo de $60.

Esa variación por modelo cambia un experimento que parece sencillo. Un conjunto de datos de 20 millones de tokens ejecutado durante tres épocas procesa 60 millones de tokens. En un trabajo estándar LoRA de hasta 16B, el entrenamiento supervisado cuesta $28.80. Con LoRA especializado de GLM-5.2, el mismo volumen de tokens procesados cuesta $2,400. El tamaño del conjunto de datos no cambió; sí lo hizo el precio del modelo base.

El trabajo de entrenamiento sigue sin ser el coste de todo el ciclo de vida. Un modelo con fine-tuning necesita capacidad de despliegue y saldo prepagado suficiente. Una sola H100 dedicada actual, activa durante 30 días, cuesta $3,952.80. Un equipo puede gastar $28.80 en crear un adaptador pequeño y luego pagar cada mes más de 137x esa suma para mantener una H100 activa.

Aquí suele romperse el presupuesto de un prototipo. El equipo de ciencia de datos informa del trabajo de entrenamiento; más tarde, finanzas descubre la factura de servicio. El experimento debe aprobarse con un plan de despliegue adjunto: horas previstas en línea, número de GPU, mínimo de escalado automático, volumen de solicitudes y responsable del apagado.

La devolución al cancelar un entrenamiento es más limitada de lo que muchos compradores esperan. Together cobra los pasos completados y solo devuelve el trabajo pendiente. En los términos, las tarifas estándar de la plataforma tampoco son reembolsables por defecto. Un trabajo de entrenamiento debe tratarse como cómputo consumido, no como una suscripción de software reversible.

Sandbox y Code Interpreter son medidores separados para agentes

Code Sandbox cuesta $0.0446 por vCPU-hora más $0.0149 por GiB de RAM y hora. Un sandbox que ejecuta 2 vCPU y 8 GiB durante 160 horas cuesta cerca de $33.34. Code Interpreter usa otro medidor: $0.03 por sesión de 60 minutos.

En un producto de agentes, esos cargos se suman a la inferencia del modelo. Si 10,000 ejecuciones mensuales abren cada una una sesión de intérprete de una hora, solo esa partida cuesta $300 antes de los tokens. Si las sesiones pueden reutilizarse de forma segura, la arquitectura modifica el coste por trabajo completado. Si permanecen abiertas al terminar, la ejecución ociosa se convierte en el equivalente a menor escala de una GPU ociosa.

La unidad correcta es, por tanto, el coste por resultado aceptado, no el coste por millón de tokens. La llamada de MiniMax M3 del ejemplo cuesta $0.0036; al añadir una sesión de Code Interpreter de $0.03, la ruta cuesta al menos $0.0336 antes de reintentos u otras llamadas a herramientas. Hay que instrumentar la ruta completa.

Together AI no es gratis, aunque un modelo muestre tokens a $0

Together AI no ofrece actualmente una prueba gratuita y exige una compra mínima de $5 en crédito prepagado antes de acceder a la plataforma. La respuesta sobre el plan gratuito es inequívoca: no existe una cuenta sin pago para usar la API.

El catálogo en vivo sí incluye Ternary Bonsai 27B a $0 por millón de tokens de entrada y $0 por millón de tokens de salida. Mientras esa ficha siga disponible, la inferencia puede costar $0, pero la cuenta aún necesita la compra de acceso de $5. Los $5 no se describen como una suscripción mensual. Los créditos prepagados comprados no caducan en la actualidad.

¿Quién puede evitar pagos adicionales después de los primeros $5? Una persona que usa la plataforma por afición o evaluación, trabaja solo con el modelo gratuito actual, respeta los límites y nunca activa un servicio de pago podría conservar intacto el saldo comprado. Es un caso muy específico, no un nivel gratuito de producción. La disponibilidad, la capacidad y el precio del modelo pueden cambiar; ningún producto debería prometer a sus clientes que un endpoint promocional o gratuito será su backend permanente.

Los créditos gratuitos ofrecidos anteriormente al registrarse ya terminaron. La política de soporte actual de Together indica que cada usuario debe comprar al menos $5 y vincular un método de pago. En el acceso prepagado ordinario no existe saldo negativo: cuando el crédito comprado llega a cero, el acceso a la API se suspende hasta añadir más saldo. Los clientes con contrato se rigen por su orden de compra.

Los créditos no caducan, pero tampoco son una cuenta de ahorro reembolsable

Los créditos comprados no tienen actualmente fecha de vencimiento. Es una condición más favorable que una caducidad anual, pero no vuelve inocuo el exceso de saldo. Los términos de Together establecen que las tarifas pagadas no son reembolsables por defecto, que las obligaciones de pago no se pueden cancelar y que los meses parciales no se prorratean, salvo que una orden de compra disponga otra cosa.

La recarga automática exige una configuración cuidadosa. La documentación de facturación señala un importe predeterminado de $25 y advierte que fijar un umbral por encima del saldo actual puede provocar compras inmediatas y repetidas hasta cubrir la diferencia. El umbral debe responder al consumo previsto, cada compra debe generar una alerta y el proyecto necesita un presupuesto independiente del saldo de crédito.

Los Build Tiers amplían los límites según el gasto acumulado

Los cinco Build Tiers de Together son bandas de límites basadas en el gasto histórico total, no planes mensuales con distintas funciones. Tier 1 comienza en $5 y permite 600 solicitudes LLM por minuto. Tier 2 comienza en $50 y permite 1,800. Tier 3 comienza en $100 y permite 3,000. Tier 4 comienza en $250 y permite 4,500. Tier 5 comienza en $1,000 y permite 6,000.

Los límites de embeddings aumentan desde 3,000 RPM en Tier 1 hasta 10,000 en Tier 4 y Tier 5. La asignación para rerank sube de 500,000 a 5,000,000 entre los cinco niveles. Estas cifras no son promesas universales para todos los modelos. Together puede imponer restricciones específicas por modelo, y su documentación serverless actual también describe límites dinámicos que responden a la capacidad en vivo y al tráfico correcto reciente.

La combinación importa durante un lanzamiento. Incluso una cuenta Tier 5 puede recibir una respuesta 429 si un modelo popular tiene menos capacidad o el tráfico crece muy por encima de su patrón reciente. Serverless resuelve el aprovisionamiento, no todos los picos. Las salidas son Batch, PTU o Dedicated Inference, cada una con un equilibrio distinto entre coste y latencia.

Los costes ocultos son, sobre todo, medidores ociosos y condiciones límite

Los precios visibles por token de Together AI suelen ser claros. Las sorpresas caras aparecen entre productos: en los compromisos, los recursos ociosos y los supuestos que parecen universales sin serlo.

Cálculo del calendario del PTU: $0.05 por minuto da $2,160 en un mes de 30 días. La nota de la calculadora en vivo usa cerca de 43,800 minutos y produce unos $2,190. Esa diferencia de $30 por PTU se convierte en $3,000 al contratar 100 PTU. Hay que aplicar la convención de facturación del contrato.

Infrautilización del PTU: un PTU público está calibrado para igualar el valor serverless de Together cuando permanece ocupado todo el mes de 30 días. Al 50% de ocupación, el coste efectivo por token se duplica. La capacidad y el SLA aún pueden justificar esa prima, pero debe quedar visible.

Tiempo ocioso en Dedicated: Dedicated Inference factura el hardware asignado mientras se ejecuta, incluso con cero solicitudes. El alojamiento de un modelo con fine-tuning debe incluirse en la previsión mensual, no solo en el presupuesto del experimento.

Reservas no reembolsables: las reservas de clústeres GPU se cobran durante todo el plazo, no se pueden pausar y no admiten reembolsos parciales. Un error de previsión se convierte en gasto comprometido.

Excedente de picos bajo demanda: si el escalado supera la capacidad GPU reservada, el exceso se factura a la tarifa bajo demanda, más alta. Incluso una base estable puede sorprender si se subestiman los picos.

Almacenamiento persistente: el almacenamiento sobrevive al cierre del clúster y continúa facturándose hasta que se elimina. Cada desmantelamiento necesita una decisión explícita: conservar o borrar.

Compatibilidad con Batch: el descuento depende del modelo, la ventana de 24 horas es de mejor esfuerzo y las respuestas completadas siguen siendo facturables después de cancelar. No debe aplicarse un 50% a todo el presupuesto de trabajo sin conexión sin revisar la lista activa.

Valores predeterminados multimedia: los precios de imagen y video pueden corresponder a la resolución, duración o número de pasos predeterminado más bajo. La calidad de producción y los reintentos elevan el coste por recurso utilizable.

Comportamiento de la recarga automática: un umbral agresivo puede provocar compras inmediatas y las tarifas ordinarias no son reembolsables. La recarga automática debe gestionarse como un control de continuidad de producción con alertas, no como una opción que se configura y se olvida.

Variación de la salida: un cambio de prompt o modelo que alargue las respuestas aumenta el gasto, aunque el volumen de solicitudes permanezca estable. Conviene medir por separado la entrada, la entrada en caché, la salida y los resultados aceptados.

Variación de los límites: los límites serverless pueden ser dinámicos y específicos del modelo. Alcanzar Tier 5 mediante gasto acumulado no reserva la flota subyacente.

No existe un descuento anual estándar de autoservicio que se pueda modelar. Serverless funciona con consumo prepagado, los PTU exigen un mínimo de un mes, las reservas GPU publican tramos de 7-30, 31-90 y 91-180 días y los compromisos más largos pasan por ventas. El riesgo de bloqueo anual se encuentra en una orden personalizada o en una cadena de reservas de infraestructura, no en un plan anual público de aplicación.

Alternativas a Together AI: normalizar el mismo modelo antes de elegir

Together AI no es el proveedor más barato para todos los modelos compartidos. En gpt-oss-120B, su precio público serverless coincide exactamente con Fireworks AI y Groq: $0.15 por millón de tokens de entrada y $0.60 por millón de tokens de salida. Un trabajo con 1 millón de tokens de entrada y 250,000 de salida cuesta $0.30 en cualquiera de los tres, antes de considerar ventajas de caché o acuerdos propios de cada cuenta.

Esa paridad resulta útil. Elimina el precio por token como criterio decisivo y obliga a comparar las tarifas de caché, los límites, la latencia, el control del proveedor, los mecanismos de respaldo, las rutas de despliegue y la cobertura del SLA.

Fireworks AI iguala la tarifa base y ofrece una caché más barata

Fireworks AI publica gpt-oss-120B Standard serverless a $0.15 de entrada, $0.015 de entrada en caché y $0.60 de salida por millón de tokens. El trabajo normalizado sin caché cuesta los mismos $0.30 que en Together. Fireworks también anuncia $1 en créditos iniciales.

Documentación de precios serverless de Fireworks AI con las tarifas de gpt-oss-120B
Precios serverless de Fireworks AI

Fireworks gana esta comparación concreta cuando la carga contiene un prefijo grande y reutilizable, porque su tarifa actual de entrada en caché para gpt-oss aparece de forma explícita y es baja. También ofrece los niveles serverless Standard, Priority y Fast, que añaden otra elección entre latencia y precio. La desventaja es que esos niveles complican una comparación de tarifas que parecía sencilla, y su precio de GPU dedicada corresponde a un producto distinto del PTU de Together.

Fireworks encaja cuando la principal necesidad es usar modelos abiertos serverless con mucha caché y sus niveles de servicio se adaptan a la aplicación. Together conviene cuando el mayor valor estratégico está en pasar desde la misma API hacia PTU, inferencia dedicada, fine-tuning, sandboxes o clústeres sin administrar.

Groq vende velocidad con la misma tarifa por token

Groq publica gpt-oss-120B con los mismos precios de $0.15 de entrada y $0.60 de salida, así que el trabajo normalizado también cuesta $0.30. Su página actual del modelo indica cerca de 500 tokens por segundo, un límite del plan Developer de 250,000 tokens por minuto y 1,000 solicitudes por minuto para este modelo.

Documentación de modelos compatibles de Groq con el precio, la velocidad y los límites de gpt-oss-120B
Precios y límites de modelos de Groq

Groq es la alternativa más clara cuando el producto promete baja latencia de generación. Su nivel empresarial Performance añade rendimiento aprovisionado con un SLA de disponibilidad del 99.9%, pero no publica el precio. Esto facilita comparar el coste de tokens de autoservicio e impide normalizar la capacidad reservada sin solicitar una cotización.

Groq es recomendable para una ruta interactiva en la que sus modelos compatibles y su velocidad importan más que la oferta amplia de entrenamiento e infraestructura de Together. No encaja si la carga necesita el fine-tuning, los clústeres GPU, el sandbox o la ruta pública de PTU que Together reúne en una misma cuenta.

OpenRouter puede costar menos, a cambio de usar un agregador

OpenRouter publica actualmente gpt-oss-120B a $0.03 de entrada, $0.03 de entrada en caché y $0.17 de salida por millón de tokens. El trabajo normalizado de 1 millón de tokens de entrada y 250,000 de salida cuesta $0.0725 antes de las tarifas por comprar crédito. Si se distribuye su comisión del 5.5% entre créditos utilizados por completo, el importe sube a unos $0.0765, aunque la comisión mínima de $0.80 domina las recargas pequeñas.

Página de gpt-oss-120B en OpenRouter con precios de tokens en vivo y enrutamiento por proveedor
Precios de gpt-oss-120B en OpenRouter

OpenRouter gana el ejemplo de precio puntual al enrutar entre proveedores ascendentes. También ofrece respaldo automático y un catálogo de modelos mucho más amplio. No es el mismo producto que reservar capacidad en Together o elegir un único proveedor de infraestructura. La selección de rutas, la política de datos, la latencia, la disponibilidad aguas arriba y los cambios de proveedor pasan a formar parte de la arquitectura.

Su nivel gratuito es más accesible que el de Together: la página de precios actual enumera más de 25 modelos gratuitos y 50 solicitudes al día. A cambio, ofrece límites gratuitos bajos, aplica una comisión del 5.5% en pago por uso y se reserva el derecho de hacer caducar los créditos sin usar después de un año. Together afirma actualmente que los créditos comprados no caducan.

OpenRouter conviene cuando el acceso amplio a modelos, los mecanismos de respaldo y el precio puntual enrutado actual son prioritarios. Together es preferible cuando pesan más el control directo del proveedor, una ruta predecible hacia capacidad reservada, el entrenamiento de modelos o la infraestructura dedicada que la solicitud enrutada más barata.

La conclusión normalizada es directa. En gpt-oss-120B, Together, Fireworks y Groq empatan en el precio de tokens sin caché. OpenRouter cuesta menos en esta instantánea, pero cambia la relación con el proveedor. La elección depende del requisito operativo, no de afirmar de forma genérica que una plataforma es más barata.

¿Quién debería elegir Together AI y quién debería descartarlo?

Together AI es una buena plataforma para una empresa que espera ver madurar su carga de modelos abiertos: desde solicitudes impredecibles hasta un plan de capacidad deliberado. No es la opción automática para cualquier desarrollador que busque una API económica.

Quien desarrolla en solitario debería empezar con serverless y limitar la primera compra a $5. Una tarea acotada puede dirigirse a DeepSeek V4 Flash, gpt-oss-120B u otro modelo que supere el umbral de calidad. No tiene sentido pasar a PTU o hardware dedicado hasta que los registros de producción demuestren una demanda estable. Si el único objetivo es probar muchos modelos o conseguir acceso gratuito, OpenRouter puede ser la primera cuenta más sencilla.

Una startup con financiación debería usar Together cuando la escalera de despliegue reduzca migraciones futuras. Serverless permite validar el producto, los PTU reservan un modelo abierto estable detrás de la misma API y Dedicated Inference aloja un modelo personalizado o con fine-tuning. Esa continuidad vale más que una pequeña diferencia por token cuando la hoja de ruta ya apunta a capacidad reservada.

El CTO de una empresa mediana debería comprar PTU por un compromiso de servicio, no por una factura elevada. Debe prever la ocupación, comparar el SLA del 99% con la promesa al cliente y valorar la reserva frente a transacciones perdidas o escalaciones de soporte. Si la aplicación necesita un 99.9% de disponibilidad, una línea del 99% no basta por sí sola: hace falta diseñar respaldo o negociar el contrato.

Un operador sénior debería trasladar el volumen sin conexión a Batch antes de reservar capacidad. Clasificación, enriquecimiento, evaluaciones y datos sintéticos pueden recibir hasta un 50% de descuento en modelos aptos. Es un descuento directo por aceptar latencia. Un PTU compra capacidad y debe llegar después.

Un equipo de investigación o modelos solo debería usar Dedicated Inference o clústeres GPU si alguien responde por su utilización. El entrenamiento, el servicio personalizado y el control de bajo nivel pueden justificar la plataforma. Un equipo incapaz de supervisar horas de GPU, réplicas ociosas, consumo en picos y volúmenes persistentes está comprando una infraestructura que no puede gobernar.

Conviene descartar Together AI si se cumple una de estas cuatro condiciones. La única prioridad es el token enrutado más barato; el tráfico resulta demasiado irregular para una reserva mensual; el modelo necesario está en otro proveedor; o la empresa exige un SLA público más sólido sin negociar con ventas. Fireworks, Groq, OpenRouter o un proveedor directo del modelo pueden ajustarse mejor.

Lo bueno
Lo que hace bien
9 points

  • Una cuenta reúne serverless, capacidad reservada de tokens, inferencia dedicada, fine-tuning, clústeres GPU, cómputo en sandbox y almacenamiento.
  • Las tarifas serverless actuales son competitivas en varios modelos abiertos y algunos endpoints compatibles ofrecen descuentos importantes en la entrada en caché.
  • Los créditos prepagados comprados no caducan actualmente.
  • Provisioned Throughput añade una ruta pública de $0.05/PTU-minuto entre la inferencia compartida y la dedicada.
  • No hay prueba gratuita sin pago; acceder a la plataforma exige una compra de $5.
  • Antes de descuentos negociados, el precio público de lista del PTU solo iguala el serverless de Together a plena ocupación.
  • Un SLA de disponibilidad del 99% para PTU puede resultar insuficiente en rutas críticas sin respaldo.
  • Los despliegues dedicados, GPU reservados, almacenamiento y modelos con fine-tuning pueden seguir facturando con cero solicitudes.
  • Los precios en vivo pueden contradecir documentación antigua del producto, por lo que compras necesita una fuente fechada.

La tarea del lunes: medir una carga antes de reservar

El lunes, hay que elegir un flujo de producción acotado y crear un registro de costes durante siete días. El objetivo no es probar todos los modelos, sino descubrir si la carga corresponde a serverless, Batch, PTU o capacidad dedicada.

  1. Definir un resultado aceptado

    Se elige una tarea con un resultado evaluable: una clasificación válida, un cambio de código que supera las pruebas, un borrador de soporte aprobado o una extracción completada. El coste por resultado aceptado es la métrica de negocio.

  2. Registrar el perfil completo de consumo

    Durante siete días se capturan el número de solicitudes, la entrada sin caché, la entrada en caché, la salida, los reintentos, el máximo de solicitudes por segundo, las respuestas 429, la latencia, el tiempo de sandbox y los resultados aceptados. Los picos laborables deben separarse de las noches y fines de semana.

  3. Calcular la base serverless

    Se aplican las tarifas activas del modelo a la mezcla de tokens medida. El trabajo sin conexión apto se traslada a Batch y se recalcula. Hay que limitar la salida innecesaria y conservar prefijos de prompt estables para que la base incluya un ahorro de caché alcanzable.

  4. Ejecutar la prueba de ocupación del PTU

    La calculadora de PTU en vivo se completa con el pico de solicitudes, la tasa de aciertos de caché y la mezcla de tokens. Después se compara la cantidad necesaria de PTU con el uso promedio. Al 80% de ocupación, el precio público de lista implica una prima efectiva del 25% por token; hay que decidir si la capacidad reservada y el SLA del 99% la justifican.

  5. Escalar solo por un requisito concreto

    El paso a Dedicated Inference debe responder a modelos personalizados, control de inquilino único o rendimiento estable del hardware. El paso a clústeres GPU solo procede cuando el equipo gestiona la plataforma de entrenamiento o servicio. Junto al responsable del presupuesto deben figurar quienes se encargarán del apagado y de limpiar el almacenamiento.

La decisión final cabe en una frase que finanzas e ingeniería puedan compartir: «Esta carga sigue en serverless», «este flujo sin conexión pasa a Batch» o «esta ruta de cliente reserva N PTU porque la capacidad garantizada vale la prima ociosa medida». Esa sí es una tarea para el lunes, no una migración de infraestructura provocada por un titular de precios.

Preguntas frecuentes sobre Together AI pricing

¿Cuánto cuestan 1,000 tokens en Together AI?

Hay que dividir entre 1,000 la tarifa por millón del modelo y calcular por separado entrada y salida. MiniMax M3 cuesta $0.0003 por 1,000 tokens de entrada sin caché y $0.0012 por 1,000 tokens de salida. Kimi K3 cuesta $0.003 de entrada y $0.015 de salida por 1,000 tokens.

¿Cuánto cuesta Together AI al mes?

Serverless no tiene una suscripción mensual fija; después de comprar el acceso por $5, el coste mensual depende del consumo. Un PTU cuesta $2,160 en un mes de 30 días o alrededor de $2,190 si se aplica el supuesto de mes promedio de 43,800 minutos de la página de precios. Una H100 dedicada que funciona sin interrupción cuesta $3,952.80 durante 720 horas con la tarifa actual de $5.49 por hora.

¿Together AI es gratis?

No. Together AI no ofrece actualmente una prueba gratuita y exige una compra mínima de $5 en crédito prepagado para acceder a la plataforma. El catálogo en vivo muestra Ternary Bonsai 27B a $0 tanto para tokens de entrada como de salida, pero la cuenta aún requiere la compra de $5.

¿Together AI regala créditos?

No como oferta permanente al registrarse. Las promociones anteriores terminaron y el acceso actual exige una compra de $5. Together también mantiene un programa de créditos de investigación por invitación para proyectos estudiantiles fuera de clases formales, pero su disponibilidad es limitada.

¿Cuáles son los límites gratuitos de Together AI?

No existe un nivel gratuito convencional. Un saldo comprado de $5 coloca la cuenta en Build Tier 1, que actualmente incluye 600 solicitudes LLM por minuto, 3,000 solicitudes de embeddings por minuto y un límite de rerank de 500,000. Los límites dinámicos y específicos del modelo pueden ser menores.

¿Cuáles son las mejores alternativas a Together AI?

Fireworks AI es la alternativa más cercana para inferencia y fine-tuning de una amplia gama de modelos abiertos; Groq destaca en modelos compatibles de baja latencia; y OpenRouter es la opción más sólida para enrutamiento amplio y respaldo entre modelos. En gpt-oss-120B, Together, Fireworks y Groq comparten actualmente la misma tarifa de $0.15 de entrada y $0.60 de salida por millón de tokens. El precio enrutado de OpenRouter es menor en esta instantánea, pero añade una comisión por comprar crédito y una capa de agregación.

¿Together AI ofrece descuento para estudiantes?

Together AI no publica un nivel de precios permanente para estudiantes. Su programa de créditos de investigación por invitación ofrece pequeñas ayudas a estudiantes que desarrollan proyectos fuera de clases formales y pide que se reconozca a Together AI en el trabajo.

¿Cuál es la política de reembolso de Together AI?

Los términos de Together indican que, por defecto, las tarifas no son reembolsables y las obligaciones de pago no se pueden cancelar ni prorratear, salvo que una orden de compra disponga otra cosa. Las reservas GPU no son reembolsables. Al cancelar un trabajo de fine-tuning se cobran los pasos completados y solo se devuelve la parte pendiente.

¿Caducan los créditos de Together AI?

Los créditos prepagados comprados no caducan actualmente. Esto no implica que sean reembolsables: pueden conservar su validez sin admitir devolución, y los créditos comprados después de una factura no pueden saldar un importe vencido anterior.

¿Cambiaron los precios de Together AI en 2026?

Sí. Together AI lanzó Provisioned Throughput el 8 de julio de 2026, con capacidad reservada de tokens a $0.05 por PTU-minuto, un mínimo de un mes y un SLA de disponibilidad del 99%. El catálogo serverless y las tarifas de hardware dedicado también cambiaron desde junio, por lo que esta página muestra como fecha de verificación el 22 de agosto.

¿Provisioned Throughput cuesta menos que Together serverless?

No necesariamente. Con las tarifas públicas de lista, un PTU ocupado por completo corresponde casi exactamente al mismo valor durante 30 días que su capacidad serverless en Together. La infrautilización aumenta el precio efectivo por token. Los PTU compran capacidad reservada y un SLA; un descuento negociado por compromiso puede mejorar la tarifa, pero Together no publica esa escala.

Obtenga el Mapa de Herramientas de IA para Empresas

El Mapa de Herramientas de IA para Empresas convierte los precios de los modelos en una arquitectura práctica de adopción, con el umbral de calidad, la función de enrutamiento y el punto de coste de cada herramienta. Suscríbase para recibir gratis la próxima edición.

Última actualización

2 sept 2026

CategoríaAI

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Newsletter

Una carta, cada domingo. Sistemas que funcionan, no opiniones calientes.

Build logs, sistemas en producción y notas de campo de un portafolio de ventures de IA.

Semanal. Sin spam. Cancele cuando quiera.