DeepSeek gratis y precios de la API (2026): menos de $1 por millón de tokens
DeepSeek gratis en el chat; la API cobra $0.14 de entrada y $0.28 de salida por millón de tokens con V4 Flash. Compara sus precios con V4 Pro.

DeepSeek gratis cuesta $0 en su versión de chat. La API se factura por uso: $0.14 por millón de tokens de entrada y $0.28 por millón de salida con V4 Flash, o $0.435 y $0.87 con V4 Pro. La decisión es sencilla: mantén el chat personal en el plan gratuito, usa Flash como opción predeterminada en producción y paga por Pro solo si reduce los reintentos lo suficiente como para compensar una diferencia de precio de 3.11x.
Precios de DeepSeek de un vistazo
DeepSeek ofrece un producto gratuito para consumidores y dos modelos de API de pago. No existe una suscripción mensual ni anual de autoservicio para la API: los cargos por tokens se descuentan del saldo de la cuenta conforme se utiliza.
Estas cifras se verificaron en la página activa Models & Pricing de DeepSeek el 12 de agosto de 2026.

Un token es la unidad que factura el modelo, no una solicitud ni una palabra. La entrada abarca todo lo que se envía al modelo: instrucciones, historial, documentos y contexto de herramientas. La salida es todo lo que devuelve. Un acierto de caché corresponde a una entrada repetida que DeepSeek puede reutilizar a una tarifa menor; cuando no hay acierto, debe procesarla a la tarifa completa.
Los dos modelos de API comparten una ventana de contexto de 1M de tokens y una salida máxima de 384K. Así desaparece la necesidad habitual de pagar un recargo por contexto largo dentro de DeepSeek. Sus límites operativos sí cambian: V4 Flash admite 2,500 solicitudes simultáneas, mientras que V4 Pro admite 500.
DeepSeek gratis en el chat, pero la API se paga aparte
La aplicación de consumo de DeepSeek no cuesta nada. Su anuncio oficial de la aplicación indica que es 100% gratuita, sin anuncios ni compras dentro de la aplicación, y la página de inicio actual sigue presentando el acceso al chat como gratuito.
Que el chat sea gratis no significa que la API también lo sea. La aplicación de consumo es una interfaz para personas; la API es el producto medido que utiliza el software. La página de la API de DeepSeek descuenta el uso de un saldo otorgado o recargado. Por tanto, una cuenta de chat gratuita no convierte el tráfico programático en tráfico sin costo.
La misma separación entre productos confunde a compradores de otras marcas: una suscripción a una aplicación y la facturación de la API pueden compartir marca y, aun así, ser productos distintos, como muestra el análisis de precios de Perplexity. En DeepSeek, la diferencia es todavía más clara: la aplicación no publica un precio de suscripción, mientras que cada token de la API tiene una tarifa definida.
Quién no necesita pagar
No necesitas pagar si el uso es interactivo, ocasional y queda cubierto por la aplicación oficial web o móvil. Esto incluye consultas personales, redacción puntual, conversaciones sobre documentos y estudiantes que no requieren conectar DeepSeek con otro producto.
DeepSeek no publica un plan ni un descuento específico para estudiantes en las páginas de precios, preguntas frecuentes o la aplicación verificadas para este análisis. Tampoco lo necesita para el acceso de consumo habitual, porque ese acceso ya cuesta $0.
La frontera es la automatización. En cuanto un CRM, un flujo de soporte, una herramienta interna o un producto para clientes necesite llamar a DeepSeek sin que una persona abra la aplicación, hay que presupuestar tokens de API. Tampoco conviene tratar el chat gratuito como infraestructura de producción: la página de la aplicación gratuita no promete capacidad ilimitada ni publica un nivel de servicio.
V4 Flash es el modelo predeterminado en producción; V4 Pro es la vía de escalamiento
DeepSeek V4 Flash-0731 debería recibir la primera solicitud en la mayoría de las rutas de producción. Tiene el precio más bajo, el límite de concurrencia publicado más alto y una superficie de integración actual más amplia.
V4 Flash-0731
V4 Flash cobra $0.14 por millón de tokens de entrada sin acierto de caché, $0.0028 por la entrada con acierto y $0.28 por la salida. Admite modos con y sin razonamiento, salida JSON, llamadas a herramientas, la API de DeepSeek compatible con Anthropic y Responses API. La página activa muestra una ventana de contexto de 1M, una salida máxima de 384K y 2,500 solicitudes simultáneas.
Esta combinación convierte a Flash en la opción lógica para clasificación, extracción, resumen, generación de primeros borradores, cambios rutinarios de código y pasos acotados de agentes. Estos trabajos tienen comprobaciones de aceptación claras, de modo que una salida fallida puede detectarse y escalarse sin dejar que un error barato llegue al cliente.
No uses Flash como única ruta cuando un fallo sea costoso y difícil de detectar. Una recomendación jurídica, financiera o con impacto en clientes no debería elegir el modelo solo por el precio de los tokens. La tarifa baja permite evaluar más; no sustituye la evaluación.
V4 Pro
V4 Pro cobra $0.435 por millón de tokens de entrada sin acierto de caché, $0.003625 por la entrada con acierto y $0.87 por la salida. Comparte la ventana de contexto de 1M y la salida máxima de 384K, además de los mismos modos de razonamiento, salida JSON, llamadas a herramientas y formato compatible con Anthropic. Su límite de concurrencia publicado es 500.
Pro es la ruta para la cola difícil: una solicitud ambigua, un plan complejo, una tarea de programación complicada o el segundo intento después de que Flash no supere una comprobación determinista. No debe ser la opción predeterminada solo porque su nombre diga Pro.
La tabla activa también esconde un límite de integración. DeepSeek actualmente indica compatibilidad de Responses API con Flash, pero no con Pro. La página todavía señala que la compatibilidad con Pro estaba prevista para principios de agosto de 2026, aunque el estado activo del 12 de agosto sigue figurando como no compatible. Si una aplicación depende de ese endpoint, el precio por token de Pro no importa hasta que exista la integración.
- La aplicación de consumo cuesta $0, sin anuncios ni compras dentro de la aplicación.
- Todas las tarifas actuales de la API están por debajo de $1 por millón de tokens.
- Ambos modelos de API ofrecen una ventana de contexto de 1M y una salida máxima de 384K.
- El almacenamiento automático de contexto en caché puede abaratar de forma drástica los prefijos repetidos.
- V4 Flash combina la tarifa más baja, una compatibilidad más amplia con endpoints y mayor concurrencia.
- DeepSeek advierte que se aproxima un aumento importante de los precios de la API, pero no indica ni la cantidad ni la fecha.
- Los aciertos de caché se realizan según disponibilidad y no están garantizados.
- V4 Pro cuesta cerca de 3.11x más que Flash en entradas sin acierto de caché y en salidas.
- V4 Pro tiene una quinta parte de la concurrencia publicada de Flash y actualmente no es compatible con Responses API.
- El chat gratuito no tiene una promesa publicada de capacidad ilimitada ni de nivel de servicio.
La factura de tokens de DeepSeek es mínima; el costo por resultado aceptado es lo que decide
El gasto bruto de la API es tan bajo que una sola revisión humana evitable puede costar más que miles de llamadas al modelo. La fórmula útil no es el costo por solicitud, sino el costo por resultado aceptado.
Para una solicitud sin aciertos de caché:
cost = input tokens / 1,000,000 × input rate + output tokens / 1,000,000 × output rate
Con 1,000 tokens, V4 Flash cuesta $0.00014 por la entrada sin acierto de caché y $0.00028 por la salida. V4 Pro cuesta $0.000435 por la entrada sin acierto y $0.00087 por la salida.
Pensemos en un flujo que redacta respuestas de soporte con 2,000 tokens de entrada y 500 de salida por respuesta. Para 1,000 respuestas y sin aciertos de caché, Flash cuesta $0.42 y Pro, $1.305. Todo el sobreprecio de Pro es de $0.885 por cada mil respuestas.
Ahora sumemos el trabajo humano. Cinco minutos de revisión, a un costo ilustrativo de $60 por hora, equivalen a $5. Un solo evento de revisión adicional cuesta más que cinco lotes completos de ese sobreprecio de Pro. La pregunta correcta no es «¿Qué modelo tiene la tarifa más baja?», sino «¿Qué ruta supera la comprobación de aceptación con el menor gasto en el modelo más el tiempo de revisión?».
Cuánto cuesta DeepSeek al mes
DeepSeek no tiene una cuota mensual por usuario comparable con una suscripción de software. El costo mensual depende únicamente de la forma del tráfico: cuánto contexto entra, cuánto texto sale, con qué frecuencia los prefijos aciertan en caché y cuántos intentos exige un resultado aceptado.
Para el prototipo de un producto individual que use 10M de tokens de entrada sin acierto de caché y 2M de salida en un mes, Flash cuesta $1.96 y Pro, $6.09. La diferencia de $4.13 no decidirá si el producto sobrevive. Lo hará el modelo que entregue un resultado válido con menos depuración.
En una operación de soporte que redacte 100,000 respuestas de 2,000 tokens de entrada y 500 de salida cada una, la factura sin caché es de $42.00 con Flash o $130.50 con Pro. Con una tasa ilustrativa de aciertos de caché del 80% en la entrada, los totales bajan a $20.048 y $61.48. Incluso con este volumen, una hora de revisión humana puede superar toda la factura mensual de Flash bajo el supuesto de $60 por hora.
Para 1,000 trabajos de análisis documental con 50,000 tokens de entrada y 2,000 de salida cada uno, la factura sin caché es de $7.56 con Flash o $23.49 con Pro. Si el 80% de la entrada acierta en caché, pasa a $2.072 o $6.235. Una entrada larga no implica automáticamente una factura elevada de DeepSeek; si esa entrada se repite, la economía por unidad puede resultar inusualmente baja.
Estos ejemplos también explican por qué no sirve copiar una estimación mensual fija de otra empresa. Una respuesta de soporte genera mucha salida en relación con su prompt. Un trabajo documental concentra el gasto en la entrada. Un agente puede multiplicar ambos mediante reintentos y ciclos de herramientas. Guarda la combinación de tokens junto a la cifra en dólares para que finanzas pueda distinguir si el cambio procede del tráfico, la calidad o una tarifa del proveedor.
El punto de equilibrio entre Flash y Pro
Las tarifas de V4 Pro para entrada sin acierto de caché y salida son 3.107143 veces las de Flash, una cifra que se redondea a 3.11x. Con la misma combinación de tokens, Pro debe reducir los intentos facturados o el volumen de tokens en un 67.82% para alcanzar el punto de equilibrio únicamente por gasto en el modelo.
Si Pro termina una tarea en un intento, Flash puede promediar hasta 3.11 intentos comparables antes de que su factura de tokens sea mayor. Si Flash resuelve en uno o dos intentos, Pro pierde la comparación de precio. Si Flash necesita cuatro intentos de forma repetida, Pro gana incluso antes de incluir la revisión humana.

Esta regla de enrutamiento también evita un error habitual de compras. Un equipo ve tarifas inferiores a un dólar, envía todas las tareas a Pro y considera que el total es barato. La factura absoluta puede seguir siendo pequeña, pero pagar un sobreprecio sin medirlo en millones de llamadas no constituye una estrategia. Flash debería encargarse de la carga base acotada; Pro, de los fallos que lo justifiquen.
El almacenamiento en caché del contexto solo cambia la factura cuando los prefijos se repiten de verdad
La tarifa por acierto de caché de DeepSeek tiene valor, pero no es un descuento que pueda darse por hecho en una hoja de cálculo. La guía de caché de contexto indica que el caché se activa de forma predeterminada, funciona con unidades completas de prefijo persistidas y opera según disponibilidad.
Un prompt de sistema estable seguido de un documento de referencia estable es un buen candidato para caché. Una solicitud posterior puede reutilizar ese inicio y añadir una pregunta nueva. Reutilizar una frase situada en medio de otro prompt no cumple el requisito: debe coincidir todo el prefijo con una unidad que DeepSeek haya conservado.
La caché también tiene una dimensión temporal. Su creación tarda segundos y las entradas sin uso normalmente se eliminan en un plazo de horas a días. Un informe semanal puede no encontrar una caché que sí aprovecharía una ráfaga de solicitudes casi idénticas. DeepSeek no garantiza una tasa de aciertos del 100%.
Con una tasa ilustrativa de aciertos de caché del 80% en la entrada, el costo combinado por millón de tokens baja a $0.03024 con Flash y $0.08990 con Pro. En el ejemplo de 1,000 respuestas de soporte, el costo total cae de $0.42 a $0.20048 con Flash y de $1.305 a $0.61480 con Pro.
Esto equivale aproximadamente a la mitad de la factura total de esta carga con salida, no a la reducción casi total que sugiere comparar de manera aislada las tarifas de entrada con y sin acierto de caché. Los tokens de salida no reciben el descuento de caché aplicado a la entrada.
Mantén estable el prefijo
Coloca primero las instrucciones duraderas y el material de referencia repetido. Añade después la solicitud cambiante del usuario, en lugar de reconstruir el prompt en un orden diferente.
Consulta los campos de uso
Registra
prompt_cache_hit_tokensyprompt_cache_miss_tokensen las respuestas de la API. Una tasa de aciertos proyectada no es un dato de facturación hasta que estos campos la confirmen.Calcula el precio de la combinación observada
Separa la entrada medida entre tokens con y sin acierto, añade los tokens de salida y calcula el costo por resultado aceptado. Vuelve a calcularlo cuando cambie la estructura del prompt o la cadencia del tráfico.
DeepSeek cuesta menos que las demás API preseleccionadas, antes de ajustar por calidad
DeepSeek gana por amplio margen en la comparación del precio bruto por token. Eso no significa que gane automáticamente en el resultado empresarial, porque estos modelos difieren en capacidad, herramientas, latencia y tasa de fallos.
Usemos una carga normalizada para comparar los precios publicados: 1M de tokens totales de entrada más 250K de salida, sin descuento de caché. Esa carga cuesta $0.21 con V4 Flash y $0.6525 con V4 Pro, redondeado a $0.65.
OpenAI GPT-5.6 Sol cobra $5 por la entrada y $30 por la salida por cada millón de tokens. La carga normalizada cuesta $12.50 siempre que cada solicitud se mantenga por debajo del umbral de contexto largo de OpenAI, o 19.16x más que V4 Pro. Los prompts de más de 272K tokens de entrada activan precios de 2x para la entrada y 1.5x para la salida en toda la solicitud, y las escrituras en caché cuestan 1.25x la entrada sin caché.
Claude Sonnet 5 cobra $2 por la entrada y $10 por la salida por cada millón de tokens. La misma carga cuesta $4.50, o 6.90x más que V4 Pro. Anthropic incluye la ventana de contexto de 1M con el precio estándar y ofrece un descuento Batch del 50%, por lo que los trabajos que toleran más latencia pueden reducir la diferencia.
Gemini 3.1 Pro Preview cobra $2 por la entrada y $12 por la salida por cada millón de tokens cuando el prompt no supera 200K. La carga normalizada agregada cuesta $5.00 si todas las solicitudes se mantienen por debajo de ese límite, o 7.66x más que V4 Pro. Si la misma carga entra en una sola solicitud superior a 200K, las tarifas de Google suben a $4 para la entrada y $18 para la salida, con una factura de $8.50, o 13.03x más que V4 Pro.

La diferencia entre precios es grande, pero la distancia en dólares resulta menor de lo que sugieren los múltiplos. Cambiar la carga normalizada de V4 Pro a GPT-5.6 Sol añade $11.8475. Una corrección humana puede borrar ese ahorro, mientras que una ruta fiable y de gran volumen puede multiplicarlo.
Consulta la comparación entre DeepSeek y ChatGPT cuando la calidad del modelo, las funciones del producto y el tratamiento de datos importen más que la tabla de tokens. Revisa la selección de las API de IA más baratas cuando el trabajo pueda admitir modelos económicos más pequeños y gateways. Una página de precios permite normalizar tarifas; solo una evaluación propia puede normalizar resultados.
El riesgo oculto para el presupuesto es un cambio de precios, no un contrato anual
La página activa de DeepSeek anuncia un aumento general de los precios de la API en un futuro próximo y anticipa que será importante. No publica ni una cantidad ni una fecha de entrada en vigor. Las tarifas actuales son hechos verificados; cualquier multiplicador futuro sería especulación.
Esa advertencia cambia la decisión de compra. No prometas a un cliente, al consejo ni al equipo financiero que la tarifa de agosto se mantendrá durante un año. Guarda la fecha de verificación de la página de precios junto a cada modelo presupuestario, convierte la tarifa en una variable editable y define qué variación de precio activaría un cambio de ruta.
No existe una trampa mensual ni anual en la API
DeepSeek descuenta del saldo el consumo de tokens; no cobra una cuota mensual por usuario ni un contrato anual de autoservicio. El saldo recargado no caduca. El saldo otorgado sí puede hacerlo, y su fecha aparece en la página Billing. Cuando existen ambos, la API utiliza primero el saldo otorgado.
Según las preguntas frecuentes oficiales, el saldo sin utilizar se puede reembolsar desde Billing > Refunds. Esto hace que una recarga moderada implique menos riesgo que un compromiso anual no reembolsable. La eliminación de la cuenta es la excepción: las preguntas frecuentes advierten que al borrarla se pierde todo el saldo restante de Open Platform.
DeepSeek también evita la sorpresa de un exceso de consumo pospago. Cuando el saldo es insuficiente, la API devuelve HTTP 402 e indica que hay que recargar. El riesgo operativo es una interrupción, no una factura que rebasa en silencio el límite de un plan. Configura una alerta de saldo antes de que el tráfico de producción encuentre ese límite.
La integración y la concurrencia pueden costar más que los tokens
Flash admite 2,500 solicitudes simultáneas y es compatible actualmente con Responses API. Pro admite 500 y no tiene compatibilidad actual con Responses API. Quien diseñe una solución en torno a Pro sin comprobar estos límites puede acabar pagando en colas, lógica de respaldo o trabajo de integración, aunque la factura del modelo siga por debajo de un dólar por millón de tokens.
La arquitectura segura más barata mantiene reversible el enrutamiento. Usa una interfaz interna única, registra el modelo elegido y el consumo de tokens, y conserva una alternativa probada. La advertencia de DeepSeek sobre sus precios convierte esta práctica habitual de ingeniería en un control presupuestario.
El historial de precios de DeepSeek separó Flash de Pro
V4 no abarató todas las partidas por igual. La estrategia actual de niveles redujo con fuerza el precio de Flash, pero mantuvo para Pro una tarifa más alta en la entrada sin acierto de caché.
El anuncio de precios de V3 fijaba $0.07 para la entrada con acierto de caché, $0.27 para la entrada sin acierto y $1.10 para la salida por millón de tokens. Frente a esas tarifas, V4 Flash cuesta un 96.00% menos en entrada con acierto, un 48.15% menos en entrada sin acierto y un 74.55% menos en salida.
V4 Pro evoluciona de otra manera. Su entrada con acierto de caché cuesta un 94.82% menos que con V3 y su salida, un 20.91% menos, pero su tarifa de $0.435 para la entrada sin acierto es un 61.11% mayor que los $0.27 de V3.
Este historial explica la regla de decisión actual. Flash no es solo una etiqueta menor: es la apuesta para grandes volúmenes. Pro exige que el flujo de trabajo justifique una tarifa sin caché más alta mediante mejores resultados. El próximo aumento anunciado puede cambiar ambos, por lo que la fecha de verificación debe acompañar los cálculos.
La acción del lunes: mide una ruta antes de mover el presupuesto
El lunes, toma 100 solicitudes depuradas de un flujo acotado y realiza una prueba de enrutamiento durante una semana. No empieces con una migración de toda la empresa.
Define primero la aceptación
Elige un resultado que una persona revisora pueda puntuar de forma consistente: esquema válido, clasificación correcta, pruebas superadas o borrador de soporte aprobado. Elimina del conjunto de evaluación los datos personales, confidenciales y de clientes.
Envía la carga base a Flash
Procesa las 100 solicitudes con V4 Flash-0731. Registra los datos de entrada, salida, aciertos y fallos de caché, reintentos, latencia y aceptación para cada solicitud.
Escala solo los fallos
Envía a V4 Pro los casos fallidos o ambiguos. Mide si Pro reduce la cola de fallos lo suficiente para compensar la tarifa de 3.11x del modelo y cualquier tiempo de revisión humana.
Define dos condiciones presupuestarias
Mantén Flash como modelo predeterminado solo mientras supere el umbral de calidad. Conserva DeepSeek como proveedor únicamente mientras el costo normalizado activo siga por debajo de la alternativa probada después de cualquier cambio de precio.
El resultado de esta prueba es una sola cifra que permite decidir: el costo por resultado aceptado. Así, las diminutas tarifas por token de DeepSeek se convierten en un presupuesto de flujo de trabajo que finanzas puede revisar sin rehacer el análisis.
Preguntas frecuentes
¿DeepSeek es de pago o gratis?
La aplicación oficial de consumo de DeepSeek es gratuita, sin anuncios ni compras dentro de la aplicación. El acceso a la API se factura por separado y cobra los tokens de entrada con acierto de caché, de entrada sin acierto y de salida.
¿Cuánto cuesta DeepSeek V4 Pro?
V4 Pro cuesta $0.003625 por millón de tokens de entrada con acierto de caché, $0.435 por millón de tokens de entrada sin acierto y $0.87 por millón de tokens de salida. Tiene una ventana de contexto de 1M, una salida máxima de 384K y un límite de concurrencia publicado de 500.
¿Cuánto cuesta DeepSeek al mes?
El chat para consumidores cuesta $0 al mes. La API no tiene un precio mensual fijo: multiplica los totales mensuales de tokens de entrada con acierto de caché, entrada sin acierto y salida por sus respectivas tarifas por millón.
¿Por qué DeepSeek es más barato que ChatGPT?
En una carga basada solo en precio de 1M de tokens de entrada más 250K de salida, DeepSeek V4 Pro cuesta cerca de $0.65 y OpenAI GPT-5.6 Sol cuesta $12.50 por debajo de su umbral de contexto largo, una diferencia de 19.16x. Compara resultados aceptados, no solo tokens, porque la calidad de los modelos y la compatibilidad con herramientas son distintas.
¿DeepSeek ofrece un descuento para estudiantes?
DeepSeek no incluye un plan ni un descuento específico para estudiantes en las páginas oficiales de precios, preguntas frecuentes o la aplicación verificadas en agosto de 2026. Los estudiantes que usan la aplicación web o móvil para consumidores ya pagan $0.
¿Puedo solicitar un reembolso a DeepSeek?
Sí, el saldo de la API sin utilizar se puede reembolsar desde Billing > Refunds. El saldo recargado no caduca, mientras que el saldo otorgado puede tener una fecha de vencimiento. Al eliminar la cuenta se pierde el saldo restante de Open Platform.
¿Cambiaron los precios de DeepSeek en 2026?
Sí. Frente a las tarifas anteriores de V3, V4 Flash cuesta un 48.15% menos en entrada sin acierto de caché y un 74.55% menos en salida. La salida de V4 Pro cuesta un 20.91% menos, pero su entrada sin acierto cuesta un 61.11% más. DeepSeek ahora advierte que se aproxima otro aumento importante, sin indicar ni la cantidad ni la fecha.
¿Conviene elegir V4 Flash o V4 Pro?
Elige Flash para la carga base acotada y Pro para los casos fallidos o de alto impacto. Si solo se considera el gasto del modelo sin caché, Pro necesita un 67.82% menos de intentos facturados o tokens para alcanzar el punto de equilibrio frente a la tarifa 3.11x menor de Flash.
Obtén el Mapa de herramientas de IA para propietarios de empresas
El Mapa de herramientas de IA para propietarios de empresas convierte los precios de los modelos en una pila de adopción práctica, con el umbral de calidad, la función de enrutamiento y el activador de costos de cada herramienta. Suscríbete para recibir gratis la próxima edición.
3 sept 2026







