Mejor IA para programar en 2026: modelos baratos para agentes
¿Cuál es la mejor IA para programar en 2026? Comparamos modelos baratos para agentes por costo real, reintentos y presupuesto por parche aceptado.

GPT-5.6 Luna es la mejor IA para programar por defecto y a bajo costo en 2026: un mes con 10,000 tareas, cada una con 100,000 tokens de entrada y 30,000 de salida, cuesta $560 a precio de lista; DeepSeek V4 Flash, en cambio, va de $418 fuera de horas pico a $836 en horario pico. La regla de compra no es elegir el token más barato, sino minimizar el presupuesto por parche aceptado después de reintentos, pruebas y revisión humana.
El veredicto, en pocas palabras
Conviene usar GPT-5.6 Luna como trabajador habitual, DeepSeek V4 Flash para colas programables fuera de horas pico, Gemini 3.7 Flash cuando una tarea más difícil o multimodal justifique un mayor costo por intento, y Claude Haiku 4.5 cuando el resto del sistema ya funcione con Claude. Esa es la respuesta breve que realmente sirve.
Un modelo y un agente de programación no son el mismo producto. El modelo es el motor de razonamiento. El agente es la infraestructura que lee archivos, ejecuta comandos, modifica código, conserva el contexto y solicita aprobación. Cursor, Claude Code, Codex y herramientas similares son esa infraestructura. Este ranking aísla la capa del modelo, porque allí se deciden la economía de tokens y el costo de los reintentos. Si aún falta elegir el agente, consulte la comparativa de agentes de IA para programar.
Todos los precios que aparecen a continuación se verificaron en la documentación publicada por cada proveedor el 22 de agosto de 2026. Los precios de entrada y salida corresponden a 1 millón de tokens. Estos modelos se analizaron y cotizaron; no se presentan como si hubieran sido probados en producción durante esta revisión.
El ranking no afirma que la primera fila gane en todas las tareas de cualquier repositorio. Indica que ofrece el mejor punto de partida presupuestario antes de contar con evaluaciones privadas. DeepSeek puede costar menos o más que Luna según la hora. Gemini puede resultar más barato por parche aceptado si evita suficientes intentos fallidos. Haiku puede ser la implementación de menor riesgo en una infraestructura estandarizada en Anthropic, aunque su precio por token sea mayor.
La mejor IA para programar se decide por el costo de cada parche aceptado
Un modelo de programación barato solo ahorra dinero si sus parches superan las pruebas y la revisión. Los tokens son el medidor, no el resultado. Un modelo que necesita tres intentos, repite llamadas a herramientas o abre un largo ciclo de correcciones puede perder frente a otro más caro que resuelve la tarea una sola vez.
La métrica útil es el presupuesto por parche aceptado:
Presupuesto por parche aceptado = gasto total en modelos dividido entre los parches que superan las pruebas y la revisión exigidas.
No es un benchmark de proveedor. Es el indicador operativo que quien administra agentes de programación puede calcular a partir del uso de la API y del proceso de integración.
Para dimensionar la diferencia de precio, supongamos que una empresa ejecuta 10,000 tareas de agentes de programación al mes. Cada tarea consume 100,000 tokens de entrada sin caché entre contexto del repositorio, instrucciones y resultados de herramientas, y luego 30,000 tokens de salida entre razonamiento, parches, pruebas y turnos posteriores. La carga mensual suma 1 millardo de tokens de entrada y 300 millones de salida. El cálculo excluye caché, descuentos por lotes, herramientas de pago, tiempo de ejecución del sandbox y revisión humana, para que las cuatro tarifas de tokens sean comparables.

DeepSeek demuestra con especial claridad por qué no conviene ordenar los modelos por un único precio llamativo. Si toda la carga se ejecuta fuera de horas pico, cuesta $418 en el mes supuesto, $142 menos que Luna. Si toda cae en horario pico, asciende a $836, es decir, $276 más que Luna. La factura de Luna queda 33.01% por debajo de la de DeepSeek en horario pico. Un equipo que use agentes interactivos durante esas franjas puede pagar más por DeepSeek incluso antes de comparar la calidad.
Los reintentos reducen con rapidez la ventaja fuera de horas pico. En este modelo, un intento con Luna cuesta $0.056. Uno con DeepSeek fuera de horas pico cuesta $0.0418. Si DeepSeek promedia más de 1.34 intentos por cada intento de Luna que produce un parche aceptado, el ahorro aparente desaparece. El umbral es tan bajo que unos pocos bucles adicionales de herramientas pueden decidir el costo del mes.
Gemini representa el caso opuesto. Un intento con su tarifa Standard introductoria cuesta $0.1875, lo mismo que 3.35 intentos de Luna. Gemini solo se convierte en la opción más barata si un intento suyo reemplaza más de 3.35 intentos de Luna con la misma distribución de tokens, o si resuelve una tarea que Luna no puede completar. Aun así, puede ser la ruta de escalamiento correcta; lo que no debe hacerse es convertirlo en la opción predeterminada de toda la flota solo porque su capacidad bruta sea mayor.
Haiku cuesta $0.25 por intento supuesto, el equivalente a 4.46 intentos de Luna. Por eso no gana una comparación general de precios. Sí puede imponerse dentro de una arquitectura nativa de Claude, donde cambiar de proveedor generaría más trabajo de implementación, evaluación y gobernanza del que ahorraría la diferencia de tokens.
La caché modifica el costo de entrada, pero la salida sigue siendo decisiva en los bucles de programación. Si el 80% de la entrada supuesta de Luna se convierte en acierto de caché, la factura de 10,000 tareas baja de $560 a $416 antes de contar los cargos iniciales por escritura en caché. Los $360 de salida no cambian. Por eso un modelo que escribe un parche correcto y más corto puede superar a otro cuya entrada sea más barata.
1. GPT-5.6 Luna: la opción económica por defecto para agentes de programación
GPT-5.6 Luna es el mejor modelo económico para el trabajo habitual de los agentes de programación, porque sus tarifas de $0.20 por entrada y $1.20 por salida forman parte de una plataforma completa para usar herramientas. OpenAI le da una ventana de contexto de 1,050,000 tokens, hasta 128,000 tokens de salida, llamadas a funciones, salidas estructuradas, shell alojado, apply patch, Skills, MCP y búsqueda de herramientas. No es simplemente un endpoint barato para generar texto: puede asumir el papel de trabajador en un agente que lee un repositorio, modifica archivos y ejecuta validaciones.

La consecuencia comercial llegó antes de que la mayoría de las comparativas de modelos pudiera reflejarla. OpenAI redujo el precio de Luna un 80% el 30 de julio. El 19 de agosto, OpenAI y Replit anunciaron que Luna impulsaba el modo gratuito de Replit para millones de usuarios. Replit deriva a GPT-5.6 Sol el trabajo que exige razonamiento más avanzado y luego vuelve a Luna sin perder el contexto del proyecto. Esa es la arquitectura útil: el modelo barato se ocupa del recorrido común y el caro interviene ante la incertidumbre, no en cada token.
Las pruebas de despliegue proceden de los propios proveedores y deben leerse como datos atribuidos, no como un benchmark independiente. Aun así, resultan especialmente pertinentes. Ramp afirma que Luna se convirtió en su opción predeterminada para automatizaciones de agentes en segundo plano. Blitzy informa que Luna elevó la reutilización de la caché de prompts del 24% al 90%, procesó 2.2x más contexto con 8.5x menos tokens de salida y redujo el costo un 87% frente a GPT-5.4 mini en miles de llamadas de producción. Dust comunica un rendimiento 40% más rápido y 40% más barato que su anterior modelo predeterminado en las mismas tareas agénticas. Estos ejemplos respaldan una consecuencia de diseño: la disciplina en la salida y el comportamiento de la caché pueden importar más que el precio anunciado de la entrada.
Ideal para: Implementación habitual, escritura de pruebas, refactorizaciones acotadas, trabajadores en segundo plano y subagentes de gran volumen
Lo más destacado: Un modelo actual y atento al costo, con shell alojado, apply patch, Skills, MCP, salidas estructuradas y una ventana de contexto de 1,050,000 tokens
Precio: $0.20 por entrada, $0.02 por entrada en caché y $1.20 por salida, por cada 1 millón de tokens
Prueba gratuita: La API no admite un nivel gratuito; Replit ofrece por separado un modo gratuito impulsado por Luna
- Es la opción predeterminada convencional de menor riesgo en esta comparativa, con $560 para la carga mensual normalizada
- Ofrece una plataforma completa de herramientas para operar sobre repositorios, no solo respuestas de chat
- Incluye seis niveles de esfuerzo de razonamiento, desde none hasta max
- Su salida máxima de 128,000 tokens admite parches extensos y bucles de herramientas
- Los despliegues públicos muestran a gran escala el patrón de trabajador más escalamiento
- La salida cuesta seis veces más que la entrada sin caché
- Toda solicitud que supere 272,000 tokens de entrada pasa a costar 2x en entrada y 1.5x en salida para la solicitud completa
- La API no tiene nivel gratuito
- Una ventana de contexto amplia puede incentivar el volcado costoso de repositorios en lugar de una recuperación precisa
Por qué Luna domina el trabajo habitual
Habitual no significa trivial. Significa que las condiciones de aceptación están claras antes de comenzar. Un ticket de implementación bien delimitado, una prueba fallida con un límite conocido, la actualización de una dependencia, una corrección de lint o un endpoint repetitivo pueden ser tareas habituales incluso dentro de una base de código grande. El agente recupera los archivos pertinentes, aplica un cambio, ejecuta las comprobaciones indicadas y devuelve un diff para revisión.
Los controles de razonamiento de Luna permiten que la infraestructura asigne distinto esfuerzo sin cambiar de modelo. Conviene usar un nivel bajo para ediciones deterministas y aumentarlo cuando el agente deba conciliar varias restricciones. Así se evita pagar el precio de un modelo de frontera solo porque una tarea de la cola tenga incertidumbre. Aun así, el control debe evaluarse: un nivel de razonamiento mayor puede consumir más salida, que es la parte cara de la tarifa de Luna.
El principal límite está en el umbral de contexto largo. Un prompt que supere 272,000 tokens de entrada cuesta el doble en entrada y 1.5 veces más en salida para la solicitud completa. El modelo admite 1,050,000 tokens, pero esa capacidad no autoriza a pegar un repositorio entero en cada turno. Una capa de recuperación que seleccione los archivos relevantes puede evitar que un conjunto adicional de archivos cambie el precio de toda la solicitud.
Piloto de Luna durante una semana
Defina el trabajo habitual
Elija una clase de tarea con un comando de prueba y un criterio de revisión claros. Las correcciones acotadas de errores, la generación de pruebas, las actualizaciones de dependencias y las refactorizaciones pequeñas son buenos candidatos. No empiece por rediseños de arquitectura.
Mantenga el modelo actual como escalamiento
Envíe el primer intento a GPT-5.6 Luna. Escale solo después de una validación fallida, falta de contexto o una incertidumbre identificada. Conserve el estado de la tarea para que el modelo más potente no repita todo el trabajo de descubrimiento.
Delimite el contexto y las herramientas
Recupere únicamente los archivos pertinentes del repositorio. Permita las herramientas de shell y parche que requiera la tarea, mantenga las acciones destructivas sujetas a aprobación y marque toda solicitud que cruce el umbral de precio de 272,000 tokens.
Registre el presupuesto por parche aceptado
En cada tarea, registre entrada, entrada en caché, salida, intentos, pruebas, minutos de revisión y si el parche se integró. El gasto del modelo sin datos de aceptación no demuestra que una ruta sea barata.
Traslade únicamente la clase que aprueba
Después del piloto, asigne a Luna la clase de tarea que haya cumplido el estándar de calidad y revisión. Mantenga el trabajo fallido, ambiguo y de gran impacto en la ruta de escalamiento.
Elija Luna cuando la empresa busque una API con amplio respaldo, herramientas actuales para agentes y un recorrido común económico. No lo use como único modelo si las tareas suelen exigir criterio arquitectónico, cambios críticos de seguridad o un contexto de repositorio que supere su umbral de precio. En esos casos, la respuesta correcta es una ruta, no una factura predeterminada más alta.
2. DeepSeek V4 Flash: la mejor opción para trabajo programado fuera de horas pico
DeepSeek V4 Flash es la ruta competente más barata de esta comparativa, pero solo cuando el trabajo se ejecuta fuera de horas pico. Su precio vigente es de $0.22 por entrada y $0.66 por salida fuera de horas pico, frente a $0.44 y $1.32 en horario pico. Ese calendario tarifario lo convierte en una buena opción para generar pruebas durante la noche, procesar migraciones en cola, indexar repositorios y ejecutar mantenimiento que admita reintentos. Funciona peor como opción predeterminada para un equipo interactivo global cuya demanda siga el reloj.

DeepSeek define como horario pico las franjas de 01:00 a 04:00 UTC y de 06:00 a 10:00 UTC. El resto del día se considera fuera de horas pico. Su página de precios también indica que la tarifa reducida durante todo el fin de semana comienza a las 00:00, hora de Pekín, el 23 de agosto de 2026. Así, la programación del trabajo se vuelve una palanca de ingeniería: una cola que puede esperar paga un precio distinto al de un desarrollador que aguarda una respuesta dentro del editor.
V4 Flash no es un pequeño clasificador. DeepSeek especifica 1,000,000 tokens de contexto, un máximo de salida de 384,000 tokens, salida JSON, llamadas a herramientas, Responses API, una API compatible con Anthropic y completado FIM en modo sin razonamiento. El proveedor afirma que su razonamiento se aproxima al de V4 Pro y que equipara a V4 Pro en tareas sencillas de agentes. También menciona integraciones con Claude Code, OpenClaw y OpenCode. Son afirmaciones del proveedor, pero describen la plataforma adecuada para evaluar un agente de programación.
Ideal para: Mantenimiento programado de código, generación de pruebas fuera de horas pico, transformaciones de repositorios y equipos que quieran API con formatos similares a OpenAI o Anthropic
Lo más destacado: Un modelo para agentes con 1,000,000 tokens de contexto, precio fuera de horas pico de $0.22/$0.66 y un límite de concurrencia de 2,500
Precio: Fuera de horas pico, $0.007 por acierto de caché, $0.22 por fallo de caché y $0.66 por salida; en horario pico, $0.014 por acierto de caché, $0.44 por fallo de caché y $1.32 por salida
Prueba gratuita: La página de precios vigente no indica un nivel gratuito permanente
- Es el menor costo mensual supuesto de esta lista cuando todas las tareas se ejecutan fuera de horas pico
- Admite JSON, llamadas a herramientas, Responses API, API de Anthropic y FIM
- Ofrece 1,000,000 tokens de contexto y un máximo de salida de 384,000 tokens
- La tarifa por horario puede recompensar una cola verdaderamente asíncrona
- Las 2,500 solicitudes simultáneas indicadas permiten evaluaciones de gran volumen
- La tarifa pico hace que el mes normalizado cueste 49.29% más que Luna
- La tarifa más barata depende de la programación del trabajo, no solo de elegir el modelo
- DeepSeek se reserva el derecho a modificar los precios
- La compatibilidad anunciada por el proveedor no elimina las revisiones de compras, privacidad y riesgo del servicio
El reloj forma parte de la arquitectura
Un equipo de plataforma puede programar tareas de modernización del código para después de las integraciones. Un desarrollador que pide al agente reparar una compilación fallida durante su jornada no puede hacerlo. Esas dos cargas de trabajo no deberían compartir el mismo supuesto de precio.
El intento normalizado fuera de horas pico cuesta $0.0418. Luna cuesta $0.056. Por tanto, DeepSeek solo tiene un margen de calidad de 1.34 intentos. Si necesita un bucle adicional de descubrimiento o corrección con la frecuencia suficiente para superar ese promedio, Luna resulta más barato por parche aceptado incluso antes de entrar en horario pico. Durante el horario pico, DeepSeek ya cuesta más con la distribución de tokens supuesta.
Esto no relega a DeepSeek a la categoría de curiosidad. Simplemente delimita dónde gana. Coloque el trabajo no urgente y apto para reintentos detrás de una cola. Etiquete la franja de facturación en la telemetría. Mantenga Luna o el proveedor actual como ruta interactiva. Así, la organización aprovecha la economía fuera de horas pico sin someter el tiempo de respuesta del desarrollador a un calendario de precios.
El segundo límite es la estabilidad del precio. DeepSeek se reserva explícitamente el derecho a modificar las tarifas y pide a sus clientes que consulten la página vigente. La advertencia importa porque una arquitectura de agentes de programación puede trasladar con rapidez una gran proporción de tokens a un solo proveedor. Registre el identificador del modelo, el proveedor, la franja de facturación y el resultado del parche aceptado en el mismo lugar, para que un cambio de precio active una decisión de enrutamiento y no una factura inesperada.
Elija DeepSeek si una cola asíncrona y validadores sólidos convierten el descuento por horario en una ventaja real. No lo adopte como única ruta si la latencia interactiva, un costo unitario anual predecible o una relación de compras estable pesan más que el ahorro fuera de horas pico.
3. Gemini 3.7 Flash: el mejor escalamiento económico para tareas difíciles y multimodales
Gemini 3.7 Flash es el modelo que conviene añadir cuando un trabajador barato falla una y otra vez con código complejo, tareas de diseño a código o evidencia multimodal del repositorio. Google lo presenta como disponible de forma general y orientado a programación compleja, flujos de agentes y ejecución fiable de varios pasos. Acepta texto, imágenes, video, audio y PDF, y además admite ejecución de código, llamadas a funciones, salidas estructuradas, búsqueda de archivos y razonamiento bajo, medio o alto.

El precio es temporalmente agresivo. El plan Standard de pago cuesta $0.75 por entrada y $3.75 por salida hasta el 31 de diciembre de 2026. El 1 de enero de 2027, esas tarifas pasan a $1.50 y $7.50. Por eso la factura mensual normalizada sube de $1,875 a $3,750 sin que cambie el tráfico. Un presupuesto anual basado en el precio introductorio nace equivocado.
Google afirma que el modelo mejora el trabajo real de ingeniería de software y agentes, incluida la resolución de incidencias y de bucles de agente fallidos. El razonamiento medio es el nivel predeterminado y la recomendación de Google para código complejo y usos agénticos. El nivel alto puede mejorar el razonamiento difícil, pero aumenta el consumo de tokens y el costo. Eso convierte a Gemini en un modelo de escalamiento útil: la ruta se activa solo después de que un intento más barato demuestre que la tarea merece más razonamiento.
Ideal para: Investigación de errores complejos, trabajo multimodal de interfaz, auditorías de fidelidad al diseño, bucles difíciles de herramientas y una ruta temporal de mayor capacidad con presupuesto controlado
Lo más destacado: Un modelo multimodal con disponibilidad general y 1,048,576 tokens, creado para programación y agentes, con ejecución de código y razonamiento ajustable
Precio: Nivel gratuito; plan Standard de pago a $0.75 por entrada y $3.75 por salida hasta el 31 de diciembre de 2026, y después $1.50 y $7.50
Prueba gratuita: Sí, pero el contenido del nivel gratuito se usa para mejorar los productos de Google; el del nivel de pago no
- Está diseñado expresamente para programación, flujos de agentes y ejecución de varios pasos
- Acepta texto, imagen, video, audio y PDF como entrada
- Incluye ejecución de código, llamadas a funciones, salida estructurada y búsqueda de archivos
- Límite de entrada de 1,048,576 tokens y límite de salida de 65,536 tokens
- El nivel gratuito abarata la evaluación con datos depurados
- El precio introductorio del plan de pago se duplica el 1 de enero de 2027
- El contenido del nivel gratuito se usa para mejorar los productos de Google
- El razonamiento alto aumenta el consumo de tokens y el costo
- La migración exige eliminar varias opciones de generación antiguas y turnos del modelo rellenados previamente
Use Gemini para reducir los bucles fallidos
El intento supuesto de Gemini cuesta $0.1875 hasta el 31 de diciembre. Equivale a 3.35 intentos de Luna. El modelo justifica su lugar cuando una ejecución reemplaza más de 3.35 intentos baratos, cuando procesa una modalidad de entrada que la ruta habitual no admite o cuando una tarea difícil tiene suficiente impacto comercial para justificar el mayor costo del primer intento.
Una reparación de fidelidad al diseño es un caso concreto. El agente puede inspeccionar una captura de pantalla o un PDF, leer la implementación, ejecutar código y devolver un resultado estructurado. Luna también acepta imágenes, por lo que la multimodalidad por sí sola no resuelve la elección. La decisión cambia cuando la evaluación demuestra que Gemini produce más correcciones aceptadas o reduce de manera sustancial los ciclos de revisión en esa clase exacta de tarea.
El nivel gratuito sirve para evaluaciones con datos depurados, no para enviar código privado de repositorios por defecto. La página vigente de Google señala que el contenido del nivel gratuito se usa para mejorar sus productos, mientras que el contenido del nivel de pago no. Una tarifa de tokens de cero dólares no está por encima del perímetro de seguridad del código.
También existe un límite de migración. Google indica a los equipos que migren a Gemini 3.7 Flash que eliminen temperature, top_p, top_k, candidate_count y los turnos del modelo rellenados previamente, y que sustituyan thinking_budget por thinking_level. El modelo puede ser más barato que una ruta de frontera, pero los cambios de integración también forman parte del costo de cambio.
Elija Gemini cuando una categoría concreta de tareas difíciles o multimodales supere el umbral de parches aceptados. No lo use como opción habitual si Luna o DeepSeek fuera de horas pico ya aprueban, ni use su nivel gratuito para código propietario.
4. Claude Haiku 4.5: el mejor subagente económico en sistemas Claude
Claude Haiku 4.5 es el modelo económico adecuado cuando el sistema de agentes que lo rodea ya utiliza Claude y la tarea es rápida, directa y de gran volumen. Anthropic recomienda comenzar con Haiku cuando se prioriza la eficiencia, tanto en implementaciones sensibles al costo como en trabajo de subagentes. El modelo cuesta $1 por entrada y $5 por salida, ofrece una ventana de contexto de 200,000 tokens, admite razonamiento extendido y presenta la menor latencia comparativa en la matriz actual de modelos de Anthropic.

Haiku no gana la carrera general de precios. El mes normalizado cuesta $2,500, o $0.25 por intento. Eso equivale a 4.46 intentos de Luna. Un equipo que parte de cero no debería pagar ese múltiplo solo por usar una marca conocida. Un equipo estandarizado en Anthropic puede llegar a otra conclusión, porque quizá ya dispone de prompts, esquemas de herramientas, evaluaciones, observabilidad, contratos de nube y modelos alternativos.
El papel más sólido del modelo es trabajar bajo Claude Sonnet 5 u Opus 5. Haiku se ocupa del etiquetado de repositorios, la preparación de pruebas, los resúmenes de cambios, las revisiones sencillas y otras subtareas acotadas. Sonnet u Opus atienden la incertidumbre arquitectónica y el trabajo autónomo prolongado. Los precios de lista actuales de Anthropic hacen visible esa jerarquía: Sonnet 5 cuesta $2/$10, Opus 5 cuesta $5/$25 y Fable 5 cuesta $10/$50.
Ideal para: Subagentes nativos de Claude, revisión rápida, clasificación de repositorios, preparación de pruebas y trabajos directos de gran volumen
Lo más destacado: El modelo actual más rápido de Anthropic, con razonamiento extendido y una ruta directa de escalamiento a Sonnet 5 u Opus 5
Precio: $1 por entrada, $0.10 por aciertos de caché y $5 por salida, por cada 1 millón de tokens
Prueba gratuita: Los nuevos usuarios de la API reciben una pequeña cantidad de créditos gratuitos
- Se integra de forma natural con los esquemas de herramientas y las suites de evaluación de Claude existentes
- Anthropic lo recomienda para priorizar la eficiencia, el gran volumen y el trabajo de subagentes
- Los aciertos de caché cuestan una décima parte de la entrada estándar
- Se puede activar el razonamiento extendido cuando una tarea acotada exige más trabajo
- El máximo de salida de 64,000 tokens admite parches y revisiones considerables
- El costo mensual normalizado de $2,500 es el más alto entre las tarifas actuales de este ranking
- Su contexto de 200,000 tokens es mucho menor que el de las alternativas de aproximadamente 1,000,000 tokens
- Necesita 4.46x menos intentos que Luna para imponerse solo por la factura normalizada de tokens
- Su fecha de corte de conocimiento fiable, febrero de 2025, es anterior a la de los modelos Claude de frontera actuales
El límite de contexto define su función
Una ventana de 200,000 tokens basta para archivos seleccionados, una solicitud de cambio, resultados de herramientas y un ciclo de revisión. Resulta menos cómoda para un agente persistente que mantenga un repositorio grande completo y un historial extenso en un solo prompt. Ese límite refuerza el papel de subagente. Entregue a Haiku los archivos concretos y la regla de aceptación, en vez de pedirle que se haga cargo del descubrimiento, la arquitectura, la implementación y la revisión dentro de un único contexto.
La caché de prompts puede abaratar las instrucciones repetidas del repositorio. En Haiku, los aciertos de caché cuestan $0.10 por millón de tokens, una escritura en caché de cinco minutos cuesta $1.25 y una de una hora cuesta $2. El contexto estable y repetido puede amortizarse; el contexto que solo se usa una vez no. La aplicación debe registrar por separado las creaciones y lecturas de caché, en lugar de suponer que la tarifa más baja se aplica a toda la entrada.
Elija Haiku para tareas acotadas de trabajadores nativos de Claude. No lo use para autonomía sobre repositorios completos, como API económica desde cero ni para cargas en las que el contexto de 200,000 tokens obligue a reconstruirlo repetidamente.
Qué modelo conviene en cada caso
La elección es una regla de enrutamiento, no un ganador permanente. Asigne a cada modelo el trabajo más pequeño en el que pueda producir con fiabilidad un parche aceptado.

Quien tenga financiación y esté creando un producto de agentes debería empezar con Luna. Mantiene el recorrido común en $0.056 por intento supuesto y conserva una plataforma de herramientas completa. Añada Gemini solo para una clase de tarea cuya tasa de bucles fallidos justifique 3.35x el costo por intento.
Un CTO de una empresa mediana con una cola nocturna debería evaluar DeepSeek. Coloque las migraciones, la generación de pruebas y el mantenimiento apto para reintentos en las franjas fuera de horas pico. Presupueste la tarifa pico para el uso interactivo de los desarrolladores y luego decida si uno o dos proveedores dan lugar al sistema operativo más limpio.
Un profesional sénior que trabaje a la vez con capturas, PDF y código debería añadir Gemini. Sus entradas multimodales y la ejecución de código lo convierten en mejor candidato cuando la tarea incluye evidencia de interfaz o varios tipos de evidencia. Mantenga el aumento de precio de enero dentro del caso de negocio.
Un equipo de ingeniería estandarizado en Claude debería conservar Haiku en la capa de trabajadores. Reutilizar el contrato vigente de Claude puede compensar la diferencia de tokens en trabajos acotados. La familiaridad con el proveedor no debe ampliar el uso de Haiku a tareas de contexto largo o gran autonomía para las que no fue elegido.
Quien construya un proyecto técnico en solitario debería evitar una arquitectura de cuatro proveedores desde el primer día. Empiece con Luna y el modelo de frontera que ya utilice como respaldo. Añada DeepSeek solo cuando exista una cola programable, Gemini cuando falle una categoría concreta de tareas difíciles o Haiku cuando la herramienta ya requiera Claude.
La regla explícita para cambiar es sencilla: mantenga el trabajador más barato mientras cumpla el estándar de parches aceptados y revisión. Escale cuando los intentos fallidos, la carga de revisión, los límites de contexto, la modalidad o el riesgo hagan que el siguiente modelo sea más barato en términos de resultado.
Cómo se eligieron estos modelos
El ranking premia un presupuesto defendible para agentes de programación, no el token aislado más barato. Los cuatro modelos entraron porque cada uno resuelve una decisión distinta y cuenta con suficiente información vigente de primera mano para indicar precio, contexto, herramientas y límite.
La metodología aplica cinco criterios:
- Economía por parche aceptado: el gasto en tokens se normaliza con la misma carga de 10,000 tareas y después se compara con el punto de equilibrio de los reintentos.
- Plataforma de agente: las llamadas a herramientas, la salida estructurada, las operaciones sobre repositorios y las API compatibles pesan más que la calidad de chat por sí sola.
- Precio del contexto: la ventana máxima y el umbral tarifario para usarla se evalúan por separado.
- Encaje operativo: la programación, el trabajo de migración, la familiaridad con el proveedor, las condiciones de privacidad y las rutas de escalamiento pueden invertir una decisión basada solo en tokens.
- Durabilidad del precio: las tarifas por horario y los aumentos programados se incorporan al ranking desde ahora, no como notas para después.
Las páginas se verificaron el 22 de agosto de 2026. Ningún modelo se describe como probado durante esta revisión. Los resultados de producción publicados por proveedores siguen atribuidos a las empresas que los difundieron. La aportación original es la carga normalizada, el presupuesto por parche aceptado y el punto de equilibrio de reintentos calculado a partir de los precios vigentes.
La lista se limita deliberadamente a cuatro modelos. Quien elige la capa de modelo necesita precios completos, límites ante fallos y reglas de enrutamiento, no un catálogo mezclado de motores y sistemas de agentes. Cuatro decisiones de compra completas aportan más que una fila más larga de nombres.
También se excluyen los modelos locales. Una descarga local sustituye el gasto en tokens por hardware, electricidad, mantenimiento y concurrencia. La guía de modelos locales para programar cubre el aspecto del hardware, mientras que el análisis general de las API de IA más baratas aborda cargas no relacionadas con programación y la elección de gateways.
Qué conviene evitar
Evite DeepSeek sin un plan para las franjas de facturación
DeepSeek no tiene una única tarifa barata y fija. Presupueste $0.22/$0.66 fuera de horas pico y $0.44/$1.32 en horario pico. Si la aplicación no puede desplazar el trabajo, evalúelo primero con la tarifa pico. Una hoja de cálculo que aplica precios fuera de horas pico al tráfico interactivo no es un presupuesto.
Evite tratar el precio introductorio de Gemini como permanente
Gemini 3.7 Flash pasa de $0.75/$3.75 a $1.50/$7.50 el 1 de enero de 2027. La factura mensual normalizada se duplica de $1,875 a $3,750. Apruebe la ruta solo si sobrevive al precio posterior o cuenta con un sustituto documentado.
Evite un nivel gratuito para código fuente privado
Google indica que el contenido del nivel gratuito de Gemini se usa para mejorar sus productos, mientras que el del nivel de pago no. Use entradas generadas, públicas o depuradas para la evaluación gratuita. Antes de pasar a producción, traslade el código propietario a una ruta de pago cuyas condiciones estén aprobadas.
Evite un modelo de frontera como trabajador predeterminado
Claude Sonnet 5 cuesta $2/$10, Opus 5 cuesta $5/$25 y Fable 5 cuesta $10/$50. Pueden ser la opción correcta para escalar trabajos difíciles. Pagar esas tarifas por cada prueba sencilla, resumen o cambio acotado desaprovecha la oportunidad de enrutamiento creada por modelos económicos y capaces.
Evite llenar todas las ventanas de contexto
Luna admite 1,050,000 tokens, pero una solicitud que supere 272,000 tokens de entrada cambia el precio de toda la solicitud. Gemini y DeepSeek también ofrecen ventanas cercanas a 1,000,000 tokens. La calidad de la recuperación y el tamaño del contexto no son lo mismo. Añada material del repositorio porque un parche fallido demostró que faltaba, no solo porque el modelo pueda aceptarlo.
Evite medir únicamente si se aprueba o falla
Un parche puede superar las pruebas y aun así exigir una revisión larga u ocultar una decisión de diseño riesgosa. Registre los minutos de revisión, la cantidad de reintentos, las reversiones y los escalamientos junto con las pruebas. El modelo más barato es el que reduce el presupuesto completo por parche aceptado sin rebajar el estándar de ingeniería.
Lo que hay que hacer el lunes
La próxima semana, procese 100 tareas representativas con una pequeña jerarquía reversible de modelos. El objetivo no es crear un benchmark universal, sino tomar una decisión operativa sobre un repositorio y una clase de tarea concretos.
Elija una clase de tarea repetible
Use una categoría acotada, como generación de pruebas, actualizaciones de dependencias, correcciones pequeñas de errores o resúmenes de repositorios. Defina las pruebas obligatorias, el criterio de revisión y las acciones prohibidas antes de la primera llamada.
Use Luna como trabajador de referencia
Envíe cada tarea a GPT-5.6 Luna con el mínimo contexto pertinente y las herramientas necesarias. Mantenga el modelo actual más potente como escalamiento que conserve el estado después de una validación fallida o una incertidumbre identificada.
Añada un solo rival por un motivo concreto
Use DeepSeek para una cola programable fuera de horas pico, Gemini para tareas difíciles o multimodales, o Haiku para un subagente nativo de Claude. No añada todos los modelos solo porque sus API estén disponibles.
Mida el presupuesto por parche aceptado
Registre entrada, entrada en caché, salida, intentos, latencia total, pruebas, minutos de revisión, escalamiento, integración y reversión. Divida el gasto total en modelos entre los parches aceptados únicamente cuando termine la revisión.
Enrute al ganador y conserve una salida
Traslade únicamente la clase de tarea que apruebe. Conserve el modelo alternativo, los registros de contexto y el identificador del modelo para evaluar un cambio de precio, una regresión o una nueva versión sin reconstruir el flujo de trabajo.
Esa es la consecuencia de disponer de modelos más baratos para agentes: una empresa ya no necesita que un único modelo costoso se ocupe de cada línea de trabajo. La tarea del lunes es convertir la pila de modelos en una jerarquía laboral medida, con un trabajador barato, una regla precisa de escalamiento y un presupuesto por parche aceptado que el equipo financiero pueda auditar.
Preguntas frecuentes
¿Cuál es el modelo de IA más barato para programar?
DeepSeek V4 Flash es el más barato fuera de horas pico entre estos cuatro modelos, con $0.22 por entrada y $0.66 por salida por millón de tokens. GPT-5.6 Luna cuesta menos durante las horas pico de DeepSeek con la carga normalizada de agentes de programación, así que la hora y la tasa de reintentos deciden la respuesta.
¿Cuál es el mejor agente de IA para programar con poco presupuesto?
Separe la infraestructura del agente y el modelo. Use un agente competente con GPT-5.6 Luna como trabajador habitual, mantenga un modelo más potente para escalamientos y mida el costo por parche aceptado en vez de elegir un agente solo por el precio mensual de su licencia.
¿Qué IA es totalmente gratis para programar?
Gemini 3.7 Flash tiene un nivel gratuito y Replit ofrece por separado un modo gratuito impulsado por Luna. Lo gratuito sigue sujeto a cuotas, límites del producto y condiciones de datos; el contenido del nivel gratuito de Google se usa para mejorar sus productos, por lo que el código propietario debe ir por una ruta de pago aprobada.
¿Cuál es el mejor modelo de IA local para programar en 2026?
Este ranking cubre API alojadas de bajo costo. Para una instalación local, la comparativa específica de modelos locales para programar analiza los compromisos entre hardware y capacidad; los modelos locales empiezan sin una factura por tokens, pero siguen necesitando memoria, electricidad, mantenimiento y un sistema de agentes seguro.
Descargue la lista de verificación para auditar flujos de trabajo empresariales con IA y convierta esta jerarquía de modelos en una evaluación de enrutamiento de una semana.
2 sept 2026






