La mejor IA para programar en local en 2026: comparativa de Qwen3.6, Devstral Small 2 y GLM-4.7-Flash

Comparamos la mejor IA para programar en local en 2026 según memoria, tareas y costo: Qwen3.6-27B, Devstral Small 2, GLM-4.7-Flash y otros modelos.

Thursday, September 3, 2026Omid Saffari
La mejor IA para programar en local en 2026: comparativa de Qwen3.6, Devstral Small 2 y GLM-4.7-Flash

Qwen3.6-27B es la mejor IA para programar en local para la mayoría de los desarrolladores en 2026, pero los 17 GB que ocupa su paquete de Ollama son apenas el punto de partida del consumo de memoria. Si la única razón para comprar hardware es evitar una suscripción mensual de $10 a Copilot Pro, una RTX 5090 de $1,999 tarda 199.9 meses en amortizarse, y eso sin contar la electricidad, el resto de la estación de trabajo ni el tiempo invertido.

Respuesta rápida: elija el modelo que su memoria pueda sostener

Elija Qwen3.6-27B si dispone de una GPU o un equipo con memoria unificada de 24 GB y busca un único modelo local sólido para trabajar con repositorios, utilizar herramientas y resolver tareas cotidianas. Elija Devstral Small 2 si la tarea consiste específicamente en ingeniería de software sobre varios archivos y el equipo cumple la recomendación de Mistral: una sola RTX 4090 o una Mac con 32 GB. Opte por GLM-4.7-Flash si quiere un modelo de agentes eficiente y acepta trabajar con un ecosistema de ejecución local menos maduro. Reserve Qwen3-Coder-Next para un equipo de 64 GB o un servidor compartido. En un sistema de 8 GB, use Qwen3.5-9B para cambios acotados, sin pretender que actúe como un ingeniero autónomo sobre todo el repositorio.

Los precios, las fichas de los modelos, los datos de memoria de los entornos de ejecución y las licencias que aparecen a continuación se verificaron en las páginas activas de los proveedores el 15 de agosto de 2026.

HerramientaIdeal paraPrecio inicialPrueba gratuita
Qwen3.6-27BMejor opción general en un equipo de 24 GB$0 en local mediante LM StudioNo hace falta; nivel local gratuito
Devstral Small 2Agentes de programación centrados en varios archivos$0 en local mediante LM StudioNo hace falta; nivel local gratuito
GLM-4.7-FlashExperimentos eficientes con agentes$0 en local mediante LM StudioNo hace falta; nivel local gratuito
Qwen3-Coder-NextUn servidor local de agentes con 64 GB$0 en local mediante LM StudioNo hace falta; nivel local gratuito
Qwen3.5-9BFragmentos de código y cambios acotados en hardware de 8 GB$0 en local mediante LM StudioNo hace falta; nivel local gratuito

La clasificación sigue una regla que prioriza el ajuste: primero, la memoria acelerada o unificada disponible; después, el flujo de programación; y, por último, la puntuación en benchmarks. Este orden evita el error más habitual al comprar hardware para IA local. Que el archivo de un modelo quepa en memoria no significa que quede espacio suficiente para una ventana de contexto útil, el entorno de ejecución, el sistema operativo y el agente que le entrega archivos y resultados de herramientas.

Hay tres cifras que parecen equivalentes, pero describen límites distintos:

  1. Tamaño del paquete: es la descarga cuantizada del modelo. Ollama indica que el paquete qwen3.6:27b ocupa 17 GB.
  2. Memoria mínima del sistema: es el umbral necesario para cargar el modelo en el entorno de ejecución. LM Studio señala 16 GB para el mismo modelo, pero un mínimo no equivale a una configuración cómoda.
  3. Memoria de contexto: aumenta a medida que crecen la conversación, los archivos de código fuente, la salida de comandos y el historial de herramientas. Qwen recomienda expresamente reducir el contexto tras un error por falta de memoria, aunque el modelo admita una ventana nativa mucho mayor.

Piense en el archivo del modelo como una persona que entra en un ascensor. Poder cruzar la puerta solo demuestra que cabe dentro. Un agente de programación también necesita espacio para el equipaje: el contexto del repositorio, los tokens generados, los búferes del entorno de ejecución y las herramientas que lo rodean. Llenar el ascensor hasta su límite declarado no es una buena forma de planificar una jornada de trabajo.

Diagrama de decisión que asigna cinco modelos de programación a equipos locales de 8 GB, 24 GB y 64 GB
Empiece por la memoria disponible y elija después el comportamiento de programación que necesita

Si lo que busca es la experiencia completa de editor, revisión y agente en la nube, y no solo el modelo subyacente, compare los asistentes de IA para programar actuales. Un modelo local es apenas una pieza. No incorpora automáticamente indexación de repositorios, controles de permisos, una interfaz para revisar parches, aislamiento ni un ejecutor seguro de comandos.

1. Qwen3.6-27B: la mejor IA para programar en local

Qwen3.6-27B es la mejor opción predeterminada porque reúne programación con agentes, uso de herramientas, entrada visual y razonamiento sobre repositorios actuales en un paquete de Ollama de 17 GB. Está pensado para quien quiere usar un solo modelo para inspeccionar un monorepo de TypeScript, explicar una prueba fallida, preparar un parche y razonar sobre la lógica de producto relacionada sin cambiar de modelo. El límite real es el margen de memoria: el mínimo de 16 GB que marca LM Studio y el paquete de 17 GB de Ollama no convierten un equipo de 16 GB en una estación cómoda para programar con contextos largos. Compre o reserve memoria en función del contexto que utilizará, no de la cifra más pequeña de la página de descarga.

Página del modelo Qwen3.6-27B en LM Studio
Qwen3.6-27B

La ficha oficial del modelo de Qwen describe un modelo de 27B parámetros con una ventana de contexto nativa de 262,144 tokens, ampliable a 1,010,000 tokens. También menciona programación con agentes, uso de herramientas, flujos de frontend, razonamiento sobre repositorios, entrada visual y conservación del contexto de razonamiento a lo largo de los mensajes anteriores. Son capacidades valiosas para un agente de programación porque una tarea de repositorio rara vez termina con una sola respuesta. El modelo debe recordar por qué eligió un enfoque después de que se incorporen a la conversación pruebas, registros y nuevos archivos.

El listado actual de etiquetas de Ollama vuelve práctica esta versión: qwen3.6:27b es una descarga de 17 GB con un contexto anunciado de 256K. El paquete NVFP4 orientado a programación ocupa 20 GB. LM Studio señala una memoria mínima del sistema de 16 GB, pero esa cifra solo indica el umbral de carga. En una GPU o un equipo con memoria unificada de 24 GB, el paquete de 17 GB deja bastante más margen para el contexto y la sobrecarga del entorno de ejecución. Con 16 GB, conviene empezar con menos contexto o con un modelo más pequeño.

El principal resultado de benchmark es sólido, pero debe leerse junto con su método. Qwen informa de 77.2 en SWE-bench Verified, 53.5 en SWE-bench Pro, 71.3 en SWE-bench Multilingual y 59.3 en Terminal-Bench 2.0. Para SWE-bench utilizó una infraestructura interna de agente con herramientas de bash y edición de archivos, además de una ventana de contexto de 200K. Terminal-Bench se ejecutó con una ventana de 256K en un entorno con 32 CPU y 48 GB de RAM. Estas cifras demuestran capacidad bajo la configuración de Qwen; no prometen el mismo resultado ni la misma velocidad en un equipo de escritorio de 24 GB.

La documentación del proveedor incluye otra advertencia sobre el contexto. Qwen aconseja reducirlo cuando se produce un error por falta de memoria y, al mismo tiempo, recomienda al menos 128K de contexto para conservar la capacidad de razonamiento en tareas complejas. Esa tensión marca el límite conocido del modelo. Puede ofrecer una ventana de 256K, pero un equipo local compacto quizá obligue a utilizar solo una parte.

Ideal para: Desarrolladores con una GPU o un equipo de memoria unificada de 24 GB que buscan un modelo local amplio para programar

Lo más destacado: Un paquete de 17 GB instalable con un clic, uso actual de herramientas, razonamiento sobre repositorios y una puntuación de 77.2 en SWE-bench Verified comunicada por el proveedor

Precio: $0 mediante el nivel local Free de LM Studio, verificado el 15 de agosto de 2026

Prueba gratuita: No corresponde; tanto el nivel de ejecución local como la descarga del modelo son gratuitos

Lo bueno
Lo que hace bien
9 points

  • La mejor combinación de esta selección entre tamaño del paquete, razonamiento general y capacidad como agente de programación
  • Está entrenado para usar herramientas y conservar el contexto de razonamiento durante una interacción de varios pasos
  • La entrada visual resulta útil cuando una tarea de programación incluye capturas de pantalla o estados de una interfaz
  • Está disponible como paquete de Ollama de 17 GB y como modelo de LM Studio instalable con un clic
  • Benchmarks sólidos de repositorios y terminal comunicados por el proveedor, con detalles del entorno de evaluación
  • Un mínimo de 16 GB no deja un margen cómodo para contextos de programación largos
  • La ventana anunciada de 256K difícilmente sea el punto de partida razonable en un equipo con memoria ajustada
  • La infraestructura y el hardware del benchmark del proveedor difieren de una configuración de escritorio habitual
  • Un modelo generalista de agentes puede estar menos enfocado que Devstral en ingeniería de software pura sobre varios archivos

Cómo configurar Qwen3.6-27B sin confundir el contexto máximo con el recomendado

  1. Compruebe la memoria antes de descargar

    Anote la VRAM o la memoria unificada disponible, no solo el espacio total en disco. Considere 24 GB como el punto de partida práctico para el paquete de 17 GB. Si el equipo solo tiene 8 GB, pase directamente a Qwen3.5-9B.

  2. Instale LM Studio y elija el modelo exacto

    Instale LM Studio en un equipo compatible con Apple Silicon, Windows o Linux. Busque Qwen3.6-27B, confirme que el editor sea Qwen y seleccione una cuantización cuyo tamaño visible deje margen de trabajo.

  3. Empiece por debajo del contexto máximo

    No arranque con 256K solo porque el modelo los admita. Comience con un contexto suficiente para una tarea representativa del repositorio, supervise el uso de memoria y auméntelo únicamente cuando los archivos adicionales mejoren el parche más de lo que ralentizan o desestabilizan la ejecución.

  4. Conecte el servidor local a un único agente de programación

    Active el servidor local de LM Studio y dirija hacia él un cliente de programación compatible con OpenAI. Mantenga el servidor vinculado al equipo local salvo que haya añadido de forma deliberada autenticación de red y controles de acceso.

  5. Pruebe una tarea de repositorio acotada

    Utilice un error con una prueba fallida conocida, un cambio pequeño en varios archivos y una tarea de explicación. Revise cada comando y cada diff propuesto. Registre los parches aceptados, el tiempo de corrección, el pico de memoria y si el modelo perdió restricciones anteriores.

2. Devstral Small 2: el mejor agente local dedicado a programar

Devstral Small 2 es la opción especializada para quien necesita que el modelo explore una base de código, edite varios archivos y trabaje con herramientas de ingeniería de software. Mistral diseñó este modelo de 24B para programación con agentes, en lugar de presentarlo como un asistente general que también genera código. Un equipo que mantenga un servicio grande en Python puede asignarle una incidencia acotada, permitir que el entorno busque y edite, y después revisar un parche coherente sobre varios archivos. Su límite está en la diferencia entre cargar el modelo y trabajar con comodidad: LM Studio indica un mínimo de 16 GB, mientras que Mistral recomienda para el despliegue local una sola RTX 4090 o una Mac con 32 GB de RAM.

Página del modelo Devstral Small 2 en LM Studio
Devstral Small 2

La ficha oficial de Mistral asigna a Devstral Small 2 una ventana de contexto de 256K, entrada visual y uso de herramientas para explorar repositorios y editar varios archivos. Además, emplea la licencia Apache 2.0, lo que ofrece a los equipos comerciales un punto de partida más claro para utilizarlo y modificarlo que una publicación comunitaria con términos ambiguos. El código y el despliegue que lo rodean aún pueden requerir una revisión legal, pero la licencia del modelo es explícita.

Mistral comunica 68.0% en SWE-bench Verified, 55.7% en SWE-bench Multilingual y 22.5% en Terminal Bench 2. En dos benchmarks coincidentes, estas puntuaciones quedan por debajo de las cifras principales que publica Qwen3.6, pero la clasificación bruta no resuelve toda la elección. El alcance de Devstral es más estrecho y fácil de explicar: es un modelo de agente de ingeniería de software, creado para usar herramientas, inspeccionar código y editar archivos.

La recomendación de memoria debería resolver la duda sobre el hardware. LM Studio señala 16 GB como mínimo, pero Mistral afirma que el modelo es lo bastante ligero para una sola RTX 4090 o una Mac con 32 GB. Si va a comprar hardware, siga la recomendación concreta del equipo. La cifra menor solo demuestra que un archivo cuantizado puede cargarse, no que una ejecución larga del agente conservará el contexto deseado.

Ideal para: Un agente dedicado a programar en varios archivos desde una única estación de trabajo de gama alta

Lo más destacado: Entrenamiento explícito como agente de ingeniería de software, contexto de 256K, visión y licencia Apache 2.0

Precio: $0 mediante el nivel local Free de LM Studio, verificado el 15 de agosto de 2026

Prueba gratuita: No corresponde; tanto el nivel de ejecución local como la descarga del modelo son gratuitos

Lo bueno
Lo que hace bien
9 points

  • Está diseñado específicamente para explorar bases de código y editar varios archivos mediante herramientas
  • Mistral indica una sola RTX 4090 o una Mac con 32 GB como objetivo de despliegue local
  • La licencia Apache 2.0 es clara para usos comerciales y no comerciales
  • El contexto de 256K y la entrada visual permiten abordar tareas de ingeniería más completas
  • Su enfoque específico en programación facilita justificar por qué elegirlo
  • El mínimo de 16 GB del entorno de ejecución no refleja el hardware que Mistral recomienda para uso local
  • El resultado de SWE-bench Verified comunicado por el proveedor queda por debajo del publicado para Qwen3.6
  • Terminal Bench 2 sigue siendo un área más difícil en la propia tabla de Mistral
  • En un único equipo, los contextos largos siguen compitiendo con la memoria del modelo

3. GLM-4.7-Flash: la mejor opción eficiente de mezcla de expertos

GLM-4.7-Flash es la opción para experimentar con eficiencia: un modelo de mezcla de expertos de 30B que activa 3B parámetros por token y cuyo paquete de Ollama ocupa 19 GB. Encaja con quien busca funciones de agente en un equipo de 24 GB y está dispuesto a validar una vía de ejecución más reciente antes de estandarizarla para todo un equipo. Z.ai comunica resultados de programación competitivos para su tamaño, y LM Studio ofrece controles de herramientas y razonamiento. El límite es la madurez de la integración: la ficha oficial indica que la compatibilidad con vLLM y SGLang dependía de sus ramas principales, una advertencia para los entornos de producción que prefieren versiones estables fijadas.

Página del modelo GLM-4.7-Flash en LM Studio
GLM-4.7-Flash

Un modelo de mezcla de expertos almacena muchos grupos de parámetros, pero solo activa una parte de ellos con cada token. La cifra de 3B activos ayuda a entender la eficiencia de cómputo; no convierte el modelo en una descarga de 3B. La página de etiquetas de Ollama indica que el paquete Q4 ocupa 19 GB, mientras que LM Studio señala una memoria mínima del sistema de 16 GB y un contexto de 128K. El tamaño del paquete es el recordatorio más útil para planificar la memoria acelerada.

La ficha oficial del modelo de Z.ai comunica 59.2 en SWE-bench Verified y 64.0 en LiveCodeBench v6. El modelo está entrenado para utilizar herramientas y ofrece controles de razonamiento mediante LM Studio. Puede ser un modelo local de agentes convincente cuando importa el rendimiento por parámetro activo, pero las evaluaciones siguen siendo cifras del proveedor y el ecosistema de ejecución merece una prueba piloto.

Para un pequeño equipo de plataforma interno, el caso de uso razonable es un único servicio local detrás de un cliente de programación, fijado a un archivo de modelo y a una versión del entorno de ejecución conocidos. Pruebe la búsqueda en repositorios, la generación de parches, la interpretación de llamadas a herramientas y las salidas largas antes de ofrecer un endpoint compartido. Si el equipo no puede reproducir el entorno después de una actualización, la mejora de eficiencia no se ha convertido en una ventaja operativa.

Ideal para: Quienes prueban un modelo de agentes eficiente en un equipo de 24 GB

Lo más destacado: 30B parámetros totales, 3B activos por token, entrenamiento para herramientas y un paquete de Ollama de 19 GB

Precio: $0 mediante el nivel local Free de LM Studio, verificado el 15 de agosto de 2026

Prueba gratuita: No corresponde; tanto el nivel de ejecución local como la descarga del modelo son gratuitos

Lo bueno
Lo que hace bien
9 points

  • Arquitectura eficiente de mezcla de expertos con solo 3B parámetros activos por token
  • El paquete Q4 de Ollama de 19 GB encaja en el nivel práctico de 24 GB
  • El entrenamiento para herramientas y los controles de razonamiento resultan adecuados para experimentar con agentes
  • Los benchmarks de programación comunicados por el proveedor son competitivos para esta categoría de despliegue
  • La disponibilidad en LM Studio con un clic reduce el esfuerzo de la primera ejecución
  • Los parámetros activos no reducen el modelo almacenado a 3 GB
  • Las instrucciones oficiales para vLLM y SGLang dependían de compatibilidad en la rama principal
  • LM Studio y Ollama muestran contextos distintos, por lo que hay que comprobar la configuración del entorno de ejecución
  • Un paquete de 19 GB deja poco margen en un dispositivo de 20 GB

4. Qwen3-Coder-Next: la mejor opción para un servidor local de 64 GB

Qwen3-Coder-Next es el especialista para un servidor local con memoria abundante, no el modelo económico que podría sugerir la etiqueta de 3B activos. Qwen lo diseñó específicamente para agentes de programación y desarrollo local, con razonamiento a largo plazo, uso complejo de herramientas y recuperación tras fallos de ejecución. Tiene sentido para un pequeño equipo de plataforma que centraliza un endpoint local y controlado para agentes cuando dispone de 64 GB de memoria unificada o del sistema. Su límite es físico: el paquete Q4 actual de Ollama ocupa 52 GB, de modo que una GPU habitual para desarrollo de 24 GB no es su objetivo.

Página del modelo Qwen3-Coder-Next en LM Studio
Qwen3-Coder-Next

La ficha del modelo Qwen describe 80B parámetros totales con 3B activos por token, un contexto nativo de 262,144 tokens y funcionamiento exclusivo sin modo de razonamiento. Su entrenamiento se centra en el trabajo de agentes de programación, no solo en completar código estático. Qwen destaca expresamente las tareas a largo plazo, el uso de herramientas, la integración con IDE y CLI, y la recuperación después de un fallo de ejecución.

La descarga cuenta toda la historia del hardware. Ollama indica que el paquete Q4 ocupa 52 GB y el Q8, 85 GB; ambos muestran un contexto de 256K. LM Studio fija una memoria mínima del sistema de 42 GB. Planificar 64 GB para Q4 deja algo de espacio para el sistema operativo y un contexto reducido, pero aun así no garantiza que resulte cómodo utilizar toda la ventana nativa.

Qwen reconoce ese límite. Su guía oficial recomienda reducir el contexto a 32,768 si el servidor no arranca o se queda sin memoria. Es una instrucción de despliegue más útil que el tamaño máximo del contexto. Una sesión estable de 32,768 tokens que edite y pruebe los archivos correctos vale más que una casilla de 256K que provoque fallos constantes.

Que el modelo funcione sin modo de razonamiento también puede ser una ventaja o una limitación. Evita mostrar una fase de razonamiento larga y puede agilizar la interacción, pero quien busque expresamente razonamiento persistente debería elegir Qwen3.6 o evaluar otro modelo. Compartir el nombre Qwen no implica que su comportamiento sea idéntico.

Ideal para: Un servidor local de 64 GB que atienda una o unas pocas cargas controladas de agentes de programación

Lo más destacado: Especialización en agentes de programación con 80B parámetros totales, 3B activos por token y entrenamiento orientado a recuperarse de fallos

Precio: $0 mediante el nivel local Free de LM Studio, verificado el 15 de agosto de 2026

Prueba gratuita: No corresponde; tanto el nivel de ejecución local como la descarga del modelo son gratuitos

Lo bueno
Lo que hace bien
9 points

  • Diseñado específicamente para agentes de programación y desarrollo local
  • Su entrenamiento pone el foco en tareas a largo plazo, uso de herramientas y recuperación ante fallos
  • Solo activa 3B parámetros por token pese a almacenar un total de 80B
  • Disponible tanto en LM Studio como en Ollama
  • Es un candidato sólido para un endpoint local centralizado y con memoria abundante
  • El paquete Q4 de 52 GB descarta las GPU habituales de 24 GB
  • El mínimo de 42 GB que marca LM Studio deja poco espacio para el contexto en un sistema de 48 GB
  • Utilizar todo el contexto de 256K puede exigir una planificación agresiva de memoria
  • Solo funciona sin modo de razonamiento, a diferencia de los controles de Qwen3.6

5. Qwen3.5-9B: la mejor opción para hardware de 8 GB

Qwen3.5-9B es la elección sensata para equipos pequeños cuando se necesitan explicaciones, fragmentos de código, generación de pruebas y cambios muy acotados. LM Studio indica un mínimo de 7 GB, por lo que puede servir a un desarrollador con un equipo de 8 GB incapaz de alojar los paquetes anteriores, que ocupan entre 17 GB y 52 GB. Su ficha incluye razonamiento, herramientas, visión y capacidades de agente, lo que le da más versatilidad que un modelo antiguo dedicado solo al autocompletado. El límite es el alcance: se trata de un modelo fundacional general de 9B, no de una autorización para entregar un repositorio entero a un agente sin supervisión.

Página del modelo Qwen3.5-9B en LM Studio
Qwen3.5-9B

La ficha oficial de Qwen3.5-9B atribuye al modelo denso un contexto nativo de 262,144 tokens, ampliable a 1,010,000 tokens. Qwen comunica 65.6 en LiveCodeBench v6, 66.1 en BFCL-V4 y 79.1 en TAU2-Bench. LiveCodeBench mide la generación de código, mientras que BFCL y TAU2 examinan el uso de herramientas y el comportamiento como agente; ninguno equivale a resolver una incidencia concreta de un repositorio mediante su entorno de programación.

El dato máximo de contexto exige la misma prudencia que en los modelos grandes. Qwen recomienda reducirlo tras un error por falta de memoria y aconseja al menos 128K para conservar el razonamiento en tareas complejas. Es poco probable que un equipo de 8 GB ejecute el modelo con tanto contexto de trabajo de manera cómoda. Use un contexto moderado, proporcione solo los archivos necesarios y prefiera una secuencia de cambios revisables frente a una ejecución autónoma prolongada.

Un buen caso de uso sería ayudar a un desarrollador a entender una función desconocida: se proporcionan la función, sus pruebas y las definiciones de tipos pertinentes; se solicita una explicación y un parche mínimo; y luego se ejecutan las pruebas manualmente. Un mal caso sería pedir al modelo que inspeccione un monorepo grande, rediseñe la arquitectura, modifique decenas de archivos y se recupere de los fallos sin supervisión. El modelo pequeño gana porque está disponible, no porque elimine el costo de la complejidad.

Ideal para: Fragmentos de código, explicaciones, pruebas y diffs acotados en un equipo de 8 GB

Lo más destacado: Mínimo de 7 GB en LM Studio con capacidades actuales de razonamiento, visión y herramientas

Precio: $0 mediante el nivel local Free de LM Studio, verificado el 15 de agosto de 2026

Prueba gratuita: No corresponde; tanto el nivel de ejecución local como la descarga del modelo son gratuitos

Lo bueno
Lo que hace bien
9 points

  • El requisito mínimo de memoria documentado más bajo entre las cinco opciones
  • Capacidades actuales de herramientas, agentes, visión y razonamiento
  • Útil para fragmentos privados y asistencia sin conexión en equipos compactos
  • Rendimiento de generación de código sólido para un modelo de 9B, según las cifras del proveedor
  • Resulta más fácil mantener una respuesta ágil con un prompt acotado y unos pocos archivos relevantes
  • No es la mejor opción para un trabajo autónomo prolongado sobre repositorios
  • En un equipo de 8 GB, el gran contexto anunciado queda limitado por el hardware
  • Su entrenamiento generalista está menos enfocado que el objetivo de ingeniería de software de Devstral
  • Los modelos pequeños exigen límites de tarea más estrictos y mayor revisión humana

¿Qué modelo conviene en cada caso?

La elección se simplifica cuando se consideran juntos la memoria y el tipo de trabajo.

En una Mac de 8 GB o un equipo pequeño similar: elija Qwen3.5-9B y mantenga un contexto moderado. Los requisitos del sistema de LM Studio recomiendan a quienes usan una Mac de 8 GB limitarse a modelos más pequeños y contextos modestos. Cabe esperar explicaciones útiles, fragmentos de código y diffs limitados, no trabajo autónomo sobre todo un repositorio.

En un equipo de 16 GB: no dé por ganador al modelo más grande que apenas logre cargar. Tanto Qwen3.6 como Devstral tienen un mínimo de 16 GB en LM Studio, pero apenas dejan espacio libre alrededor del modelo. Una cuantización menor, Qwen3.5-9B o una prueba con poco contexto son puntos de partida más seguros.

En una GPU o un equipo con memoria unificada de 24 GB: Qwen3.6-27B es la opción predeterminada. Devstral Small 2 pasa al primer puesto cuando casi toda la carga consiste en ingeniería de software sobre varios archivos. GLM-4.7-Flash lo hace cuando la eficiencia de su mezcla de expertos compensa la validación adicional del entorno de ejecución.

En una Mac de 32 GB o una estación con una RTX 4090: Devstral Small 2 presenta el ajuste más claro respaldado por el proveedor. Qwen3.6 sigue siendo el asistente más versátil, así que la decisión enfrenta un agente de programación especializado con un modelo de razonamiento y visión más amplio.

En un equipo o servidor local de 64 GB: Qwen3-Coder-Next se vuelve viable. Su paquete Q4 de 52 GB aún exige presupuestar el contexto, y el servidor necesita un plan de acceso y concurrencia. Que un modelo sea local no significa que deba exponerse mediante un endpoint sin autenticación a toda la red de la oficina.

La regla para desempatar es sencilla: si caben dos modelos, elija el que haya sido entrenado para la tarea más parecida; si solo uno deja margen, elija el que deja margen. Ningún puesto en un benchmark salvará a un modelo que pase la jornada intercambiando memoria, fallando o trabajando con demasiado poco contexto para entender el cambio.

El punto de equilibrio frente a una suscripción: cuándo incluir el hardware en el presupuesto

Los pesos locales parten de $0, pero programar en local no sale gratis. El gasto pasa de la suscripción al hardware, la electricidad, la configuración, las actualizaciones, el control de acceso y el tiempo de los desarrolladores. Si el equipo ya está disponible, la decisión cambia. Si se compra exclusivamente para ejecutar inferencia local, debe justificar su propia partida presupuestaria.

El nivel Free de LM Studio cuesta $0, ejecuta modelos locales en el equipo del usuario y afirma que ningún dato sale del dispositivo. Su documentación del sistema indica que la aplicación puede funcionar por completo sin conexión una vez descargados los archivos del modelo. Esa privacidad y esa independencia de la red pueden justificar la inferencia local incluso cuando la comparación de suscripciones no lo haga. Pueden ser importantes al trabajar con código fuente aún no publicado, en lugares sin conectividad estable o para un equipo que necesite disponer del modelo al margen de las interrupciones de un proveedor.

La comparación presupuestaria más clara utiliza precios públicos de lista, no una promesa sobre el costo total. NVIDIA lanzó la RTX 5090 de 32 GB con un precio inicial de $1,999. Los planes individuales actuales de GitHub sitúan Copilot Free en $0, Pro en $10 por usuario al mes, Pro+ en $39 y Max en $100. El precio para organizaciones es de $19 por usuario al mes para Business y $39 para Enterprise.

  • Una suscripción Pro de $10 tarda 199.9 meses, unos 16.7 años, en igualar el precio inicial de una GPU de $1,999.
  • Diez suscripciones Business cuestan $190 al mes. El precio de lista de la GPU equivale a 10.5 meses de esa partida.
  • Diez suscripciones Enterprise cuestan $390 al mes. El precio de lista de la GPU equivale a 5.1 meses de esa partida.
Comparación de costos entre una RTX 5090 de 1999 dólares y diez suscripciones Copilot Business y Enterprise
El hardware alcanza el costo de una suscripción de equipo mucho antes que el de una individual, sin incluir los gastos operativos

Esta consecuencia resulta más útil que una especificación de lanzamiento. No compre una GPU de gama alta únicamente para eliminar una suscripción de $10 en la nube. Cómprela porque el código debe mantenerse dentro de un perímetro local, porque trabajar sin conexión aporta valor operativo, porque el hardware ya existe o porque un equipo puede compartir la capacidad sin convertir una máquina en una cola de espera.

Las suscripciones en la nube también incluyen más que inferencia. Un plan de asistente de programación puede ofrecer modelos alojados, integración con el editor, agentes en la nube, revisión de código, identidad, políticas y soporte. Descargar un modelo local no aporta por sí solo ninguno de esos controles. Si la comparación adecuada es la inferencia por uso y no una suscripción, el análisis de las API de IA más baratas explica por qué el precio por token es apenas una parte del costo de una aplicación.

Por eso, la decisión inmediata es asimétrica. Un desarrollador independiente que ya tenga una GPU de 24 GB debería probar Qwen3.6 antes de pagar por otro servicio. Si no cuenta con hardware adecuado, conviene empezar con una suscripción en la nube o con Qwen3.5 en el equipo actual. Un equipo de diez personas con código sensible debería probar durante dos semanas un servidor compartido y medir la concurrencia, los parches aceptados, el tiempo de corrección y las horas de operación antes de comprar una flota.

Cómo se eligieron estos modelos de IA local para programar

Los cinco modelos responden a una decisión que un desarrollador puede poner en práctica hoy, no a la intención de crear la lista más larga posible. Cada opción ocupa un nivel de memoria o un tipo de tarea distinto y cuenta con documentación suficiente para identificar en qué equipo o flujo deja de ser la elección correcta.

Se utilizaron seis criterios para establecer el orden:

  1. Disponibilidad local: el modelo debe tener una ficha oficial vigente y una publicación actual en LM Studio u Ollama que pueda instalarse con un clic.
  2. Ajuste al hardware: se consideran en conjunto el tamaño del paquete, la memoria mínima, la presión del contexto y el equipo recomendado expresamente por el proveedor.
  3. Comportamiento como agente de programación: el uso de herramientas, los cambios en varios archivos, el razonamiento sobre repositorios, la recuperación ante fallos y la compatibilidad con entornos de programación importan más que el autocompletado por sí solo.
  4. Madurez operativa: se valoran un entorno de ejecución reproducible y unas instrucciones claras ante la falta de memoria. Depender de la rama principal para ejecutar el modelo supone un costo, aunque los pesos sean gratuitos.
  5. Condiciones actuales: los precios y las licencias proceden de páginas activas de los proveedores. Una licencia clara aporta una ventaja importante en un despliegue comercial.
  6. Evidencia transparente: los benchmarks de los proveedores solo resultan útiles si incluyen su alcance y entorno de evaluación. Las puntuaciones obtenidas con infraestructuras distintas no se tratan como una clasificación perfectamente comparable.

Durante este análisis no se ejecutó ningún modelo; por eso el título dice comparados, no probados. La clasificación utiliza fichas actuales de los modelos, páginas de los entornos de ejecución, métodos de evaluación declarados y un análisis original de costos. Un benchmark del proveedor y un parche aceptado en su repositorio siguen siendo pruebas de naturaleza distinta.

La lista descarta modelos impresionantes que no son prácticos en una estación de trabajo actual. Un modelo de 480B puede tener pesos abiertos y admitir autoalojamiento, pero aun así ser una respuesta equivocada para quien pregunta qué puede ejecutar en local. También se excluyen modelos sin un paquete local actual y reproducible, o que solo pueden describirse con elogios genéricos.

Modelos y enfoques que conviene evitar para esta tarea

Evite presentar modelos gigantes como opciones locales corrientes. Los modelos insignia más grandes de Qwen3-Coder, Kimi y GLM pueden ser abiertos y autoalojables, pero eso no los convierte en recomendaciones para una sola estación de trabajo. Sin una cuantización exacta, un plan de memoria, un entorno de ejecución y un objetivo de concurrencia, «local» solo describe una posibilidad de despliegue.

Evite decidir únicamente por el número de parámetros activos. GLM-4.7-Flash y Qwen3-Coder-Next activan 3B parámetros por token, pero sus paquetes cuantizados de Ollama ocupan 19 GB y 52 GB. La computación activa y los pesos almacenados responden preguntas diferentes. La GPU todavía debe alojar o mover el paquete que ejecuta.

Evite adoptar Code Llama o StarCoder2 como opción predeterminada en una instalación nueva. Los modelos de código antiguos aún pueden servir en un flujo fijado, sobre todo si el equipo ya conoce bien su comportamiento. Para una configuración nueva en 2026, los modelos actuales entrenados como agentes incorporan uso de herramientas, contextos más largos y entrenamiento orientado a la recuperación, capacidades que encajan mejor con el funcionamiento de los agentes de programación.

Evite usar una cuantización comunitaria experimental como base para todo el equipo. Una compilación comunitaria puede ser excelente, pero antes de que varios desarrolladores dependan de ella hay que registrar el archivo exacto, la cuantización, la plantilla de prompt, la versión del entorno de ejecución, la licencia y la suma de comprobación. Si el resultado no se puede reproducir después de una actualización, la configuración local habrá sustituido la dependencia del proveedor por la dependencia de un artefacto.

Evite el contexto máximo desde el primer día. Que la página de un modelo muestre 256K no implica que haya que asignar 256K en cada tarea. Empiece con el contexto más pequeño que contenga el código pertinente y el historial de herramientas. Amplíelo cuando un parche fallido demuestre que faltaba información, no solo porque un control permita hacerlo.

Preguntas frecuentes

¿Cuál es el mejor modelo de IA para programadores?

Para una configuración local, Qwen3.6-27B es la mejor opción general en un equipo de 24 GB. Devstral Small 2 resulta superior cuando la carga consiste específicamente en ingeniería de software sobre varios archivos, mientras que un modelo gestionado en la nube todavía puede ser el sistema más adecuado si la concurrencia, el mantenimiento o las herramientas alojadas son la principal restricción.

¿Cuál es la mejor IA para programar en local en 2026?

Qwen3.6-27B es la mejor opción general porque su paquete de Ollama de 17 GB combina capacidades actuales de agente de programación con razonamiento amplio y visión. Use Devstral Small 2 como agente especializado en código, Qwen3-Coder-Next en un servidor de 64 GB y Qwen3.5-9B en un equipo de 8 GB.

¿Cuál es el mejor modelo de IA local ahora mismo?

El mejor modelo es el más potente que aún deje memoria para un contexto útil y el entorno de ejecución. Qwen3.6-27B gana en el nivel habitual de 24 GB; Qwen3.5-9B puede ser mejor en un equipo de 8 GB porque funciona con un contexto aprovechable en vez de limitarse a cargar.

¿Cuál es el mejor modelo de IA autoalojado para programar?

Qwen3-Coder-Next es la opción especializada para un servidor local de 64 GB porque fue diseñado para agentes de programación, uso prolongado de herramientas y recuperación ante fallos. Qwen3.6-27B es la alternativa autoalojada más práctica cuando el servidor o la estación de trabajo tiene unos 24 GB de memoria acelerada o unificada.

¿Qué modelo de Ollama es mejor para programar?

Empiece con qwen3.6:27b si el equipo tiene espacio para el paquete de 17 GB más el contexto y la sobrecarga del entorno de ejecución. En un equipo compacto, use un paquete Qwen3.5 más pequeño; en un servidor de 64 GB, evalúe Qwen3-Coder-Next y comience con contexto reducido.

¿Cuánta RAM o VRAM necesita un modelo local para programar?

Use hardware de 8 GB para Qwen3.5-9B y tareas acotadas, unos 24 GB para Qwen3.6-27B o GLM-4.7-Flash, un PC con una 4090 o una Mac de 32 GB para Devstral Small 2 y unos 64 GB para el paquete de 52 GB de Qwen3-Coder-Next. Son objetivos prácticos, no garantías: el contexto, la cuantización, el entorno de ejecución, el sistema operativo y la descarga parcial en la GPU cambian el requisito final.

¿Los modelos de IA local para programar son gratuitos?

Las cinco descargas de modelos y el nivel local de LM Studio parten de $0. El sistema no carece de costos: el hardware, la electricidad, la configuración, las actualizaciones, el control de acceso, las copias de seguridad y el tiempo de ingeniería siguen formando parte de la propiedad.

Qué hacer esta semana

No empiece encargando una GPU. Comience con una prueba de ajuste sobre un solo repositorio.

Lunes: revise el equipo y elija un candidato

Anote la VRAM o la memoria unificada disponible, la RAM del sistema, el sistema operativo y si el equipo ya es compatible con LM Studio. Elija Qwen3.5-9B para un sistema de 8 GB, Qwen3.6-27B para uno de 24 GB o Devstral Small 2 para una 4090 o una Mac de 32 GB. No descargue los cinco.

Martes: defina tres tareas representativas

Utilice una prueba fallida con una solución conocida, un cambio pequeño en varios archivos y una tarea de explicación tomadas de un repositorio que el equipo conozca. Elimine los secretos y conceda al agente de programación únicamente las herramientas que necesite cada tarea. Guarde el comportamiento esperado antes de empezar.

Miércoles: ejecute por debajo del contexto máximo

Empiece con un contexto acotado y el conjunto mínimo de archivos relevantes. Registre el pico de memoria, el tiempo hasta el primer parche útil, los comandos solicitados, las pruebas superadas y las correcciones humanas. Si el modelo omite una dependencia, añada el archivo que falta antes de ampliar toda la ventana de contexto.

Jueves: compare con la opción actual en la nube

Ejecute las mismas tres tareas con el asistente o la API que ya paga. Compare los parches aceptados y los minutos de corrección, no la seguridad con la que está redactada la respuesta. Incluya el tiempo de configuración y operación en el lado local.

Viernes: tome una de tres decisiones

Mantenga la opción local si mejoraron la privacidad, el trabajo sin conexión, el control o la rentabilidad de los parches aceptados. Conserve la suscripción en la nube si sigue siendo más económica y sencilla. Actualice el hardware solo cuando la prueba identifique la memoria como factor limitante y el beneficio local justifique poseer el equipo.

Última actualización

3 sept 2026

CategoríaBuild

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Newsletter

Una carta, cada domingo. Sistemas que funcionan, no opiniones calientes.

Build logs, sistemas en producción y notas de campo de un portafolio de ventures de IA.

Semanal. Sin spam. Cancele cuando quiera.