Los mejores LLM open source de 2026: ranking de 8 modelos

Comparamos los mejores LLM open source de 2026 por rendimiento, licencia, contexto y precio para elegir el modelo adecuado para código, agentes y uso local.

Friday, September 4, 2026Omid Saffari
Los mejores LLM open source de 2026: ranking de 8 modelos

El mejor LLM open source que puedes ejecutar en 2026 ya no es estadounidense ni una alternativa de segunda. GLM-5.2 supera a GPT-5.5 en SWE-bench Pro, se distribuye con licencia MIT y cuesta una tarifa fija de $18 al mes. La frontera que antes alquilabas ahora se puede descargar.

La respuesta corta

Si buscas un único modelo abierto para programación y trabajo serio con agentes, elige GLM-5.2. Para procesar grandes volúmenes al menor costo posible, usa DeepSeek V4 Flash. Si todo debe permanecer en tu propio hardware y funcionar con una sola GPU, la opción es gpt-oss-120b. Y si la prioridad del equipo legal es una licencia sin zonas grises, Qwen3 o Mistral bajo Apache 2.0 son el punto de partida más seguro.

Un modelo de pesos abiertos permite descargar sus parámetros entrenados y ejecutarlos por cuenta propia, en lugar de alquilar el acceso exclusivamente mediante una API. Ese detalle cambia por completo la economía de construir con IA: el modelo pasa a ser un costo bajo tu control, no un contador que sigue corriendo mientras duermes. Esta es la clasificación según lo que cada opción ofrece en la práctica.

ModeloIdeal paraLicenciaContextoPrecio (por 1M, entrada/salida)Lo más destacado
GLM-5.2Agentes + programaciónMIT1M~$1.40 / ~$4.40 (o plan de $18/mes)El mejor modelo abierto para programación de largo recorrido
DeepSeek V4 FlashAlto volumen a bajo costoMIT1M$0.14 / $0.28Nivel frontera a un costo casi nulo
DeepSeek V4 ProRazonamiento complejo y económicoMIT1M$0.435 / $0.87MoE de 1.6T por menos de un dólar de salida
Kimi K2.7 CodeEnjambres de agentes de programaciónMIT modificada256K$0.95 / $4.00Modelo de 1T optimizado para agentes de programación
Qwen3-235BFlexibilidad con licencia permisivaApache 2.0256KPesos gratuitos119 idiomas y código realmente abierto
MiniMax M3Multimodalidad con contexto largoComunitaria (restringida)1M$0.30 / $1.20Entrada de texto, imagen y video; contexto de 1M
gpt-oss-120bAutoalojamiento con una GPUApache 2.0LargoPesos gratuitosFunciona en una sola H100 de 80GB
Mistral Small 4Residencia de datos en la UEAbiertaLargoPesos gratuitosEuropeo, con razonamiento híbrido
Llama 4Ecosistema + herramientasComunitaria (restringida)LargoPesos gratuitosEl soporte de herramientas más amplio

Una precisión sobre los precios de la tabla: cuando descargas un modelo, el costo por token será el que cobre el proveedor de infraestructura más barato, porque los pesos no cuestan nada. Las cifras indicadas son las tarifas de las API oficiales de cada proveedor, registradas esta semana. Si optas por alojarlo tú mismo, sustituyes ese contador por la factura de las GPU.

Por qué los LLM open source dejaron de ser una concesión

Durante dos años, hablar de un «modelo abierto» era hablar de algo «suficientemente bueno si no puedes pagar el de verdad». Esa idea ya quedó atrás, y un benchmark lo demuestra con claridad. En SWE-bench Pro, una prueba que mide si un modelo puede resolver incidencias reales de ingeniería de software, GLM-5.2 obtiene 62.1. GPT-5.5 logra 58.6. Gemini 3.1 Pro alcanza 54.2. Solo Claude Opus 4.8, con 69.2, mantiene una ventaja clara. Un modelo abierto con licencia MIT, creado por una empresa surgida de Tsinghua, ya supera a dos de los tres laboratorios occidentales de frontera en la evaluación más relevante para el trabajo de ingeniería.

Aquí está la diferencia que determina si realmente puedes usar un modelo y que casi ninguna comparativa explica bien: «pesos abiertos» y «código abierto» no prometen lo mismo. Pesos abiertos significa que puedes descargar los parámetros. Código abierto, en el sentido que importa a una empresa, también implica que la licencia permite desplegar, modificar y vender lo que construyes sin pedir autorización. DeepSeek, GLM y Qwen se publican bajo MIT o Apache 2.0, licencias verdaderamente permisivas: admiten cualquier uso, incluido el comercial. Llama y MiniMax recurren a «licencias comunitarias» con restricciones escondidas en sus condiciones. No es una distinción académica. Es la diferencia entre lanzar un producto basado en el modelo y recibir una objeción del equipo legal tres meses después.

GLM-5.2 es el modelo abierto que todos deben superar

GLM-5.2, del laboratorio chino Z.ai (antes Zhipu), es el modelo de pesos abiertos más potente del mundo para trabajos de ingeniería de largo recorrido y la primera opción que conviene probar. Llegó a mediados de junio de 2026 con una ventana de contexto de 1M tokens realmente aprovechable, frente a los 200K de la versión anterior, y mantiene la calidad a lo largo de toda esa ventana en vez de limitarse a aceptar los tokens. La ventana de contexto es la cantidad de texto que un modelo puede conservar a la vez en su memoria de trabajo; con 1M, puede tener presentes un repositorio de tamaño medio completo, sus pruebas y sus convenciones mientras trabaja.

Página principal de GLM-5.2 de Z.ai
Z.ai, el laboratorio responsable de GLM-5.2

En Terminal-Bench 2.1, que evalúa si un modelo puede controlar una terminal real y completar una tarea, GLM-5.2 obtiene 81.0, a pocos puntos de Claude Opus 4.8 con 85.0 y por delante de Gemini 3.1 Pro con 74.0. Según los benchmarks de la propia Z.ai, fue el modelo open source mejor clasificado en todas las pruebas de largo recorrido que realizaron. Su licencia MIT permite que una startup de 12 personas lo aloje por su cuenta, lo ajuste con su propio código y lo incorpore a un producto de pago sin permisos ni regalías.

La dificultad está en el hardware. Es un modelo de aproximadamente 745 mil millones de parámetros, por lo que alojarlo bien exige un equipo serio con varias GPU. La mayoría de los equipos no lo ejecutará por cuenta propia, sino mediante la API, cuya tarifa publicada ronda los $1.40 por millón de tokens de entrada y los $4.40 por millón de salida, o con el GLM Coding Plan de tarifa fija por unos $18 al mes. Para quien dirige una empresa y viene pagando precios de API de frontera, ese plan es el gran titular: aproximadamente lo que cuestan dos cafés por un mes de programación de nivel frontera, con la posibilidad de llevar los pesos a infraestructura propia más adelante si controlar los datos se vuelve indispensable.

DeepSeek V4 fija un costo mínimo que nadie más iguala

DeepSeek V4 hace que las cuentas sean imposibles de ignorar: ofrece una calidad cercana a la frontera por un precio que prácticamente se redondea a cero. El laboratorio chino DeepSeek lo lanzó en abril de 2026 en dos tamaños, ambos con licencia MIT y contexto de 1M tokens. V4-Pro es un modelo de mezcla de expertos con 1.6 billones de parámetros; V4-Flash es una versión más ligera de 284 mil millones. Un modelo de mezcla de expertos activa solo una pequeña parte de sus parámetros para cada token, y así puede servir un sistema de este tamaño a bajo costo.

Página principal de DeepSeek
DeepSeek, creador de la familia de modelos V4

El precio es el argumento central. En la API oficial de DeepSeek, V4-Flash cuesta $0.14 por millón de tokens de entrada y $0.28 por millón de salida. Incluso V4-Pro, la versión de mayor capacidad, se queda en $0.435 de entrada y $0.87 de salida. Para dimensionar la diferencia: una carga que cuesta varios cientos de dólares al mes con un modelo cerrado de frontera suele bajar a unas pocas decenas con V4-Flash, para el mismo trabajo y con una calidad de salida que la mayoría de los usuarios no distingue en tareas cotidianas. Ambos ofrecen un modo de pensamiento para razonamientos más complejos y llamadas a herramientas para flujos con agentes.

La limitación real: DeepSeek destaca en razonamiento, matemáticas y código, pero no sería mi elección para el trabajo multimodal más exigente ni para las sesiones más largas de programación con agentes, donde GLM-5.2 y Kimi llevan ventaja. Usa V4-Flash como opción predeterminada para cargas de alto volumen, clasificación, extracción, resumen y redacción, y reserva un modelo más caro para el 5% de tareas que de verdad lo necesitan.

Kimi K2.7 Code está diseñado para agentes que programan

Kimi K2.7 Code, de Moonshot AI, es un modelo abierto creado expresamente para agentes de programación que trabajan durante horas; llegó en junio de 2026. Es un modelo de mezcla de expertos con 1 billón de parámetros, entrada multimodal nativa —puede leer imágenes y video además de texto— y una ventana de contexto de 256K tokens. Mientras GLM-5.2 es un modelo generalista que además programa muy bien, Kimi está ajustado específicamente para los bucles largos y de varios pasos que ejecutan las herramientas modernas de programación.

Kimi de Moonshot AI
Kimi, el modelo de Moonshot AI centrado en programación

Según las cifras publicadas por Moonshot, el anterior K2.6 alcanzó 80.2% en SWE-bench Verified, en la misma franja que los modelos cerrados de frontera. K2.7 Code cuesta $0.95 por millón de tokens de entrada y $4.00 por millón de salida en la API oficial, con una tarifa mucho menor de $0.19 cuando el prompt está en caché. Esa diferencia pesa mucho en los agentes, que vuelven a enviar el mismo contexto extenso en cada paso. Se distribuye con una licencia MIT modificada, por lo que el autoalojamiento comercial es posible.

El costo de esa especialización es el enfoque. Kimi es muy competente al programar y ejecutar tareas con agentes, pero menos versátil para escritura o análisis general. Si tu producto es un agente de programación o una herramienta interna de desarrollo, es una de las mejores opciones. Si necesitas que un solo modelo haga de todo, GLM-5.2 o DeepSeek ofrecen un equilibrio mayor. Para entender cómo encajan estos modelos en las herramientas que los ejecutan, consulta los mejores agentes de IA para programar.

Qwen3 es el modelo abierto serio con la licencia más permisiva

Qwen3, de Alibaba, es la elección indicada cuando una licencia clara y la cobertura de idiomas pesan más que liderar un benchmark concreto. Su modelo insignia abierto, Qwen3-235B-A22B, es una mezcla de expertos con 235 mil millones de parámetros totales, 22 mil millones de parámetros activos, contexto de 256K tokens y compatibilidad con 119 idiomas. Lo decisivo es su licencia Apache 2.0, la más permisiva de toda esta lista, que lo convierte en la opción predeterminada para empresas cuyos equipos legales desconfían de condiciones personalizadas.

Interfaz de chat de Qwen
Qwen, la familia de modelos de pesos abiertos de Alibaba

El mismo modelo permite alternar entre un modo de pensamiento para razonamientos difíciles y otro más rápido, sin pensamiento, para conversaciones cotidianas. Así no pagas por una deliberación que no necesitas. Los pesos se descargan gratis y pueden ejecutarse mediante Alibaba Cloud o cualquier proveedor que los ofrezca.

Hay una distinción importante que el marketing suele difuminar: el modelo insignia más reciente de Alibaba, Qwen3.7-Max, es cerrado y solo está disponible por API. Los modelos verdaderamente abiertos son los pesos publicados de gama media y 235B, no la categoría Max. Para quien toma decisiones de compra sin un perfil técnico, la regla es sencilla: si quieres poseer el modelo, elige un peso abierto de Qwen con nombre propio, no el nivel Max. El 235B abierto queda un poco por detrás de GLM-5.2 y DeepSeek V4 en los benchmarks de programación más difíciles, pero su licencia permisiva y su alcance multilingüe lo convierten en la opción soberana más segura para un producto global.

MiniMax M3 lleva la multimodalidad a la frontera abierta

MiniMax M3 es el modelo abierto que conviene seguir cuando el trabajo combina texto, imágenes y video y, además, necesita un contexto enorme. También es el más reciente del grupo: se lanzó el 1 de junio de 2026. Es una mezcla de expertos con 428 mil millones de parámetros totales, 23 mil millones activos, contexto de 1M tokens y entrada multimodal nativa. Emplea un diseño de atención que el laboratorio denomina MiniMax Sparse Attention para mantener asequible la inferencia con contextos largos.

Página principal de la plataforma MiniMax
MiniMax, creador del modelo M3

También compite con fuerza en precio: la API oficial de MiniMax publica M3 a $0.30 por millón de tokens de entrada y $1.20 por millón de salida, con un descuento permanente de 50%. Resultados como 93.0 en GPQA Diamond lo sitúan entre los modelos de razonamiento más potentes, tanto abiertos como cerrados.

El asterisco está en la licencia. Los pesos de M3 se pueden descargar, pero el uso comercial del modelo o de sus derivados requiere un acuerdo adicional a la MiniMax Community License predeterminada. En términos sencillos: es una gran opción para experimentar, pero conviene obtener las condiciones comerciales por escrito antes de montar un negocio sobre ella. Esa única cláusula explica por qué queda por debajo de los modelos MIT y Apache para cualquiera que vaya a lanzar un producto.

gpt-oss es la opción que funciona en tu propia GPU

gpt-oss, la familia de pesos abiertos de OpenAI, es la elección adecuada cuando el requisito innegociable es ejecutarla en hardware propio sin montar un clúster. El modelo mayor, gpt-oss-120b, tiene 117 mil millones de parámetros, aunque solo 5.1 mil millones están activos, y fue diseñado para funcionar en una única GPU de 80GB como la NVIDIA H100. El modelo menor, gpt-oss-20b, funciona con 16GB de memoria, es decir, en una estación de trabajo bien equipada. Ambos usan Apache 2.0.

gpt-oss de OpenAI
gpt-oss, los modelos de pesos abiertos de OpenAI

Es la opción práctica para instalaciones locales. Para una empresa regulada, un hospital, un banco o un contratista de defensa que no puede enviar datos a ninguna API externa, que «quepa en una H100» resuelve toda la decisión. Permite configurar el esfuerzo de razonamiento para graduar el modelo entre rápido y económico o lento y minucioso, y da acceso completo a la cadena de pensamiento para depuración. También está preparado para agentes, con llamadas a funciones, navegación web y ejecución de Python nativas.

El encuadre honesto es este: gpt-oss no pretende encabezar los rankings de benchmarks como GLM-5.2 o DeepSeek V4, y es el lanzamiento más antiguo del grupo. Se elige por sus posibilidades de despliegue: un modelo competente que cabe en hardware que ya posees y tiene una licencia clara, no porque sea la alternativa más inteligente de todas.

Mistral es la alternativa abierta europea

Mistral, el laboratorio francés, es el modelo abierto que conviene elegir cuando la residencia europea de los datos y un proveedor occidental conocido importan a tus compradores. Su catálogo abierto incluye Mistral Small 4, un modelo híbrido que reúne seguimiento de instrucciones, razonamiento y programación en un paquete eficiente; Mistral Medium 3.5, un modelo multimodal de nivel frontera; y Devstral 2 para trabajo con agentes de programación.

Página principal de Mistral AI
Mistral, el laboratorio europeo de modelos abiertos

Para una empresa europea que vende a clientes europeos, la conversación de compras resulta más sencilla con un proveedor de París que con uno de Pekín, independientemente de lo que hagan los pesos. Los modelos de Mistral son más pequeños y ligeros que los enormes MoE chinos. Eso es una ventaja si buscas eficiencia y una limitación si necesitas llegar a lo más alto de los rankings de programación. Es la opción cómoda y compatible con los requisitos normativos, no la líder de los benchmarks.

Llama 4 destaca por su ecosistema, no por estar en la frontera

Llama 4, de Meta, ya no es el modelo que se elige para ganar benchmarks, pero conserva el ecosistema de herramientas más profundo y la comunidad más amplia. La generación actual, lanzada en 2025, incluye Scout y Maverick, ambos modelos de mezcla de expertos multimodales de forma nativa con 17 mil millones de parámetros activos; Maverick reúne 400 mil millones de parámetros totales distribuidos entre 128 expertos. El modelo más grande, Behemoth, aún no se ha lanzado.

Página principal de Meta Llama
Llama de Meta, el ecosistema más amplio entre los modelos abiertos

El verdadero activo de Llama en 2026 es su fuerza de atracción: más ajustes finos, más cuantizaciones, más guías de despliegue y más familiaridad en el mercado laboral que cualquier otro modelo abierto. Si tu equipo ya trabaja con Llama y resuelve bien sus tareas, no hay urgencia por cambiar. Pero hay que ser preciso con la licencia. Llama usa la licencia comunitaria de Meta, no Apache ni MIT, y esta incluye restricciones comerciales que una licencia realmente open source no tiene. Para un proyecto nuevo en el que la licencia aún está por decidir, los modelos chinos más recientes con MIT y Apache ofrecen mayor capacidad y condiciones más limpias.

Qué modelo elegir para cada necesidad

El modelo correcto depende de tu restricción principal; no existe un ganador universal. Busca tu situación en la tabla.

Tu situaciónEligePor qué
Programación con agentes y gasto ya elevadoGLM-5.2El mejor modelo abierto para código, MIT y plan de $18/mes
Tareas de API de alto volumen con presupuesto ajustadoDeepSeek V4 Flash$0.14/$0.28 por 1M y calidad cercana a la frontera
Desarrollo de un producto de agentes de programaciónKimi K2.7 CodeAjustado para bucles largos de agentes y entrada en caché barata
Producto global y equipo legal cautelosoQwen3-235BApache 2.0, 119 idiomas y apertura real
Ejecución local obligatoria con una GPUgpt-oss-120bCabe en una sola H100 de 80GB y usa Apache 2.0
Residencia de datos en la UE obligatoriaMistralProveedor europeo, abierto y eficiente
Multimodalidad + contexto enormeMiniMax M3Entrada de texto, imagen y video, contexto de 1M y bajo costo
Tu organización ya lo ha estandarizadoLlama 4El ecosistema de herramientas más profundo y ningún motivo para migrar

Las cuentas de costos, sin adornos

Todo esto importa a una empresa por la factura, así que conviene revisar las cifras reales sin exageraciones. Hay tres formas de pagar por un modelo abierto, y cada una funciona a una escala distinta.

  1. Alquilar la API (el menor compromiso)

    Llamas al modelo mediante la API del proveedor y pagas por token. Con los precios de DeepSeek V4-Flash, un millón de tokens de salida cuesta 28 centavos. Un equipo que procesa unos cientos de millones de tokens al mes —una carga real para un producto con bastante actividad— paga decenas de dólares, no miles. Casi todo el mundo debería empezar aquí.

  2. Contratar un plan fijo (gasto predecible)

    Para un uso intensivo en programación, una suscripción como el GLM Coding Plan por aproximadamente $18 al mes elimina por completo la ansiedad del costo por token. Pagas una tarifa fija y dejas de contarlos. Es el punto ideal para un equipo pequeño de ingeniería que programa con IA durante toda la jornada.

  3. Autoalojar los pesos (mayor compromiso, menor costo marginal)

    Descargas los pesos MIT o Apache y los ejecutas en tus propias GPU. El costo deja de ser un contador por token y se convierte en una factura fija de GPU más el tiempo de ingeniería. Solo compensa con un volumen alto y constante, o cuando controlar los datos no es negociable. gpt-oss-120b en una única H100 es el punto de entrada realista; los MoE con un billón de parámetros necesitan un clúster.

La afirmación tan repetida de que un equipo que gasta $10,000 al mes en un modelo cerrado podría gastar entre $1,000 y $2,000 en uno abierto es correcta a grandes rasgos y fácil de contrastar con los precios anteriores: GLM-5.2 y DeepSeek V4 cuestan aproximadamente entre cinco y diez veces menos que las API cerradas de frontera para un trabajo comparable. El ahorro es real. Lo que esa afirmación omite es el costo de ingeniería necesario para operar bien una infraestructura de inferencia propia. Por eso, para la mayoría de los equipos, una API o un plan fijo supera al autoalojamiento hasta que el volumen es elevado. Para ver cómo se comparan estos modelos abiertos con los modelos cerrados Claude, GPT y Gemini específicamente en programación, consulta el [mejor modelo de IA para programar](/blog/best-ai-model-for-coding-2026).

La regla para tomar la decisión

Una sola restricción cambia por completo la elección. Si puedes usar una API, debes equilibrar costo y capacidad: GLM-5.2 es la respuesta para el trabajo complejo con agentes y DeepSeek V4 Flash para cualquier carga de alto volumen. Si no puedes usar una API por residencia de datos, regulación o infraestructura aislada, la única pregunta relevante es qué funciona en el hardware disponible. La respuesta será gpt-oss-120b en una GPU o Qwen3 en un equipo algo mayor. Decide primero si puedes usar una API. Todo lo demás se deriva de ahí.

¿Cuál es el mejor LLM open source de 2026?

Para programación y trabajo serio con agentes, GLM-5.2: lidera todos los benchmarks abiertos de largo recorrido, se publica con licencia MIT y está disponible mediante un plan fijo de $18 al mes. Para tareas económicas y de alto volumen, DeepSeek V4 Flash, a $0.14 de entrada y $0.28 de salida por millón de tokens, no tiene rival en precio.

¿Pesos abiertos y código abierto significan lo mismo?

No, y confundirlos puede salir caro. Pesos abiertos significa que puedes descargar el modelo. Para una empresa, código abierto también implica que la licencia permite desplegar y vender lo que construyes. DeepSeek, GLM, Qwen y gpt-oss usan licencias permisivas MIT o Apache 2.0; Llama y MiniMax se distribuyen con licencias comunitarias restringidas que un abogado debe revisar antes de cualquier uso comercial.

¿Puedo ejecutar estos modelos en mi propio hardware?

Algunos sí, y con facilidad. gpt-oss-120b cabe en una única H100 de 80GB y gpt-oss-20b funciona con 16GB. Los enormes modelos de mezcla de expertos —DeepSeek V4, GLM-5.2 y Kimi K2.7— necesitan un clúster con varias GPU para alojarlos bien, por lo que la mayoría de los equipos los alquila mediante una API.

¿Es seguro usar modelos abiertos chinos en una empresa de EE. UU.?

Los pesos descargados se ejecutan íntegramente en tu infraestructura y no envían datos a ningún lugar, por lo que el autoalojamiento elimina por completo el problema de la residencia de datos. La duda solo aparece al usar la API alojada de un proveedor, porque entonces tus datos sí llegan a ese servicio. Si es relevante, aloja tú mismo los pesos abiertos o elige un proveedor occidental que los ofrezca.

¿Cuál es el mejor LLM abierto para ejecutar localmente en un equipo normal?

gpt-oss-20b, que funciona con 16GB de memoria, o un modelo Qwen3 de gama media. Ambos ofrecen un modelo competente con licencia permisiva en una sola estación de trabajo, sin necesidad de alquilar nada.

¿Quieres un mapa completo del panorama para tu negocio, no solo de los modelos sino también de los agentes, herramientas y stacks que los convierten en productos? Descarga el mapa de herramientas de IA para empresas y recibe una lectura semanal breve sobre lo que de verdad se lanzó y qué hacer al respecto.

Última actualización

4 sept 2026

CategoríaAI

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Newsletter

Una carta, cada domingo. Sistemas que funcionan, no opiniones calientes.

Build logs, sistemas en producción y notas de campo de un portafolio de ventures de IA.

Semanal. Sin spam. Cancele cuando quiera.