Los mejores LLM locales en 2026: Qwen3.6, Gemma 4, gpt-oss y Phi-4

Descubra los mejores LLM locales en 2026 clasificados por memoria y uso: tamaños en 4 bits, requisitos de RAM y VRAM, precios y cómo ejecutarlos.

Friday, September 4, 2026Omid Saffari
Los mejores LLM locales en 2026: Qwen3.6, Gemma 4, gpt-oss y Phi-4

El mejor LLM local para un equipo de 32 GB es Qwen3.6-35B-A3B: su compilación actual en 4 bits para Ollama ocupa 24 GB, dejando 8 GB libres antes de que el runtime, el sistema operativo y la caché de contexto tomen su parte. Para 8 GB, elija Qwen3.5-9B; para 16 GB, elija Gemma 4 12B para tareas multimodales o gpt-oss-20b para razonamiento.

Respuesta rápida: los mejores LLM locales para cada equipo

Un modelo local debe caber en la memoria antes de que cualquier benchmark tenga relevancia. Suena obvio, pero es el error detrás de la mayoría de las malas recomendaciones: un modelo disperso (sparse) puede activar solo unos pocos miles de millones de parámetros por cada token mientras sigue exigiendo que cada peso resida físicamente en la memoria.

Esta clasificación comienza con el artefacto descargable actual, añade margen operativo de trabajo y solo entonces evalúa para qué es bueno el modelo. Son comparativas basadas en model cards actuales y páginas oficiales de runtimes, no afirmaciones de rendimiento derivadas de pruebas inexistentes.

ElecciónAjuste práctico de memoriaMejor usoLímite real
Qwen3.6-35B-A3B32 GB de memoria disponibleEl mejor en general, código, imágenesEl archivo de 24 GB deja poco margen por debajo de 32 GB
Qwen3.5-9B8 GB de VRAM, preferiblemente 12 GB+ totalesAsistente multimodal compactoLos contextos largos rompen de inmediato el límite de 8 GB
Gemma 4 12B16 GB de memoria disponibleImágenes, audio, documentosTérminos de Gemma, no un atajo de licencia permisiva
gpt-oss-20bMínimo 16 GB, cómodo en 24 GBRazonamiento y uso de herramientasSolo texto, 16 GB queda muy ajustado
Phi-4-mini-instruct4 GB de VRAM más RAM del sistemaUso en CPU, pequeñas utilidadesCorte de conocimiento en junio de 2024
Qwen3-Coder-Next64 GB+ de memoria disponibleAgentes de código a escala de repositorioArchivo de 52 GB, especialista en programación

La mejor opción predeterminada indiscutible es Qwen3.6-35B-A3B en un equipo con unos 32 GB de memoria de sistema o unificada disponible. Combina pesos abiertos, entrada multimodal y programación agéntica en un paquete actual Q4_K_M de 24 GB. Si ese archivo no cabe dejando espacio operativo, bajar a Qwen3.5-9B es una decisión mucho más sensata que forzar el modelo grande a recurrir a la memoria swap.

El nivel de 16 GB tiene dos ganadores porque la carga de trabajo define la elección. Gemma 4 12B es la opción más útil cuando el asistente necesita analizar imágenes, vídeo o audio. gpt-oss-20b es la elección para razonamiento y uso de herramientas, pero su paquete de 14 GB deja solo 2 GB antes de que el resto del ordenador solicite memoria.

Cuánta memoria necesita realmente un LLM local

En las discusiones sobre modelos locales se suelen mezclar cuatro conceptos: el conteo de parámetros, los parámetros activos, el tamaño del archivo cuantizado y la memoria de trabajo. Cada uno responde a preguntas distintas.

Los parámetros totales describen todos los pesos aprendidos del modelo. Los parámetros activos describen el subconjunto que un modelo de mezcla de expertos (mixture-of-experts) utiliza para generar un solo token. Este segundo dato ayuda a entender la eficiencia de cómputo, pero el primero sigue determinando el almacenamiento y la ocupación en memoria. Google hace explícita esta distinción para Gemma 4 26B A4B: solo 4 mil millones de parámetros están activos, pero los 26 mil millones deben cargarse en la memoria.

La cuantización almacena dichos pesos con una menor precisión numérica. Una compilación de 4 bits es mucho más pequeña que una en precisión completa, con una posible pérdida de capacidad asumible. Es algo similar a comprimir un mapa detallado en una edición de bolsillo en lugar de eliminar tres cuartas partes de las carreteras: la estructura se mantiene, pero se pierde algo de precisión.

La memoria de trabajo comprende el archivo del modelo más todo lo necesario para utilizarlo. El runner necesita memoria. El sistema operativo necesita memoria. La caché KV, un búfer rápido para el prompt y la conversación generada, crece a medida que se alarga el contexto. La propia tabla de Gemma de Google advierte que sus estimaciones de pesos estáticos excluyen el software auxiliar y la ventana de contexto.

Por eso, un modelo que anuncia un límite de contexto de 256K puede caber en memoria mientras que el contexto completo de 256K no lo hace. Un límite de contexto es el máximo soportado por la arquitectura, no una garantía sobre su portátil. Tanto Qwen3.5-9B como Qwen3-Coder-Next aconsejan explícitamente a los usuarios reducir el contexto tras experimentar un error de falta de memoria (out-of-memory).

Empiece por el nivel de memoria y luego elija el modelo

Tome estas referencias como mínimos técnicos para despliegue, no como garantías para cualquier longitud de contexto:

  • 4 GB de VRAM dedicada: el archivo Q4_K_M de 2.5 GB de Phi-4-mini es la opción creíble de modelo pequeño si el equipo dispone además de RAM de sistema convencional. Para ejecución exclusiva en CPU, 8 GB de RAM de sistema es una base más razonable.
  • 8 GB de VRAM dedicada: el paquete de 6.6 GB de Qwen3.5-9B encaja si el contexto se mantiene moderado. Un equipo con 12 GB o más de memoria total (unificada o de sistema) es una opción más segura.
  • 16 GB de memoria disponible: Gemma 4 12B encaja con mayor holgura. gpt-oss-20b alcanza el suelo oficial de 16 GB fijado por OpenAI, pero representa la alternativa justa.
  • 32 GB de memoria disponible: Qwen3.6-35B-A3B es la recomendación integral más sólida en este nivel, ya que su paquete de 24 GB deja 8 GB antes del consumo del runtime y del contexto.
  • 64 GB o más: Qwen3-Coder-Next se vuelve viable. Su paquete de 52 GB sigue dejando solo 12 GB antes de considerar el resto del sistema.
Cinco terrazas de memoria física que asignan LLM locales a 4 GB, 8 GB, 16 GB, 32 GB y 64 GB o más
Elija primero el nivel de memoria y después el modelo local.

El cálculo del margen libre revela lo dispares que son estos ajustes. Qwen3.5-9B deja 1.4 GB en una asignación de 8 GB, es decir, un 17.5%. gpt-oss-20b deja 2 GB en 16 GB, un 12.5%. Qwen3.6 deja 8 GB en 32 GB, un 25%. Qwen3-Coder-Next deja 12 GB en 64 GB, un 18.75%.

Estos porcentajes no reflejan la memoria disponible tras el arranque; representan el límite superior teórico antes de que el runner, el sistema operativo y la caché KV tomen su parte. Por lo tanto, el emparejamiento con gpt-oss es un mínimo técnico estricto, mientras que el de Qwen3.6 ofrece el margen más saludable de los cuatro.

Cuatro recipientes de memoria transparentes que comparan el tamaño del archivo del modelo con el margen restante
Un archivo de modelo que llena el recipiente no deja espacio para la conversación.

1. Qwen3.6-35B-A3B: el mejor LLM local en general para 32 GB

Qwen3.6-35B-A3B es el mejor LLM local integral cuando se dispone de 32 GB de memoria real. Qwen lo define como un modelo de mezcla de expertos de 35 mil millones de parámetros con 3 mil millones de parámetros activos, pesos abiertos, razonamiento multimodal y un enfoque central en programación agéntica. El paquete actual para Ollama pesa 24 GB en Q4_K_M, que es la cifra que determina si cabe en su máquina.

Página de lanzamiento oficial de Qwen3.6-35B-A3B
Qwen3.6-35B-A3B

El modelo resulta idóneo para fundadores o desarrolladores senior que buscan un asistente privado único para consultar repositorios, planificar implementaciones, inspeccionar imágenes y abordar tareas de programación extensas. Es una opción predeterminada superior a un modelo exclusivo para código cuando el asistente local también debe interpretar capturas de pantalla, diagramas o documentación. La cifra de 3 mil millones de parámetros activos optimiza la eficiencia de ejecución, pero no reduce el paquete a 3 GB: el artefacto de 4 bits instalado sigue pesando 24 GB.

El obstáculo práctico reside en el contexto. El archivo consume tres cuartas partes de una asignación de 32 GB antes de iniciar la conversación. Los repositorios grandes, múltiples imágenes y un historial prolongado expanden la caché, por lo que resulta preferible trabajar con un contexto útil más corto antes que forzar un máximo teórico que obligue a la máquina a usar swap.

Ideal para: Un equipo de 32 GB que necesita un único modelo local potente para código, razonamiento e imágenes.
Aspecto destacado: 35 mil millones de parámetros totales, 3 mil millones activos, entrada multimodal y compilación Q4_K_M de 24 GB.
Precios: Pesos abiertos bajo Apache License 2.0 asociados al artefacto actual de Ollama; el hardware local constituye el coste operativo.
Prueba gratuita: No aplica para pesos descargables.

Lo bueno
Lo que hace bien
4 points

  • El mejor equilibrio entre capacidad actual y ajuste práctico a 32 GB en esta lista.
  • La entrada multimodal evita tener que mantener un modelo de visión por separado.
  • La programación agéntica es una prioridad nativa del lanzamiento, no un uso casual.
  • El comando y artefacto exactos en Ollama son fáciles de verificar.
Lo malo
Dónde se queda corto
3 points

  • El archivo de 24 GB es inviable para un equipo de 24 GB en uso normal.
  • Los contextos extensos pueden agotar con rapidez el margen de 8 GB.
  • Los modelos más pequeños responderán más rápido en hardware modesto.

Ejecución del modelo principal con Ollama

  1. Compruebe la memoria que puede dedicar

    Tome 32 GB como base de trabajo para este archivo de 24 GB. En sistemas de memoria unificada, reste lo que el sistema operativo y otras aplicaciones ya consumen.

  2. Instale Ollama

    Descargue la compilación actual para escritorio o línea de comandos desde Ollama. El plan Free es suficiente para un uso ilimitado en su propio hardware.

  3. Ejecute la etiqueta exacta del modelo

    Ejecute ollama run qwen3.6:35b-a3b. Esa etiqueta apunta directamente al artefacto actual de 24 GB en Q4_K_M documentado en la página de Ollama.

  4. Comience con un contexto de trabajo corto

    Inicie la sesión limitándose al directorio del repositorio o a los documentos específicos de la tarea, en lugar de cargar un archivo completo por defecto. Si el equipo entra en swap o el runner muestra un error de falta de memoria, reduzca el contexto antes de optar por un artefacto de menor precisión.

2. Qwen3.5-9B: el mejor LLM local para una GPU de 8 GB

Qwen3.5-9B es el mejor LLM local compacto analizado para una GPU dedicada de 8 GB. La ficha oficial del modelo lo describe como un modelo de lenguaje causal de 9 mil millones de parámetros con codificador de visión, y el paquete actual de Ollama pesa 6.6 GB con soporte para texto e imagen. Esto lo convierte en la recomendación más pequeña de la lista capaz de funcionar como asistente multimodal diario solvente.

Model card oficial de Qwen3.5-9B en Hugging Face
Qwen3.5-9B

El caso de uso concreto es un compañero de programación de escritorio que además puede interpretar una captura de un error, un diseño de interfaz o un diagrama técnico. Un desarrollador individual con una GPU de 8 GB puede emplearlo para explicaciones de código, refactorizaciones cortas y consultas visuales sin asignar los 24 GB exigidos por Qwen3.6. También es la alternativa idónea cuando el modelo superior arranca en teoría pero pasa el tiempo paginando memoria.

La etiqueta de contexto de 256K requiere cautela. La ficha de Qwen fija un límite nativo de 262,144 tokens y aconseja explícitamente reducirlo en caso de error por falta de memoria. El archivo de 6.6 GB deja apenas 1.4 GB libres en un presupuesto de 8 GB de VRAM antes de la sobrecarga de caché y runner, por lo que el contexto completo exige un hardware mucho más grande.

Ideal para: GPU dedicada de 8 GB, chat multimodal compacto y asistencia cotidiana en programación.
Aspecto destacado: Artefacto de 6.6 GB con entrada de texto e imágenes.
Precios: Pesos de modelo descargables sin suscripción en la página de origen; hardware y cualquier runner alojado van por separado.
Prueba gratuita: No aplica para pesos descargables.

Lo bueno
Lo que hace bien
4 points

  • Encaja en una GPU habitual de 8 GB con un contexto moderado.
  • Admite imágenes además de texto.
  • Mucho más fácil de ubicar que un archivo de entre 20 GB y 24 GB.
  • Familia actual, en lugar de recurrir al estándar anterior Qwen2.5.
Lo malo
Dónde se queda corto
3 points

  • Solo quedan 1.4 GB de VRAM nominal en la configuración de 8 GB.
  • El contexto máximo es irreal en el escalón mínimo de hardware.
  • Un modelo de 9 mil millones de parámetros tiene menor capacidad para razonamientos complejos que las opciones mayores.

3. Gemma 4 12B: el mejor LLM local multimodal para 16 GB

Gemma 4 12B es la mejor elección para 16 GB cuando la entrada multimodal es indispensable. La familia actual de Google procesa texto, imágenes y vídeo, mientras que la versión 12B admite también audio. Sus pesos abiertos permiten un uso comercial responsable según los términos de Gemma, lo que resulta práctico para un asistente privado de documentos o contenido multimedia cuando dichos términos se ajustan al proyecto.

Visión general oficial del modelo Google Gemma 4 y tabla de memoria
Gemma 4 12B

El modelo encaja con precisión en el flujo de un responsable de producto que necesita comparar capturas, resumir una llamada grabada, revisar un vídeo corto y razonar sobre el texto asociado en el mismo equipo. Ofrece una compatibilidad de entradas más amplia que gpt-oss-20b, que es exclusivamente de texto. Presenta también un encaje en memoria más desahogado: el archivo actual gemma4:12b en Ollama ocupa 7.6 GB, dejando un margen considerable en 16 GB.

La estimación propia de Google para Q4_0 es de 6.7 GB, mientras que el paquete de Ollama se sitúa en 7.6 GB. Estas cifras no son contradictorias, sino el resultado de diferentes compilaciones y cuantizaciones. La lección fundamental reside en la advertencia de Google: la memoria estática excluye el software auxiliar y la ventana de contexto, por lo que ninguna de las dos cifras debe tomarse como la huella de trabajo total.

El modelo 12B pertenece al grupo intermedio de Gemma con un límite de contexto de 256K. Al igual que con Qwen, este techo arquitectónico no es un punto de partida viable en 16 GB. Conviene iniciar con los documentos o medios estrictamente necesarios y ampliar el contexto solo si el equipo mantiene una respuesta ágil.

Ideal para: Un asistente multimodal en 16 GB que procese texto, imágenes, vídeo y audio.
Aspecto destacado: Amplia compatibilidad de entradas en un artefacto actual para Ollama de 7.6 GB.
Precios: Pesos abiertos bajo los términos de Gemma; no se requiere suscripción para su descarga.
Prueba gratuita: No aplica para pesos descargables.

Lo bueno
Lo que hace bien
4 points

  • La mejor cobertura de formatos de entrada en la categoría de 16 GB.
  • El archivo de 7.6 GB deja mucho más espacio de trabajo que gpt-oss-20b.
  • Google proporciona directrices de memoria inusualmente transparentes.
  • El uso comercial responsable está autorizado explícitamente en los términos de Gemma.
Lo malo
Dónde se queda corto
3 points

  • Los términos de Gemma requieren una revisión de licencia específica para entornos comerciales.
  • El contexto completo de 256K no es un objetivo realista en el hardware mínimo.
  • No es la opción más pequeña ni la más grande de la familia, lo que propicia confusiones si se elige solo por nombre.

4. gpt-oss-20b: el mejor modelo local de razonamiento en el suelo de 16 GB

gpt-oss-20b es el modelo local orientado prioritariamente al razonamiento para equipos capaces de cumplir con un umbral estricto de 16 GB de memoria. OpenAI especifica 21 mil millones de parámetros totales, 3.6 mil millones de parámetros activos, hasta 128K de contexto, licencia Apache 2.0 y soporte para uso de herramientas, llamadas a funciones (function calling), Structured Outputs y esfuerzo de razonamiento configurable (bajo, medio o alto). El paquete actual en Ollama es de 14 GB y funciona exclusivamente con texto.

Presentación oficial de OpenAI para gpt-oss-20b y gpt-oss-120b
gpt-oss-20b

Es la alternativa idónea para automatizaciones locales que deben resolver tareas estructuradas y devolver esquemas predecibles, como la clasificación de solicitudes de soporte antes de la revisión humana. También resulta idóneo para desarrolladores que priorizan el ajuste del esfuerzo de razonamiento por encima de la capacidad de procesar imágenes. El modelo fue entrenado en un corpus mayoritariamente en inglés, exclusivo de texto y enfocado a áreas STEM, código y conocimiento general; no debe considerarse un modelo de visión.

OpenAI indica que el modelo 20B puede ejecutarse con 16 GB de memoria. El archivo de 14 GB en Ollama corrobora ese límite mínimo, pero los 2 GB restantes representan apenas un 12.5% de margen antes de considerar el runner, el sistema operativo y la caché de contexto. Un sistema con 24 GB es una recomendación notablemente más cómoda si se pretende someter el modelo a un trabajo continuado en vez de a prompts breves.

Ideal para: Razonamiento sobre texto, herramientas, salidas estructuradas y flujos de agentes.
Aspecto destacado: 3.6 mil millones de parámetros activos, esfuerzo de razonamiento ajustable y requisito mínimo oficial de 16 GB.
Precios: Pesos abiertos bajo Apache 2.0; sin suscripciones para uso local.
Prueba gratuita: No aplica para pesos descargables.

Lo bueno
Lo que hace bien
4 points

  • Excelente soporte nativo para flujos orientados a razonamiento y uso de herramientas.
  • La licencia Apache 2.0 simplifica el despliegue en múltiples proyectos comerciales.
  • Structured Outputs y esfuerzo de razonamiento configurable facilitan el diseño de aplicaciones.
  • El paquete de 14 GB es considerablemente menor que el de 24 GB de Qwen3.6.
Lo malo
Dónde se queda corto
3 points

  • Solo admite texto, por lo que no sustituye a un asistente multimodal.
  • El umbral oficial de 16 GB deja un margen de trabajo sumamente estrecho.
  • Una conversación larga de 128K exige más memoria de la que sugiere el archivo base.

5. Phi-4-mini-instruct: el mejor LLM local pequeño para CPU y 4 GB de VRAM

Phi-4-mini-instruct es el mejor LLM local de dimensiones reducidas para entornos de hardware limitado. La ficha de Microsoft detalla 3.8 mil millones de parámetros, un límite de contexto de 128K, entrada exclusiva de texto, soporte para 24 idiomas y licencia MIT. El archivo Q4_K_M en Ollama ocupa 2.5 GB, encajando con solvencia en una GPU dedicada de 4 GB o en un equipo sin GPU con al menos 8 GB de RAM de sistema.

Ficha oficial de modelo de Microsoft para Phi-4-mini-instruct
Phi-4-mini-instruct

El escenario práctico comprende utilidades locales concretas: reescribir respuestas de atención al cliente, extraer campos de textos cortos, clasificar notas o apoyar en scripts pequeños de Python sin enviar datos a APIs externas. Microsoft lo orienta expresamente a entornos con restricciones de memoria, cómputo y latencia, así como a tareas de razonamiento y matemáticas. Esta es una justificación sólida para seleccionarlo, en lugar de esperar que compita directamente con un modelo de 24 GB en cada tarea.

Su principal debilidad es transparente: la fecha de corte estática de su entrenamiento es junio de 2024. Microsoft advierte que, debido a su tamaño compacto, almacena menos conocimiento factual y puede cometer imprecisiones. La ficha técnica recomienda el uso de búsquedas o generación aumentada por recuperación (RAG) para mitigar esto. En términos prácticos: suminístrele los datos de origen para tareas factuales en lugar de recurrir a su memoria entrenada.

Ideal para: Utilidades ligeras en CPU, hardware antiguo, tareas de texto cortas y GPUs de 4 GB.
Aspecto destacado: Artefacto Q4_K_M de 2.5 GB bajo licencia MIT.
Precios: Pesos descargables con licencia MIT; el hardware local asume el coste.
Prueba gratuita: No aplica para pesos descargables.

Lo bueno
Lo que hace bien
4 points

  • El paquete creíble más pequeño de la selección principal.
  • Licencia MIT clara y permisiva.
  • Diseñado de fábrica para condiciones restrictivas de memoria y latencia.
  • Soporte para llamadas a funciones con herramientas documentado en su ficha.
Lo malo
Dónde se queda corto
4 points

  • Exclusivo para texto.
  • Corte de conocimiento en junio de 2024.
  • Microsoft advierte que su limitada capacidad factual puede provocar errores en respuestas directas.
  • Las conversaciones largas pueden perder coherencia a pesar del límite teórico de 128K.

6. Qwen3-Coder-Next: el mejor LLM local para programación en 64 GB o más

Qwen3-Coder-Next es el mejor LLM local especializado en desarrollo para máquinas con 64 GB o más. Qwen lo diseñó específicamente para agentes de programación y desarrollo local, integrando 80 mil millones de parámetros totales, 3 mil millones activos, razonamiento a largo plazo, uso complejo de herramientas, recuperación ante fallos de ejecución y un contexto nativo de 262,144 tokens. Su compilación Q4_K_M en Ollama alcanza los 52 GB.

Ficha oficial de Qwen3-Coder-Next
Qwen3-Coder-Next

Es el modelo concebido para ingenieros senior que necesitan un agente autónomo local capaz de navegar por un repositorio amplio, invocar herramientas, editar archivos y corregir errores tras la ejecución fallida de comandos. No debe usarse como primera opción para chat general, visión o en portátiles de 32 GB. La documentación oficial estipula que opera exclusivamente en modo "non-thinking", lo que implica que no genera bloques de razonamiento visibles.

El valor de 3 mil millones de parámetros activos induce a error con frecuencia. El archivo de Ollama pesa 52 GB porque los 80 mil millones de pesos totales deben cargarse en el paquete. Situar este volumen en 64 GB deja solo 12 GB libres (un 18.75%) antes de que el runtime y la caché tomen su parte; por ende, 64 GB representa un suelo estricto y disponer de mayor memoria resulta clave para trabajar a escala de repositorio.

Qwen sugiere explícitamente bajar el contexto a 32,768 tokens tras experimentar problemas de memoria. Esa es la reacción adecuada en una máquina de 64 GB. Mantener un contexto más corto que garantice la fluidez del agente es preferible a forzar el límite máximo de 262,144 tokens.

Ideal para: Agentes locales de código, interacción con repositorios y flujos avanzados de desarrollo en 64 GB o más.
Aspecto destacado: 80 mil millones de parámetros totales, 3 mil millones activos, paquete Q4_K_M de 52 GB y diseño específico para agentes.
Precios: Pesos abiertos bajo Apache License 2.0 incluidos en el artefacto de Ollama; hardware independiente.
Prueba gratuita: No aplica para pesos descargables.

Lo bueno
Lo que hace bien
4 points

  • Diseñado expresamente para agentes de software y desarrollo local.
  • Manejo de herramientas y recuperación ante errores integrados de forma nativa.
  • Contexto nativo masivo en estaciones de trabajo capaces de albergar la caché.
  • Paquete actual verificado con comando directo de ejecución en Ollama.
Lo malo
Dónde se queda corto
4 points

  • El paquete de 52 GB excluye a casi la totalidad de portátiles convencionales.
  • Su alta especialización en programación lo desaconseja como asistente de uso general.
  • Funciona únicamente en modo "non-thinking".
  • El contexto completo puede desencadenar errores de memoria en el umbral mínimo de hardware.

Ollama vs LM Studio vs llama.cpp

El modelo establece el techo de capacidad, pero el runner determina la fricción entre la descarga y el servicio del endpoint local. Ollama es la opción para automatización, LM Studio la elección para entornos gráficos y llama.cpp la herramienta para control total del hardware. Los tres pueden convivir en el mismo equipo.

Tres accesos físicos que comparan Ollama, LM Studio y llama.cpp por interfaz y nivel de control
Elija el runner según la interfaz requerida: CLI y API, interfaz gráfica o control de bajo nivel.

Ollama: la vía más directa para CLI y API

Ollama destaca cuando el modelo local debe convertirse rápidamente en un comando de terminal, un script o un endpoint de API. Su plan Free actual cubre modelos locales en su propio hardware, interfaz de línea de comandos (CLI), API y aplicaciones de escritorio. El uso local es siempre ilimitado, siendo este el único factor de precio relevante para despliegues estrictamente en local.

Página de precios actual de Ollama con niveles Free, Pro, Max, Team y Enterprise
Ollama

Los planes de pago de Ollama proporcionan capacidad de cómputo en la nube, no cobros por inferencia local. Los precios y límites siguientes fueron verificados el 5 de agosto de 2026.

NivelPrecioConcurrencia en la nubeLímite destacado
Free$0Uso ligero en la nubeHardware local ilimitado
Pro$20/mes o $200/año3 modelos en la nube50x más uso en la nube que Free
Max$100/mes10 modelos en la nubeNuevos registros pausados; 5x uso de Pro
Team$25/usuario/mesUso compartido para equiposMínimo 5 usuarios, mínimo $125/mes
EnterpriseA medidaA medidaCondiciones por volumen y soporte

Los límites de sesión individual en la nube se restablecen cada 5 horas, y los semanales cada 7 días. Dichos límites no afectan a los modelos que operan en su propio hardware. Para la recomendación principal, la puesta en marcha local se reduce a un comando tras la instalación: ollama run qwen3.6:35b-a3b.

Ideal para: Desarrolladores que buscan CLI local limpio, API, aplicación de escritorio y etiquetas predecibles.
Aspecto destacado: Uso gratuito e ilimitado en hardware local con planes cloud opcionales.
Precios: Free $0; Pro $20 al mes o $200 al año; Max $100 al mes (registros pausados); Team $25 por usuario al mes (mínimo 5 usuarios); Enterprise personalizado.
Prueba gratuita: El nivel Free es permanente, no una prueba temporal.

LM Studio: la mejor experiencia gráfica para modelos locales

LM Studio es el runner recomendado si prefiere descargar, configurar e interactuar con el modelo a través de una interfaz de usuario visual. Su guía oficial organiza el flujo mediante las pestañas Discover, un cargador de modelos y la sección Chat. El plan Free permite ejecutar LLM locales y transcripción de voz en el equipo del usuario, garantizando en su política que ningún dato abandona el dispositivo durante el uso local.

Página de precios actual de LM Studio para inferencia local y en la nube
LM Studio

LM Studio también permite inferencia en la nube, por lo que conviene separar sus tarifas del uso local. Precios comprobados el 5 de agosto de 2026:

  • Free, $0: LLM locales, Bionic Agent, runtimes llama.cpp y MLX, transcripción de voz offline, herramienta limitada de búsqueda web sin retención de datos con sesión iniciada y LM Link para hasta 5 dispositivos.
  • Pay as you go: créditos de nube facturados por cada 1 millón de tokens. DeepSeek V4 Flash cuesta $0.13 entrada, $0.028 entrada en caché y $0.26 salida. DeepSeek V4 Pro cuesta $1.74 entrada, $0.15 entrada en caché y $3.48 salida.
  • Pay as you go, continuación: GLM-5.2 cuesta $1.50 entrada, $0.30 entrada en caché y $4.50 salida. Kimi K2.6 cuesta $0.95 entrada, $0.16 entrada en caché y $4.00 salida. Kimi-K2.7-Code cuesta igualmente $0.95 entrada, $0.16 entrada en caché y $4.00 salida. Kimi K3 cuesta $3.00 entrada, $0.30 entrada en caché y $15.00 salida.
  • Bionic Pass: precios y detalles del plan pendientes de publicación.

Para un fundador que evalúa modelos en un único equipo, la interfaz gráfica de Free es el gran motivo para decantarse por LM Studio. Para proyectos que requieran servicios reproducibles bajo control de versiones, Ollama o llama.cpp ofrecen un flujo operativo más limpio.

Ideal para: Exploración visual de modelos, carga interactiva y chat en local.
Aspecto destacado: Experiencia de escritorio a $0 con runtimes de llama.cpp y MLX.
Precios: Free $0; inferencia en la nube mediante pago por uso según tarifas anteriores; Bionic Pass aún sin precio.
Prueba gratuita: El nivel Free es permanente, no una prueba temporal.

llama.cpp: la referencia para control de hardware e inferencia híbrida

llama.cpp es la opción para quienes necesitan control total sobre la máquina, las flags de compilación y la ubicación exacta de las capas. El proyecto actual bajo licencia MIT es compatible con Apple Silicon mediante Metal, GPUs NVIDIA a través de CUDA, GPUs AMD con HIP e inferencia híbrida CPU-GPU para modelos que superan la VRAM disponible. Incluye CLI, servidor y una interfaz web integrada.

Repositorio oficial de GitHub de llama.cpp y backends de hardware compatibles
llama.cpp

El caso de uso habitual es una estación de trabajo a medida donde parte del modelo se ubica en la GPU y el resto se deriva a la memoria de sistema, o donde se exige un backend concreto. El comando llama serve inicia el servidor local del proyecto. Esa flexibilidad exige, en contrapartida, mayor esfuerzo de configuración y la responsabilidad de seleccionar los archivos GGUF e indicadores de ejecución correctos.

llama.cpp no cuenta con tablas de precios comerciales: es software de código abierto con licencia MIT. El único coste asociado es el hardware y el tiempo de ingeniería dedicado a su ajuste.

Ideal para: Hardware personalizado, inferencia híbrida CPU/GPU y control de despliegue a bajo nivel.
Aspecto destacado: Compatibilidad exhaustiva con diversos backends y servidor nativo sin costes de producto.
Precios: Código abierto con licencia MIT; sin versiones de pago.
Prueba gratuita: No aplica.

Lo bueno
Lo que hace bien
3 points

  • Ollama ofrece la ruta más rápida hacia un comando reproducible y una API.
  • LM Studio proporciona el entorno gráfico más intuitivo para interactuar con modelos.
  • llama.cpp concede el control más profundo del backend y la gestión del hardware.
Lo malo
Dónde se queda corto
3 points

  • La oferta de servicios cloud de Ollama puede ocultar que su uso local es totalmente ilimitado.
  • La interfaz de LM Studio es menos idónea para despliegues automatizados mediante scripts.
  • llama.cpp requiere que el usuario gestione los formatos del modelo y múltiples parámetros técnicos de ejecución.

Cómo se han seleccionado estos LLM locales

La fecha de corte de esta comparativa fue el 5 de agosto de 2026. Los modelos debían contar con documentación oficial actualizada, pesos descargables, aplicabilidad real en tareas de consumo o nivel profesional y artefactos ejecutables cuyo tamaño pudiera contrastarse en páginas oficiales de runtimes.

La clasificación aplicó seis criterios:

  1. Huella práctica en 4 bits: el archivo actual del modelo debía ajustarse a un nivel de memoria definido dejando margen operativo.
  2. Utilidad operativa: cada modelo debía resolver una necesidad clara, como procesamiento multimodal, herramientas de razonamiento, bajo consumo de memoria o funciones agénticas para código.
  3. Pertenencia a familias actuales: se descartaron versiones anteriores cuando existía una arquitectura sucesora ya documentada y ejecutable.
  4. Límites documentados por el creador: contexto, modalidades, condiciones de licencia y limitaciones técnicas se tomaron de fichas oficiales del fabricante o proyectos originales.
  5. Disponibilidad en runners: existencia de un artefacto actual en Ollama o compatibilidad explícita en runners vigentes.
  6. Exclusión rigurosa: los modelos concebidos para servidores no se catalogaron para consumo por el mero hecho de presentar un número bajo de parámetros activos.

No se empleó una puntuación benchmark cruzada como criterio universal, dado que los proveedores no publican configuraciones de prueba homogéneas. El veredicto final se fundamenta en la viabilidad técnica del despliegue y la carga de trabajo prevista, factores que cualquier usuario puede comprobar antes de iniciar descargas masivas.

Por este motivo la lista reúne seis modelos específicos en lugar de extenderse de forma artificial. Qwen3.6 y Gemma 4 sustituyen recomendaciones de generaciones pasadas, mientras que los tramos de memoria impiden duplicar opciones prácticamente idénticas.

Modelos que conviene evitar en equipos de consumo estándar

Evitar no significa que sean deficientes. Significa que resultan inadecuados ante la consulta de un usuario con hardware convencional.

Mistral Small 4 es un modelo actual y potente con entrada de texto e imágenes, razonamiento configurable, ventana de contexto de 256K y licencia Apache 2.0. Sin embargo, suma 119 mil millones de parámetros totales y 6 mil millones activos por token. Ese volumen total de pesos lo sitúa como opción para servidores o estaciones de trabajo dedicadas, no para un portátil cotidiano.

Llama 4 Scout cuenta con 109 mil millones de parámetros totales y 17 mil millones activos. Meta indica que la versión Int4 requiere una GPU NVIDIA H100 individual. Llama 4 Maverick alcanza los 400 mil millones de parámetros totales con 17 mil millones activos, y Meta lo vincula a servidores H100. Son especificaciones técnicas relevantes, pero alejadas del hardware doméstico.

DeepSeek-V4-Flash puede parecer una versión ligera por su denominación, pero integra 284 mil millones de parámetros totales y 13 mil millones activos. DeepSeek-V4-Pro asciende a 1.6 billones totales y 49 mil millones activos. Ambos soportan 1 millón de tokens de contexto en los servicios en la nube de DeepSeek, lo cual demuestra la solvencia de su infraestructura remota, no que sus pesos deban instalarse en un ordenador de escritorio común.

Una lista actualizada en 2026 no debería abrirse con Llama 3.1 8B, Mistral 7B, Phi-3.5 Mini, Gemma 2 9B o Qwen2.5 7B únicamente por inercia de publicaciones pasadas. Siguen siendo útiles en despliegues ya consolidados, pero las familias actuales Qwen3.5, Qwen3.6, Gemma 4 y Phi-4 constituyen el punto de partida obligado para nuevas implementaciones.

La distinción es relevante respecto a los costes de migración. Un sistema en producción estable no necesita cambiar de modelo por pura novedad; sin embargo, un proyecto nuevo debe evaluar primero las arquitecturas vigentes bajo sus mismas restricciones de memoria y licencias.

Guía final para decidir

Con 4 GB de VRAM dedicada, recurra a Phi-4-mini-instruct para tareas delimitadas de texto y suminístrele los datos de referencia en consultas factuales. Con 8 GB de VRAM dedicada, opte por Qwen3.5-9B con contexto moderado para lograr el equilibrio compacto más completo entre texto, imagen y código.

En 16 GB, use Gemma 4 12B si precisa tratar imágenes, audio o vídeo. Elija gpt-oss-20b si la prioridad es el razonamiento, las herramientas y la generación de texto estructurado, procurando disponer de 24 GB de memoria global si el ordenador ejecutará otras herramientas de desarrollo en paralelo.

En 32 GB, seleccione Qwen3.6-35B-A3B. Es la alternativa integral más equilibrada de esta comparativa: su paquete de 24 GB mantiene un margen libre útil a la vez que ofrece soporte multimodal y programación orientada a agentes.

En 64 GB o más, escoja Qwen3-Coder-Next exclusivamente si el trabajo principal recae en agentes de programación. Su paquete de 52 GB y su diseño hiperespecializado resultan desproporcionados para chat básico, pero idóneos para desarrollo local sobre repositorios completos.

Para profundizar en modelos de pesos abiertos sin el límite de hardware de consumo, consulte la comparativa de mejores LLM de código abierto. Si la elección del modelo está decidida pero busca alternativas al runner, revise las alternativas actuales a Ollama.

La elección del runner es sencilla: Ollama para automatización por línea de comandos y API, LM Studio para interfaz gráfica y llama.cpp para control sobre el hardware. El mejor LLM local es siempre aquel que cabe en la máquina, resuelve la tarea y preserva memoria suficiente para completar el prompt.

Preguntas frecuentes

¿Cuál es el mejor LLM local para programación en 2026?

Qwen3-Coder-Next es la opción especializada en equipos con 64 GB o más, ya que su archivo actual Q4_K_M ocupa 52 GB y está pensado para agentes de código. Qwen3.6-35B-A3B es la alternativa superior más equilibrada para programar en 32 GB.

¿Cuál es el mejor LLM local para 16 GB de RAM?

Gemma 4 12B es la opción multimodal más equilibrada, ya que su archivo actual para Ollama ocupa 7.6 GB. gpt-oss-20b alcanza el suelo de 16 GB fijado por OpenAI para razonamiento, pero sus 14 GB dejan apenas 2 GB libres antes del runtime y la memoria de contexto.

¿Es mejor Ollama que LM Studio para LLM locales?

Ollama resulta más adecuado para entornos de terminal (CLI), scripts y APIs. LM Studio es la opción preferible si se valora una interfaz gráfica para explorar, cargar e interactuar con modelos mediante chat. Ambos ofrecen uso local a $0.

¿Cuánta RAM o VRAM necesito para un LLM local?

Tome como base el peso del modelo cuantizado y sume margen para el runner, el sistema operativo y la caché KV. Las alternativas prácticas analizadas oscilan entre 2.5 GB para equipos muy modestos y 52 GB para modelos que demandan 64 GB o más.

¿Son gratis los LLM locales?

Los modelos de esta comparativa ofrecen pesos abiertos descargables, por lo que no conllevan tarifas por prompt en inferencia local. El hardware, el almacenamiento, la memoria, la energía eléctrica, el tiempo de configuración y los servicios cloud opcionales siguen teniendo un coste asociado.

Obtenga la lista de verificación para auditar flujos de trabajo de IA empresarial y determine con criterio qué automatizaciones conviene construir en local o alojadas en la nube.

Última actualización

4 sept 2026

CategoríaBuild

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Newsletter

Una carta, cada domingo. Sistemas que funcionan, no opiniones calientes.

Build logs, sistemas en producción y notas de campo de un portafolio de ventures de IA.

Semanal. Sin spam. Cancele cuando quiera.