Análisis de Kimi K3: rendimiento de frontera a mitad del costo de la API, pero aún sin pesos

Kimi K3 ofrece rendimiento de frontera y una API más barata para agentes de código, pero sus pesos y el informe técnico aún no son públicos.

Thursday, September 3, 2026Omid Saffari
Análisis de Kimi K3: rendimiento de frontera a mitad del costo de la API, pero aún sin pesos

Este análisis de Kimi K3 concluye que es el modelo que conviene probar para programación con caché y tareas de largo horizonte, pero todavía no el indicado para convertir en estándar. Su API cuesta $3 por cada millón de tokens de entrada sin caché y $15 por cada millón de tokens de salida, aproximadamente la mitad del costo combinado por tokens de GPT-5.6 Sol; sin embargo, los pesos prometidos y el informe técnico aún no son públicos, y la propia documentación de Kimi advierte sobre cambios de sesión inestables, acciones demasiado impulsivas y una brecha en la experiencia de usuario.

Kimi K3 se lanzó el 16 de julio de 2026 como el modelo insignia de Moonshot AI para programación, agentes y trabajo del conocimiento de principio a fin. Ya está disponible en Kimi.com, Kimi Work, Kimi Code y mediante la API kimi-k3.

Página de lanzamiento de Kimi K3 con detalles del modelo y gráficos de benchmarks
Kimi K3

Este lanzamiento importa porque K3 entra en la conversación sobre precio y rendimiento de los modelos de frontera sin pretender dominar en todos los frentes. La propia Kimi reconoce que, en términos generales, el modelo aún está por detrás de Claude Fable 5 y GPT-5.6 Sol. Esa franqueza hace más creíble su ventaja específica: K3 ofrece una capacidad sólida para tareas prolongadas a una tarifa de API bastante menor.

Análisis de Kimi K3: el veredicto en una tabla

Kimi K3 merece una prueba controlada en producción, no una migración como modelo predeterminado. Es lo bastante barato para evaluarlo con trabajo real y lo bastante capaz para imponerse en rutas concretas, pero las limitaciones de su lanzamiento hacen que un cambio total sea prematuro.

ModeloIdeal paraPrecio de API por 1M, entrada / salidaEntrada en cachéEvidencia actualPrincipal obstáculo
Kimi K3Programación con contexto largo en caché, trabajo en repositorios y pruebas de agentes sensibles al costo$3 / $15$0.3057 en el Artificial Analysis Intelligence Index, #4 de 189Los pesos y el informe técnico no son públicos; solo está disponible el esfuerzo máximo
GPT-5.6 SolUso maduro de herramientas, decisiones difíciles y enrutamiento amplio en producción$5 / $30$0.50Modelo de frontera con un contexto de 1,050,000 tokens y un ecosistema maduro de herramientasMayor precio de salida
Claude Fable 5Trabajo prolongado en el que la autonomía y el criterio justifican pagar más$10 / $50$1 después del descuento de caché del 90%El modelo de Anthropic con mayor capacidad y disponibilidad generalEl precio más alto; algunas solicitudes sensibles pasan a Opus 4.8

La regla de decisión es sencilla: conviene probar K3 cuando el costo limita una ruta de agente con contexto largo; Sol o Fable siguen siendo preferibles cuando un error cuesta más que el ahorro en tokens. Si el requisito es alojar el modelo en infraestructura propia, hay que esperar a que se publiquen los pesos y la licencia.

Qué es realmente Kimi K3

Kimi K3 es un modelo de mezcla de expertos a escala de infraestructura, no un enorme modelo denso que active sus 2.8 billones de parámetros con cada token. Una mezcla de expertos dirige cada token por un pequeño grupo de subredes especializadas. K3 utiliza Stable LatentMoE para activar 16 de sus 896 expertos; así puede ofrecer respuestas a un precio de API inferior al de los líderes de frontera cerrados pese a su tamaño.

Su guía oficial de inicio rápido fija las especificaciones clave:

  • 2.8 billones de parámetros en total.
  • 1,048,576 tokens de contexto, con tarifa plana por token y sin un nivel de precio especial para contexto largo.
  • Comprensión visual nativa, con entrada de texto e imágenes y salida de texto.
  • Kimi Delta Attention, un diseño híbrido de atención pensado para transportar información de manera eficiente a través de secuencias largas.
  • Attention Residuals, un método que recupera representaciones útiles a distintas profundidades del modelo en vez de acumular todas las capas de forma uniforme.
  • Caché automática de contexto, sin necesidad de un ID de caché, un tiempo de vida ni un parámetro adicional en la solicitud.

Kimi atribuye a estos cambios de arquitectura y entrenamiento una mejora aproximada de 2.5x en la eficiencia de escalado frente a K2. Debe entenderse como una afirmación del proveedor sobre la arquitectura, no como un benchmark de aplicaciones. La consecuencia práctica para quien evalúa la compra es más fácil de comprobar: K3 ofrece un espacio de trabajo de un millón de tokens y cobra una décima parte de la tarifa de entrada sin caché cuando el prefijo se encuentra en caché.

K3 ya está disponible en cuatro modalidades. Kimi.com es la interfaz de chat. Kimi Work, desde la versión 3.1.0, lo lleva a Windows y a equipos Mac con Apple silicon. En Kimi Code se selecciona desde la terminal con /model. Para desarrollo, se invoca el modelo kimi-k3 mediante la API de Kimi.

La API admite llamadas a herramientas, JSON Mode, salida estructurada, restricciones para elegir herramientas y carga dinámica de herramientas. La entrada visual tiene una limitación poco cómoda: no acepta URL públicas de imágenes, por lo que las aplicaciones deben enviar datos base64 o una referencia de archivo de Kimi.

Los benchmarks muestran nivel de frontera, no el primer puesto

Las mediciones independientes sitúan a Kimi K3 cerca de la cima, pero también revelan el costo que no se ve en una tarifa baja: es lento y genera respuestas extensas. Artificial Analysis le otorga 57 puntos y lo coloca en el puesto #4 de 189 modelos. Mide una velocidad de 62.0 tokens de salida por segundo, puesto #91 de 189, y registra 130M tokens de salida en su Intelligence Index frente a un promedio de 63M.

Esa verbosidad importa porque la salida es la parte cara de la factura de K3. Artificial Analysis informa que gastó $2,709.75 para evaluar el modelo. Un modelo puede ser barato por token y, aun así, resultar caro por resultado aceptado si genera aproximadamente el doble del volumen de salida del conjunto de comparación.

La tabla de benchmarks de Kimi dibuja un patrón de capacidades con más matices:

BenchmarkKimi K3Claude Fable 5GPT-5.6 SolLectura
DeepSWE67.570.073.0K3 queda por detrás de ambos en esta prueba de ingeniería de software
Program Bench77.876.877.6K3 lidera por un margen estrecho
Terminal-Bench 2.188.384.688.8K3 casi empata con Sol y supera el resultado indicado de Fable
FrontierSWE81.286.671.3K3 queda entre los líderes
SWE Marathon42.035.039.0K3 lidera en esta prueba de mayor horizonte
GDPval-AA v2, Elo166817601748K3 queda por detrás de ambos en trabajo profesional general
BrowseComp91.288.090.4K3 lidera la prueba de navegación en la tabla del proveedor

Son resultados serios, pero no constituyen una comparación directa y uniforme. Kimi ejecutó K3 con razonamiento máximo, temperatura 1.0 y top-p 1.0. El sistema que corre la evaluación cambia según la fila entre Kimi Code, Claude Code y Codex. Algunos resultados de Fable 5 pueden incluir el cambio automático a Opus 4.8. La tabla permite describir a K3 como competitivo en la frontera, pero no como ganador universal.

La evidencia independiente y la del proveedor coinciden en la conclusión útil. K3 tiene capacidad suficiente para disputar una ruta de producción. Aún no ha demostrado lo necesario para sustituirlas todas.

Lo bueno
Lo que hace bien
10 points

  • K3 cuesta $3 de entrada y $15 de salida por cada millón de tokens sin caché, muy por debajo de Sol y Fable 5.
  • La entrada con acierto de caché baja a $0.30 por millón de tokens gracias al almacenamiento automático de prefijos.
  • El contexto de 1,048,576 tokens no está sujeto a una tarifa especial para contexto largo.
  • La visión nativa, la salida estructurada, las llamadas a herramientas y la carga dinámica de herramientas cubren las funciones esenciales de un agente.
  • Una medición independiente sitúa a K3 en el puesto #4 de 189 modelos dentro de un índice amplio de inteligencia.
  • Los pesos completos, la licencia final y el informe técnico todavía no son públicos.
  • Solo está disponible el esfuerzo de razonamiento máximo, así que no existe una opción de esfuerzo más barata o rápida para tareas sencillas.
  • Kimi advierte que omitir el historial de razonamiento o cambiar de modelo a mitad de una sesión puede desestabilizar la calidad.
  • La herramienta de búsqueda web de Kimi se está actualizando y no se recomienda a corto plazo.
  • Las mediciones independientes encuentran que K3 es más lento y mucho más verboso que el promedio de comparación.

Precio de la API de Kimi K3: la verdadera razón para probarlo

El primer argumento de Kimi K3 para entrar en producción es el costo, sobre todo cuando una sesión de programación reutiliza un prefijo estable del repositorio. La tarifa oficial cobra $0.30 por cada millón de tokens de entrada encontrados en caché, $3 por cada millón que no está en caché y $15 por cada millón de tokens de salida.

Para un millón de tokens de entrada sin caché más un millón de tokens de salida, la comparación directa queda así:

  • Kimi K3: $18
  • GPT-5.6 Sol: $35
  • Claude Fable 5: $60

En esa carga de trabajo deliberadamente simple, K3 cuesta un 48.6% menos que Sol y un 70% menos que Fable.

Un ejemplo más representativo para un agente de programación sería un mes con 10M tokens de entrada y 1M de salida, donde 9M tokens de entrada son lo bastante estables para aprovechar la caché. Kimi afirma que su API oficial supera una tasa de aciertos de caché del 90% en cargas de programación, aunque la estructura del repositorio y la estabilidad del prefijo determinan si una aplicación puede reproducirla.

  • K3: 9 x $0.30 de entrada en caché + 1 x $3 de entrada sin caché + 1 x $15 de salida = $20.70.
  • Sol: 9 x $0.50 de entrada en caché + 1 x $5 de entrada sin caché + 1 x $30 de salida = $39.50.
  • Fable: 9 x $1 de entrada en caché + 1 x $10 de entrada sin caché + 1 x $50 de salida = $69.00.

Sin ningún acierto de caché, esa misma carga cuesta $45 con K3, $80 con Sol y $150 con Fable. La caché no crea la ventaja de precio de K3, pero sí la conserva durante las sesiones largas.

Diagrama de decisión que compara el costo de cargas con caché en Kimi K3, GPT-5.6 Sol y Claude Fable 5
Con una tasa de aciertos del 90% en la caché de entrada, K3 ofrece la prueba seria más barata.

La trampa está en optimizar el precio por token en vez del costo por resultado aceptado. Artificial Analysis observó que K3 generó 130M tokens de salida frente a un promedio comparativo de 63M. Si una ruta exige más revisión, generaciones más largas o correcciones repetidas, la tarifa de salida de $15 puede borrar parte del ahorro anunciado.

La membresía para usuarios es una vía de compra distinta de la API. Los precios oficiales de membresía incluyen un plan Adagio gratuito con 6 créditos de Agent y una tarea de Agent simultánea, pero sin créditos de Kimi Code. Moderato comienza en $19 al mes, o $15 al mes con facturación anual, e incluye 60 créditos de Agent y 1x créditos de Kimi Code. Los niveles mensuales superiores son Allegretto por $39, Allegro por $99 y Vivace por $199.

El plan gratuito sirve para conocer la interfaz y el estilo de respuesta de K3. No sustituye una evaluación de la API con una carga de producción, porque los créditos de la membresía y la facturación de tokens de la API se contabilizan por separado.

Las barreras de producción pesan más que la demostración

El riesgo de llevar Kimi K3 a producción no está en su inteligencia bruta. Está en la interacción entre el estado de la sesión, el esfuerzo de razonamiento fijo, los permisos de las herramientas y una experiencia de producto aún inmadura.

Conserve todo el historial de razonamiento

K3 se entrenó para recibir el historial de razonamiento completo a lo largo de una sesión. Kimi advierte que la calidad puede volverse muy inestable si el entorno del agente descarta ese historial o cambia una sesión existente de otro modelo a K3. No es un simple detalle del formato del prompt: un experimento de enrutamiento puede hacer que K3 parezca peor de lo que es si el modelo cambia a mitad de la conversación.

La evaluación de K3 debe comenzar en una sesión nueva y conservar intacto todo el historial del asistente. No conviene compararlo cambiando únicamente el ID del modelo a mitad de una trayectoria iniciada con Sol o Fable.

El esfuerzo máximo es la única opción

K3 siempre razona y, por ahora, reasoning_effort solo acepta max. Hay controles inferiores y superiores previstos, pero todavía no están disponibles. Esto elimina una palanca útil en producción: las tareas simples no pueden pasar por el mismo endpoint con un nivel de esfuerzo más rápido y barato.

Para un fundador con financiación que depura una migración compleja, el esfuerzo máximo obligatorio puede ser razonable. Para el responsable tecnológico de una empresa mediana que enruta miles de clasificaciones corrientes, supone un desperdicio. Es preferible mantener un modelo más barato junto a K3 en vez de asignarle todas las solicitudes.

Limite las acciones con más rigor que los prompts

Kimi señala que K3 puede tomar decisiones inesperadas cuando las instrucciones son ambiguas, porque se entrenó para avanzar en tareas de largo horizonte. La solución práctica no es alargar el prompt de personalidad, sino definir una política de acciones explícita: herramientas permitidas, confirmación antes de escrituras externas, topes de gasto, rutas de archivos acotadas y capacidad de revertir cambios.

Un agente que entrega un buen parche pero también modifica una configuración ajena a la tarea no ejerce una autonomía útil. El comportamiento proactivo es una capacidad que exige reducir el alcance potencial de los daños.

Todavía no conviene depender de la herramienta de búsqueda web

La documentación de la API de Kimi indica que la búsqueda web se está actualizando y no se recomienda a corto plazo. Por eso, los agentes de investigación necesitan una capa externa de búsqueda o recuperación en lugar de dar por lista la herramienta oficial de K3.

Kimi también reconoce una brecha perceptible en la experiencia de usuario frente a Fable 5 y Sol. La expresión es amplia, pero las limitaciones que la rodean la vuelven concreta: la compatibilidad de sesiones es frágil, el enrutamiento por esfuerzo está incompleto y una herramienta oficial atraviesa una transición. Ninguno de estos defectos invalida el modelo, pero sí delimita el alcance de una prueba sensata.

Los pesos abiertos siguen siendo una promesa hasta el 27 de julio

Kimi K3 no es una opción disponible para alojamiento propio el 17 de julio de 2026. Kimi promete publicar los pesos completos del modelo a más tardar el 27 de julio, y el informe técnico llegará junto con ellos. Hasta que esos artefactos y la licencia final sean públicos, «abierto» describe el destino anunciado, no un recurso descargable listo para producción.

La escala también cambia lo que significa disponer de pesos abiertos. Con 2.8 billones de parámetros, los pesos sin procesar ocupan aproximadamente 1.4 TB a 4 bits por parámetro o 5.6 TB a 16 bits por parámetro, antes de sumar la sobrecarga de ejecución, la caché, las activaciones y la redundancia. Kimi recomienda despliegues de supernodos con 64 aceleradores o más.

Eso es infraestructura de centro de datos, no un modelo para una estación de trabajo. A un desarrollador técnico independiente le conviene alquilar la API. Una empresa mediana que valore la inferencia privada debería presupuestar el clúster, la red, el personal de operación y el margen de capacidad antes de considerar el alojamiento propio como un plan de ahorro.

La diferencia importa:

  • Pesos abiertos significa que los parámetros entrenados se pueden descargar.
  • Código abierto también exige código y términos de licencia que permitan el uso previsto.
  • Alojamiento propio viable significa que el modelo cabe en una infraestructura y un presupuesto operativo sostenibles.

El panorama actual de modelos con pesos abiertos ya incluye opciones más pequeñas y fáciles de desplegar. K3 podría sumarse en la frontera de capacidad, pero primero deben llegar los archivos de lanzamiento y la licencia.

Kimi K3 vs GPT-5.6 Sol y Claude Fable 5: ¿cuál conviene?

La elección debe basarse en el costo de un fallo, no en la mejor fila de benchmarks de cada modelo.

SituaciónElecciónPor quéCuándo descartarlo
Un agente de programación lee repetidamente un repositorio grande y establePrueba con Kimi K3La caché automática y la entrada en caché a $0.30 abaratan las sesiones largasEl entorno no puede conservar todo el historial de razonamiento
Un agente de producción necesita herramientas maduras y amplias, además de criterio para decisiones difícilesGPT-5.6 SolCapacidad general sólida, herramientas maduras de web y computadora, y una plataforma de producción vigenteLa salida domina la factura y K3 iguala la calidad en esa ruta
Una tarea de varios días y consecuencias importantes premia el criterio por encima del precioClaude Fable 5Está diseñado para trabajo ambicioso y prolongado, con validaciónEl precio de salida de $50 no se compensa con menos correcciones
Los datos deben permanecer en infraestructura bajo control propioEsperar o elegir otro modelo abiertoLos pesos y la licencia final de K3 no son públicosSe puede aceptar una API durante la evaluación
Un gran volumen de trabajo sencillo exige baja latencia y poco gasto de razonamientoNingún modelo insignia por defectoK3 solo ofrece esfuerzo máximo; Sol y Fable son rutas premiumUna tasa de fallos medida demuestra que el modelo insignia compensa su costo

Kimi K3 es la prueba de precio y rendimiento

Kimi K3 es el experimento adecuado cuando el contexto largo, el trabajo sobre repositorios con caché o la visión nativa aportan una ventaja real a la carga de trabajo. Con $3 de entrada, $0.30 de entrada en caché y $15 de salida por millón de tokens, tiene margen para perder algo de eficiencia y aun así superar en costo a los líderes de frontera. Conviene descartarlo si la capa de sesión no puede conservar el historial, si la búsqueda web oficial es esencial o si una acción prematura podría resultar costosa.

GPT-5.6 Sol es el estándar de producción que debe superar

GPT-5.6 Sol es una opción predeterminada más sólida cuando la ruta depende de herramientas maduras y de un comportamiento probado en distintos trabajos. Admite llamadas a funciones, salida estructurada, búsqueda web y de archivos, ejecución de código, shell alojado, uso de computadora, MCP y búsqueda de herramientas. Sus tarifas de $5 por entrada, $0.50 por entrada en caché y $30 por salida son mayores que las de K3, pero una menor carga de revisión puede justificar la diferencia. La guía actual de enrutamiento de GPT-5.6 explica cuándo conviene repartir el trabajo entre Sol, Terra y Luna.

Página de lanzamiento de OpenAI GPT-5.6 con Sol, Terra y Luna
GPT-5.6 Sol

Conviene omitir Sol cuando K3 entrega el mismo resultado aceptado en una ruta estable y repetible. Seguir pagando el precio premium de un modelo de frontera después de que la opción más barata supera la evaluación es una costumbre, no gestión de riesgos.

Claude Fable 5 es la prima por mejor criterio

Claude Fable 5 es el modelo de Anthropic con mayor capacidad y disponibilidad general para programación ambiciosa y trabajo del conocimiento. Cuesta $10 de entrada y $50 de salida por millón de tokens, con un descuento del 90% por caché del prompt en la entrada. Anthropic lo posiciona para proyectos prolongados capaces de planificar, delegar, probar y revisar su propio trabajo.

Página de producto y precios de Anthropic Claude Fable 5
Claude Fable 5

Los obstáculos son el precio y la previsibilidad del enrutamiento. Las solicitudes sensibles de ciberseguridad y biología pueden pasar a Opus 4.8. Fable solo justifica su costo adicional cuando menos correcciones, un mejor criterio o una autonomía confiable durante más tiempo producen más trabajo aceptado que K3 o Sol.

Plan reversible para evaluar Kimi K3

La forma más segura de adoptar K3 consiste en cambiar una ruta por vez y mantener listo el modelo anterior. El lanzamiento de un modelo debe tratarse como la actualización de una dependencia: observable, reversible y con un alcance suficientemente limitado para diagnosticar problemas.

Proceso de evaluación de Kimi K3 en cuatro etapas, con advertencias sobre sesiones y riesgos de herramientas
K3 debe superar las pruebas de historial, permisos y resultados antes de asumir una ruta de producción.
  1. Elija una ruta costosa

    Empiece con un trabajo en el que el costo de Sol o Fable sea relevante y K3 tenga una ventaja plausible, como depuración a escala de repositorio, análisis de documentos largos o reparación de interfaces guiada por visión. No comience con todas las llamadas de IA del producto.

  2. Mantenga fijas las condiciones de comparación

    Utilice los mismos prompts, archivos, herramientas, límites de permisos y criterios de aceptación. Mantenga constante el entorno del agente siempre que sea posible para no confundir una diferencia entre modelos con otra entre herramientas.

  3. Comience desde cero y conserve el historial

    Cree sesiones nuevas de K3, retenga todo el historial de razonamiento del asistente que exige la API y mantenga los prefijos estables idénticos byte por byte para favorecer los aciertos de caché. Nunca cambie a K3 una sesión en curso iniciada con otro modelo.

  4. Limite las acciones fuera del modelo

    Use una lista de herramientas permitidas, exija aprobación para escrituras externas y cambios destructivos, limite el gasto y conserve la posibilidad de revertir. Defina los límites en el código y los permisos, no solo en el prompt del sistema.

  5. Mida los resultados aceptados

    Registre la entrada, la entrada en caché, la salida, el tiempo transcurrido, los reintentos, el trabajo rechazado y el esfuerzo de revisión. Divida el gasto total entre los resultados aceptados. Así, una sola métrica refleja tanto la tarifa baja de K3 como su tendencia a producir salidas más largas.

  6. Promueva únicamente las rutas que gane K3

    Migre una ruta cuando K3 cumpla el nivel de calidad a un costo total menor. Mantenga Sol o Fable como vía explícita de escalamiento para los casos difíciles y deje el trabajo sencillo de gran volumen en un modelo más barato.

Este plan no exige creer que K3 sea mejor en términos generales. Exige demostrar que es mejor para un trabajo concreto. Ese es el único nivel en el que una decisión sobre modelos para producción conserva su validez a largo plazo.

¿Qué es Kimi K3?

Kimi K3 es el modelo insignia de Moonshot AI, con 2.8 billones de parámetros, creado para programación de largo horizonte, trabajo del conocimiento y razonamiento. Acepta texto e imágenes, ofrece una ventana de contexto de 1,048,576 tokens y está disponible mediante las aplicaciones, la herramienta de programación y la API de Kimi.

¿Kimi K3 será de código abierto?

Kimi afirma que publicará todos los pesos del modelo a más tardar el 27 de julio de 2026. Al 17 de julio, los pesos, la licencia final y el informe técnico no son públicos, por lo que los derechos comerciales y la viabilidad de un alojamiento propio reproducible deberán evaluarse cuando lleguen esos artefactos.

¿Se puede ejecutar Kimi AI de forma local?

K3 no es un modelo local convencional. Sus 2.8 billones de parámetros ocupan aproximadamente 1.4 TB incluso a 4 bits por parámetro antes de la sobrecarga de ejecución, y Kimi recomienda supernodos con 64 aceleradores o más. Para la mayoría de los equipos, lo adecuado es evaluar K3 mediante la API.

¿Kimi es totalmente gratis?

No. La membresía Adagio es gratuita e incluye 6 créditos de Agent, pero no créditos de Kimi Code. Las membresías de pago comienzan con Moderato por $19 al mes, mientras que la API de Kimi factura por separado los tokens de entrada y salida.

¿Kimi K3 es mejor que GPT-5.6 Sol o Claude Fable 5?

No en términos generales. K3 lidera algunas pruebas informadas por el proveedor y cuesta menos, pero Kimi reconoce que todavía queda por detrás de Sol y Fable en conjunto. La pregunta práctica es si K3 alcanza el nivel de aceptación de una ruta a un costo total menor.

¿Quiere ver qué modelos actuales encajan con cada tipo de trabajo? Obtenga gratis el mapa de herramientas de IA para responsables de negocio.

Última actualización

3 sept 2026

CategoríaAI

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Newsletter

Una carta, cada domingo. Sistemas que funcionan, no opiniones calientes.

Build logs, sistemas en producción y notas de campo de un portafolio de ventures de IA.

Semanal. Sin spam. Cancele cuando quiera.