Kimi K3 em análise: desempenho de ponta pela metade do custo da API, mas os pesos ainda não são públicos
Veja custos, benchmarks e limites do Kimi K3 e descubra onde ele pode superar GPT-5.6 Sol e Claude Fable 5 — e por que ainda não deve ser o padrão.

O Kimi K3 merece um teste em tarefas de programação longas e com bom aproveitamento de cache, mas ainda não é o modelo para adotar como padrão. A API custa $3 por milhão de tokens de entrada sem cache e $15 por milhão de tokens de saída — cerca da metade do custo combinado do GPT-5.6 Sol. Porém, os pesos e o relatório técnico prometidos ainda não são públicos, e a própria documentação da Kimi alerta para trocas de sessão instáveis, ações precipitadas e uma experiência de uso aquém das concorrentes.
O Kimi K3 foi lançado em 16 de julho de 2026 como o principal modelo da Moonshot AI para programação, agentes e trabalho de conhecimento de ponta a ponta. Ele já pode ser usado no Kimi.com, no Kimi Work, no Kimi Code ou pela API kimi-k3.

O lançamento importa porque o K3 entrou na disputa por custo-benefício entre modelos de ponta sem fingir que vence em tudo. A própria Kimi reconhece que, no resultado geral, o modelo ainda fica atrás do Claude Fable 5 e do GPT-5.6 Sol. Essa franqueza torna a vantagem mais específica bem mais crível: o K3 entrega capacidade robusta para tarefas longas por um preço de API significativamente menor.
Kimi K3 em análise: o veredito em uma tabela
O Kimi K3 justifica um teste controlado em produção, não uma migração do modelo padrão. É barato o bastante para ser avaliado em trabalho real e competente o suficiente para vencer em rotas específicas, mas as limitações presentes no lançamento tornam prematura uma troca generalizada.
A regra de decisão é direta: teste o K3 quando o custo limitar uma rota de agente com contexto longo; mantenha Sol ou Fable quando o preço de um erro superar a economia com tokens. Se a exigência for hospedar o modelo por conta própria, aguarde os pesos e a licença de fato.
O que é o Kimi K3, afinal?
O Kimi K3 é um modelo mixture-of-experts em escala de infraestrutura, e não um enorme modelo denso que ativa todos os 2.8 trilhões de parâmetros a cada token. Em uma arquitetura mixture-of-experts, cada token é encaminhado por um pequeno conjunto de sub-redes especializadas. O K3 usa Stable LatentMoE para ativar 16 de 896 especialistas; é assim que um modelo desse porte consegue fornecer respostas por um preço de API inferior ao dos líderes fechados de ponta.
O guia rápido oficial confirma as especificações centrais:
- 2.8 trilhões de parâmetros no total.
- 1,048,576 tokens de contexto, com preço fixo por token, sem uma faixa separada para contexto longo.
- Compreensão visual nativa, com entrada de texto e imagem e saída em texto.
- Kimi Delta Attention, um projeto híbrido de atenção criado para transportar informações de forma eficiente ao longo de sequências extensas.
- Attention Residuals, método que recupera representações úteis entre as diferentes profundidades do modelo, em vez de acumular todas as camadas de maneira uniforme.
- Cache de contexto automático, sem exigir ID de cache, configuração de tempo de vida ou parâmetro adicional na requisição.
A Kimi atribui a essas mudanças de arquitetura e treinamento uma melhoria aproximada de 2.5x na eficiência de escala em relação ao K2. Isso deve ser tratado como uma afirmação do fornecedor sobre a arquitetura, não como um benchmark de aplicação. A consequência prática para quem compra é mais fácil de confirmar: o K3 oferece um espaço de trabalho de um milhão de tokens e cobra um décimo do preço da entrada sem cache quando há acerto no prefixo armazenado.
O K3 já está disponível em quatro formatos. O Kimi.com é a interface de chat. O Kimi Work, na versão 3.1.0 ou posterior, leva o modelo ao Windows e aos Macs com Apple silicon. No Kimi Code, ele é selecionado pelo terminal com /model. Para desenvolvedores, o modelo kimi-k3 fica disponível pela API da Kimi.
A API inclui chamadas de ferramentas, JSON Mode, saída estruturada, restrições de escolha de ferramentas e carregamento dinâmico de ferramentas. A entrada visual tem uma limitação incômoda: URLs públicas de imagens não são aceitas, portanto os aplicativos precisam enviar os dados em base64 ou usar uma referência de arquivo da Kimi.
Os benchmarks mostram competitividade de ponta, não liderança absoluta
Medições independentes colocam o Kimi K3 perto do topo, mas também expõem o custo escondido por uma tabela de preços baixa: o modelo é lento e prolixo. A Artificial Analysis dá 57 pontos ao K3, o que o coloca em #4 entre 189 modelos. A medição registra 62.0 tokens de saída por segundo, posição #91 de 189, além de 130M tokens de saída no Intelligence Index, diante de uma média de 63M.
Essa tendência a respostas longas importa porque a saída é a parte mais cara da conta do K3. A Artificial Analysis informa ter gastado $2,709.75 para avaliar o modelo. Um modelo pode custar pouco por token e, ainda assim, sair caro por resultado aceito se produzir aproximadamente o dobro do volume de saída do conjunto usado na comparação.
A tabela de benchmarks da própria Kimi revela um quadro de capacidades mais equilibrado:
São resultados expressivos, mas não formam uma comparação direta e uniforme. A Kimi executou o K3 com raciocínio máximo, temperatura 1.0 e top-p 1.0. O sistema de avaliação varia entre Kimi Code, Claude Code e Codex conforme a linha. Alguns resultados do Fable 5 podem incluir fallback para o Opus 4.8. A tabela sustenta a conclusão de que o K3 compete na fronteira; não permite chamá-lo de vencedor universal.
As evidências independentes e as do fornecedor apontam para a mesma conclusão útil. O K3 tem capacidade para disputar uma rota de produção. Ainda não demonstrou o bastante para substituir todas elas.
- O K3 custa $3 por milhão de tokens de entrada e $15 por milhão de tokens de saída sem cache, bem menos que Sol e Fable 5.
- Com acerto de cache, a entrada cai para $0.30 por milhão de tokens graças ao armazenamento automático do prefixo.
- O contexto de 1,048,576 tokens não está sujeito a uma faixa de preço separada para contexto longo.
- Visão nativa, saída estruturada, chamadas de ferramentas e carregamento dinâmico cobrem os recursos essenciais para agentes.
- A medição independente coloca o K3 em #4 entre 189 modelos em um índice amplo de inteligência.
- Os pesos completos, a licença final e o relatório técnico ainda não são públicos.
- Apenas o esforço máximo de raciocínio está disponível, sem uma configuração mais barata ou rápida para direcionar tarefas simples.
- A Kimi alerta que omitir o histórico de raciocínio ou trocar de modelo no meio da sessão pode desestabilizar a qualidade.
- A ferramenta de busca na web da Kimi está sendo atualizada e não é recomendada no curto prazo.
- A medição independente considera o K3 mais lento e muito mais prolixo que a média da comparação.
O preço da API é o verdadeiro motivo para testar o Kimi K3
O primeiro argumento do Kimi K3 para entrar em produção é o custo, sobretudo quando uma sessão de programação reutiliza um prefixo estável do repositório. A tabela oficial de preços cobra $0.30 por milhão de tokens de entrada com acerto de cache, $3 por milhão sem acerto e $15 por milhão de tokens de saída.
Para um milhão de tokens de entrada sem cache e um milhão de tokens de saída, a comparação direta fica assim:
- Kimi K3: $18
- GPT-5.6 Sol: $35
- Claude Fable 5: $60
Nessa carga de trabalho deliberadamente simples, o K3 custa 48.6% menos que o Sol e 70% menos que o Fable.
Um exemplo melhor para agentes de programação é um mês com 10M tokens de entrada e 1M de saída, no qual 9M tokens de entrada são estáveis o suficiente para aproveitar o cache. A Kimi afirma que sua API oficial supera uma taxa de acerto de cache de 90% em trabalhos de programação, embora a organização do repositório e a estabilidade do prefixo determinem se a aplicação conseguirá repetir esse resultado.
- K3: 9 x $0.30 de entrada em cache + 1 x $3 de entrada sem cache + 1 x $15 de saída = $20.70.
- Sol: 9 x $0.50 de entrada em cache + 1 x $5 de entrada sem cache + 1 x $30 de saída = $39.50.
- Fable: 9 x $1 de entrada em cache + 1 x $10 de entrada sem cache + 1 x $50 de saída = $69.00.
Sem nenhum acerto de cache, a mesma carga custa $45 no K3, $80 no Sol e $150 no Fable. O cache não cria a vantagem de preço do K3, mas ajuda a preservá-la ao longo de sessões extensas.

A armadilha é otimizar o preço do token em vez do custo por resultado aceito. A Artificial Analysis observou o K3 gerar 130M tokens de saída, contra uma média de 63M no conjunto comparado. Se a rota exigir mais revisão, gerações mais longas ou correções repetidas, a tarifa de $15 da saída poderá consumir parte da economia anunciada.
A assinatura para consumidores é uma modalidade de compra separada da API. A tabela oficial de assinaturas inclui o plano gratuito Adagio, com 6 créditos de Agent e uma tarefa simultânea de Agent, mas sem créditos do Kimi Code. O Moderato começa em $19 por mês, ou $15 mensais na cobrança anual, com 60 créditos de Agent e 1x em créditos do Kimi Code. Os planos mensais superiores são Allegretto por $39, Allegro por $99 e Vivace por $199.
Isso torna o plano gratuito adequado para conhecer a interface e o estilo de resposta do K3. Ele não substitui uma avaliação de API para uma carga de produção, pois os créditos da assinatura e a cobrança de tokens da API usam métricas diferentes.
As barreiras para produção importam mais que a demonstração
O risco do Kimi K3 em produção não está na inteligência bruta. Ele surge da interação entre o estado da sessão, o esforço fixo de raciocínio, as permissões de ferramentas e uma experiência de produto ainda imatura.
Preserve todo o histórico de raciocínio
O K3 foi treinado para receber o histórico de raciocínio preservado ao longo da sessão. A Kimi alerta que a qualidade pode se tornar bastante instável se o runtime de um agente descartar esse histórico ou trocar para o K3 em uma sessão iniciada com outro modelo. Não se trata apenas de um detalhe no formato do prompt: um teste com roteamento de modelos pode fazer o K3 parecer pior do que realmente é se a mudança ocorrer no meio da conversa.
Comece a avaliação do K3 em uma sessão nova e mantenha intacto todo o histórico do assistente. Não faça a comparação trocando apenas o ID do modelo no meio de uma trajetória iniciada com Sol ou Fable.
Esforço máximo é a única opção
O K3 sempre raciocina, e reasoning_effort atualmente aceita apenas max. Controles menores e maiores estão planejados, mas ainda não estão disponíveis. Isso elimina um recurso importante para produção: trabalhos simples não podem passar pelo mesmo endpoint com uma configuração de esforço mais barata e rápida.
Para um fundador com recursos tentando corrigir uma migração difícil, o esforço máximo obrigatório pode ser aceitável. Para o CTO de uma empresa de médio porte que distribui milhares de classificações comuns, é desperdício. Mantenha um modelo mais barato ao lado do K3, em vez de fazê-lo atender a todas as requisições.
Limite as ações com mais rigor que os prompts
Segundo a Kimi, o K3 pode tomar decisões inesperadas diante de instruções ambíguas porque foi treinado para avançar em trabalhos de longa duração. A solução prática não é escrever um prompt de personalidade maior. É definir uma política explícita de ações: ferramentas permitidas, confirmação antes de gravações externas, limites de gastos, caminhos de arquivos restritos e possibilidade de reversão.
Um agente que escreve um bom patch, mas também altera uma configuração não relacionada, não é autônomo de maneira útil. Trate o comportamento proativo como uma capacidade que exige um raio de impacto menor.
Ainda não desenvolva em torno da busca na web
A documentação da API da Kimi informa que a busca na web está sendo atualizada e não é recomendada no curto prazo. Para agentes de pesquisa, isso significa adotar uma camada separada de busca ou recuperação, em vez de presumir que a ferramenta oficial do K3 já está pronta.
A Kimi também admite uma diferença perceptível na experiência de uso em relação ao Fable 5 e ao Sol. A expressão é ampla, mas as limitações próximas a tornam concreta: a compatibilidade entre sessões é frágil, o roteamento por nível de esforço está incompleto e uma ferramenta oficial passa por transição. Nenhum desses problemas invalida o modelo. Todos ajudam a delimitar um teste sensato.
Os pesos abertos são uma promessa até 27 de julho
Em 17 de julho de 2026, o Kimi K3 ainda não é uma opção disponível para hospedagem própria. A Kimi promete os pesos completos até 27 de julho, e o relatório técnico deve acompanhá-los. Até que esses artefatos e a licença final se tornem públicos, “aberto” descreve o destino anunciado, não um recurso de produção pronto para baixar.
A escala também muda o significado de pesos abertos. Com 2.8 trilhões de parâmetros, os pesos brutos ocupam aproximadamente 1.4 TB a 4 bits por parâmetro ou 5.6 TB a 16 bits por parâmetro, antes da sobrecarga do runtime, do cache, das ativações e da redundância. A Kimi recomenda implantações em supernodes com 64 ou mais aceleradores.
Isso é infraestrutura de data center, não um modelo para workstation. Um desenvolvedor técnico independente deve alugar a API. Uma empresa de médio porte que cogite inferência privada precisa calcular o custo do cluster, da rede, da equipe de operação e da capacidade excedente antes de tratar a hospedagem própria como plano de economia.
A distinção é importante:
- Pesos abertos significam que os parâmetros treinados podem ser baixados.
- Código aberto também exige código e termos de licença que permitam o uso pretendido.
- Hospedagem própria viável significa que o modelo cabe em uma infraestrutura e em um orçamento operacional sustentáveis.
O cenário atual de modelos de pesos abertos já oferece opções menores e mais fáceis de implantar. O K3 pode se juntar a elas na fronteira de capacidade, mas os arquivos da versão e a licença precisam chegar primeiro.
Quem deve escolher Kimi K3, GPT-5.6 Sol ou Claude Fable 5?
Escolha de acordo com o custo da falha, não pela melhor linha de benchmark do modelo.
Kimi K3 é o teste de custo-benefício
O Kimi K3 é o experimento certo quando contexto longo, trabalho em repositório com cache ou visão nativa trazem uma vantagem real para a carga. A $3 pela entrada, $0.30 pela entrada em cache e $15 pela saída por milhão de tokens, existe margem para perder alguma eficiência e ainda superar os líderes de ponta em custo. Evite-o quando a camada de sessão não puder preservar o histórico, quando a busca oficial na web for essencial ou quando uma ação prematura puder sair cara.
GPT-5.6 Sol é o padrão de produção a ser superado
O GPT-5.6 Sol é a escolha padrão mais forte quando a rota depende de um ecossistema maduro de ferramentas e de comportamento comprovado em tarefas variadas. Ele oferece chamadas de função, saída estruturada, busca na web e em arquivos, execução de código, shell hospedado, uso de computador, MCP e busca de ferramentas. Seus preços de $5 para entrada, $0.50 para entrada em cache e $30 para saída são maiores que os do K3, mas uma carga menor de revisão pode justificar o adicional. O guia atual de roteamento do GPT-5.6 explica quando Sol, Terra e Luna devem dividir o trabalho.

Não escolha Sol quando uma rota estável e repetível entregar no K3 o mesmo resultado aceito. Continuar pagando o preço premium depois que o modelo mais barato passa na avaliação é hábito, não gestão de risco.
Claude Fable 5 é o adicional por discernimento
O Claude Fable 5 é o modelo de disponibilidade geral mais capaz da Anthropic para programação ambiciosa e trabalho de conhecimento. Custa $10 pela entrada e $50 pela saída por milhão de tokens, com desconto de 90% no cache de prompts da entrada. A Anthropic o posiciona para projetos longos que planejam, delegam, testam e verificam o próprio trabalho.

A barreira está no preço e na previsibilidade do roteamento. Solicitações sensíveis de cibersegurança e biologia podem recorrer ao Opus 4.8. O Fable só justifica o adicional quando menos correções, melhores decisões ou autonomia confiável por mais tempo produzem mais trabalho aceito que K3 ou Sol.
Um plano reversível para avaliar o Kimi K3
O caminho mais seguro para adotar o K3 é mudar uma rota por vez e manter o modelo anterior disponível. O lançamento de um modelo deve ser tratado como a atualização de uma dependência: observável, reversível e restrito o suficiente para permitir o diagnóstico.

Escolha uma única rota cara
Comece por um trabalho em que o custo do Sol ou Fable seja relevante e o K3 tenha uma vantagem plausível, como depuração na escala de um repositório, análise de documentos longos ou correção de frontend orientada por visão. Não comece por todas as chamadas de IA do produto.
Fixe as condições da comparação
Use os mesmos prompts, arquivos, ferramentas, limites de permissão e critérios de aceitação. Mantenha o runtime do agente constante sempre que possível, para não confundir uma diferença entre modelos com uma diferença nas ferramentas.
Comece do zero e preserve o histórico
Crie sessões novas no K3, retenha todo o histórico de raciocínio do assistente exigido pela API e mantenha os prefixos estáveis consistentes byte a byte o suficiente para obter acertos de cache. Nunca transfira para o K3 uma sessão em andamento iniciada com outro modelo.
Restrinja as ações fora do modelo
Permita apenas ferramentas aprovadas, exija autorização para gravações externas e alterações destrutivas, limite os gastos e preserve a possibilidade de reversão. Implemente os limites em código e nas permissões, não apenas no prompt do sistema.
Meça os resultados aceitos
Registre entrada, entrada em cache, saída, tempo decorrido, novas tentativas, trabalho rejeitado e esforço de revisão. Divida o gasto total pelos resultados aceitos. Esse número reúne em uma só métrica a tarifa baixa do K3 e sua tendência a respostas mais longas.
Promova apenas as rotas que o K3 vencer
Migre uma rota quando o K3 alcançar o padrão de qualidade por um custo total menor. Mantenha Sol ou Fable como caminho explícito de escalação para casos difíceis e deixe o trabalho simples de alto volume em um modelo mais barato.
Esse plano não depende da crença de que o K3 é melhor em termos gerais. Ele exige provar que o K3 é melhor para uma tarefa. Esse é o único nível em que uma decisão sobre modelos para produção continua verdadeira por muito tempo.
O que é o Kimi K3?
O Kimi K3 é o principal modelo de 2.8 trilhões de parâmetros da Moonshot AI para programação de longa duração, trabalho de conhecimento e raciocínio. Ele aceita texto e imagens, oferece uma janela de contexto de 1,048,576 tokens e está disponível nos aplicativos, na ferramenta de programação e na API da Kimi.
O Kimi K3 será open source?
A Kimi afirma que os pesos completos do modelo serão lançados até 27 de julho de 2026. Em 17 de julho, os pesos, a licença final e o relatório técnico ainda não são públicos; portanto, os direitos de uso comercial e a viabilidade de uma hospedagem própria reproduzível devem ser avaliados quando esses artefatos chegarem.
Posso rodar o Kimi AI localmente?
O K3 não é um modelo local comum. Seus 2.8 trilhões de parâmetros ocupam aproximadamente 1.4 TB mesmo a 4 bits por parâmetro, antes da sobrecarga do runtime, e a Kimi recomenda supernodes com 64 ou mais aceleradores. Para a maioria das equipes, a melhor forma de avaliar o K3 é pela API.
O Kimi é totalmente gratuito?
Não. A assinatura Adagio é gratuita e inclui 6 créditos de Agent, mas nenhum crédito do Kimi Code. As assinaturas pagas começam com o Moderato por $19 ao mês, enquanto a API da Kimi é cobrada separadamente pelos tokens de entrada e saída.
O Kimi K3 é melhor que GPT-5.6 Sol ou Claude Fable 5?
Não de modo geral. O K3 lidera em algumas linhas divulgadas pelo fornecedor e custa menos, mas a Kimi reconhece que ele ainda fica atrás do Sol e do Fable no resultado geral. A pergunta prática é se o K3 alcança o padrão de aceitação da sua rota por um custo total menor.
Quer saber quais modelos atuais combinam de verdade com cada tipo de trabalho? Receba gratuitamente o mapa de ferramentas de IA para empresários.
Receba o mapa de ferramentas de IA para empresários
Um guia em linguagem clara sobre quais modelos e ferramentas de IA servem para cada trabalho, atualizado à medida que preços e capacidades mudam. Gratuito para assinantes.
3 de set. de 2026







