Xiaomi MiMo: como usar o MiMo-V2.6 na prática
Aprenda a testar o Xiaomi MiMo no Studio, configurar a API do MiMo-V2.6, escolher entre Flash e Pro e levar o fluxo à produção com segurança.

O Xiaomi MiMo-V2.6 transforma um único prompt validado em um fluxo de trabalho empresarial reproduzível por meio da API da Xiaomi. Comece pelo Studio para comprovar que a tarefa funciona, use o Flash na primeira requisição em produção e só troque de modelo quando os dados de qualidade ou latência justificarem o custo extra.
O caminho mais curto é direto: teste uma tarefa sintética no AI Studio, crie o tipo certo de chave, aponte um cliente compatível com a OpenAI para a URL-base da Xiaomi e examine o JSON retornado antes de conectar dados reais de clientes.
Essa ordem faz diferença. Ela separa um problema de prompt de um problema de conta. Se a tarefa não funcionar no Studio, mudar o código em Python não vai resolver. Se funcionar no Studio, mas a API disser que a chave é inválida, a causa mais provável está na modalidade da credencial, não no modelo.
O que é o Xiaomi MiMo-V2.6, na prática
O MiMo-V2.6 é uma família de modelos com dois pontos de partida úteis. O mimo-v2.6-flash é a opção econômica para chamadas frequentes. O mimo-v2.6-pro custa mais e atende trabalhos complexos e de longa duração. Ambos aceitam texto, imagens, vídeo e áudio e devolvem texto. Os dois oferecem janela de contexto de 1 milhão de tokens, saída máxima de 128,000 tokens, chamada de ferramentas, streaming, saída estruturada, busca na web e cache de contexto.
Pense no modelo como o motor e na forma de acesso como o cartão de combustível. O motor pode ser o mesmo, embora cartão, medidor e posto sejam diferentes. Uma chave pré-paga não consome a cota do Token Plan, e uma chave do Token Plan não é autenticada na URL-base do sistema pré-pago.
A Xiaomi disponibiliza Pro e Flash no AI Studio, MiMo Code, MiMo Desktop, na plataforma de API e no OpenRouter. O Studio é o melhor primeiro passo porque permite que a pessoa responsável avalie a tarefa antes que a engenharia transforme o teste em uma solução.

Como colocar o Xiaomi MiMo para executar a primeira tarefa
Comece com uma tarefa inofensiva, mas representativa. Em uma triagem de suporte, não cole o nome, o e-mail, o histórico de pedidos nem os dados de pagamento de um cliente real. Use um chamado fictício com a mesma estrutura do trabalho:
Classifique este chamado fictício como cobrança, acesso, bug ou outro e, em seguida, indique uma próxima ação: meu cartão foi cobrado, mas o saldo do meu workspace não foi atualizado.
1. Valide a tarefa no Studio
Entre com uma conta Xiaomi, abra o AI Studio, selecione MiMo-V2.6-Flash e envie o prompt fictício. Aqui, três pontos precisam ser verificados: se a categoria está correta, se a próxima ação é útil na operação e se a resposta tem consistência suficiente para virar um esquema mais adiante.
Ainda não é hora de buscar elegância. Um primeiro resultado útil poderia responder billing e recomendar a verificação da liquidação do pagamento ou o encaminhamento da divergência de saldo. Se a resposta se dispersar, delimite melhor as categorias e exija apenas uma próxima ação. O Studio é a sala de ensaio, não o sistema de produção.
2. Escolha a modalidade da credencial antes de criar a chave
Para um fluxo empresarial de API de uso geral, o modelo pré-pago é o ponto de partida mais simples. Adicione saldo ao console do MiMo, crie uma chave comum em API Keys, no formato sk-, e use:
- URL-base:
https://api.xiaomimimo.com/v1 - Modelo:
mimo-v2.6-flash
O Token Plan é uma assinatura voltada a cargas de programação com IA. Ele emite uma chave separada, tp- para pessoas ou ttp- para equipes, e usa:
- URL-base:
https://token-plan-cn.xiaomimimo.com/v1 - Modelo:
mimo-v2.6-flashoumimo-v2.6-pro
O formato da API é o mesmo, mas a chave e a URL-base precisam mudar juntas. A Xiaomi afirma expressamente que o saldo pré-pago e a cota do Token Plan não são intercambiáveis. Para conhecer todas as condições de acesso, consulte O MiMo V2.6 é gratuito?.
3. Faça a menor requisição útil em Python
A requisição abaixo segue o exemplo da Xiaomi compatível com a OpenAI, mas retira do código oficial a data de sistema, já desatualizada, de dezembro de 2025. Ela usa uma tarefa neutra, lê a chave a partir do ambiente e imprime a resposta completa para preservar o ID do modelo, o consumo e o conteúdo retornados.
import os
import time
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MIMO_API_KEY"],
base_url="https://api.xiaomimimo.com/v1",
)
started = time.perf_counter()
response = client.chat.completions.create(
model="mimo-v2.6-flash",
messages=[{
"role": "user",
"content": (
"Classify this synthetic support ticket as billing, access, "
"bug, or other, then give one next action: My card was charged "
"but my workspace balance did not update."
),
}],
max_completion_tokens=120,
stream=False,
extra_body={"thinking": {"type": "disabled"}},
)
print(f"latency_seconds={time.perf_counter() - started:.3f}")
print(response.model_dump_json(indent=2))Instale a versão atual do pacote Python da OpenAI, exporte MIMO_API_KEY e execute o arquivo. Se você contratou o Token Plan, troque tanto a chave quanto a base_url. Não altere apenas um dos dois.
O que este teste verificou — e o que ficou de fora
O exemplo não foi executado porque o ambiente de publicação não tinha uma conta MiMo autorizada nem uma chave. Um teste sem credencial conseguiu chegar a https://api.xiaomimimo.com/v1/chat/completions. A resposta foi HTTP 401, com invalid_key e a mensagem Invalid API Key, em 0.067 segundo. É uma falha de configuração que pode ser corrigida: basta fornecer uma chave válida da modalidade correspondente.
A autenticação falhou antes da inferência; por isso, não há como informar com honestidade o ID do modelo, o uso de tokens ou a resposta gerada. Uma execução bem-sucedida deve preservar o JSON completo da resposta, a latência medida pelo cliente e uma cópia da requisição com dados sensíveis removidos. Essas evidências bastam para comparar modelos e investigar a cobrança sem registrar a chave nem dados de clientes.

Flash, Pro ou UltraSpeed: qual escolher para cada tarefa
Comece pelo Flash. Ele tem as mesmas modalidades de entrada, janela de contexto, saída máxima e limites de uso informados para o Pro, mas cobra menos por token. Migre uma tarefa para o Pro depois que um pequeno conjunto de avaliação demonstrar que decisões melhores compensam a diferença.
Segundo a Xiaomi, o UltraSpeed pode gerar a saída até 20 vezes mais rápido que o Pro, com a mesma qualidade. Os preços de entrada sem cache e de saída também são 10 vezes maiores que os do Pro. Essa troca só faz sentido quando o tempo de resposta tem valor mensurável para o negócio.
A conta do modelo pode ser mínima em tarefas curtas de classificação. Considere que um chamado consuma 1,000 tokens de entrada sem cache e 200 tokens de saída. Com as tarifas publicadas, 10,000 chamados custariam cerca de $1.96 no Flash, $6.09 no Pro ou $60.90 no Pro-UltraSpeed. O processamento em lote com o Flash reduziria essa conta estimada do modelo para aproximadamente $0.98.
Esses valores são cenários aritméticos, não resultados de uso. Eles não incluem novas tentativas, busca na web, armazenamento, monitoramento, engenharia nem revisão humana. A Xiaomi cobra separadamente $5 por 1,000 chamadas de busca na web feitas no exterior. O que pesa no orçamento não é o custo da equipe de suporte isoladamente, mas a suposição de que toda classificação inicial exige uma licença em outro aplicativo ou intervenção humana antes do encaminhamento.

Sete fluxos de trabalho empresariais que vale testar
Eles aparecem em ordem de clareza da entrada, valor de uma resposta estruturada e segurança para que a equipe meça o resultado antes de entregar mais controle ao modelo.
1. Triagem de uma fila de suporte de alto volume
A liderança de operações de suporte pode enviar cada novo chamado ao Flash e, quando necessário, incluir uma captura de tela sem dados sensíveis. O modelo classifica o problema, propõe uma próxima ação e produz um texto que o sistema de encaminhamento converte em campos. O ganho está em agilizar a triagem inicial por um custo de modelo que pode permanecer abaixo de um dólar para vários milhares de chamados curtos. Agentes humanos continuam responsáveis por reembolsos, alterações de conta e casos ambíguos.
2. Manutenção de repositório para uma equipe de software
Uma liderança de engenharia pode fornecer a um sistema de programação um relatório de bug, o contexto relevante do repositório, comandos de teste e acesso a ferramentas. O Flash cuida das explorações frequentes; o Pro assume os casos que não atingem um limite de avaliação. O benefício não é a geração genérica de código. É reduzir o número de licenças pagas de assistentes em um fluxo bem delimitado, além de manter um registro de todas as requisições e ações das ferramentas. O ponto de atenção é que o sistema ao redor — sandbox, testes e revisão de código — concentra mais risco do que a chamada ao modelo.
3. Análise de grandes conjuntos de documentos
Uma pessoa de operações pode reunir textos extraídos de contratos, páginas de políticas e imagens de páginas digitalizadas e, então, pedir as exceções em um esquema fixo. A janela de contexto de 1 milhão de tokens permite trabalhar com grandes pacotes de evidências, enquanto a saída estruturada oferece um formato previsível ao software seguinte. O ganho é uma primeira revisão mais curta. Isso não equivale a uma decisão jurídica, e cada exceção citada ainda precisa apontar para a página de origem.
4. Controle visual de qualidade no comércio eletrônico
Uma equipe de e-commerce pode enviar a imagem de um produto junto com o texto do anúncio e perguntar se cor, quantidade na embalagem e alegações visíveis estão de acordo. O Flash devolve texto para que um mecanismo de regras aprove ou encaminhe o item a uma fila. O benefício é detectar divergências evidentes antes da publicação. O modelo não devolve uma imagem editada, portanto ainda será necessário um pipeline de imagem separado.
5. Revisão de chamadas gravadas e evidências em tela
Uma equipe de sucesso do cliente pode fornecer áudio, gravação de tela e critérios de avaliação e solicitar um resumo em texto de compromissos, impedimentos ainda não resolvidos e acompanhamentos. A entrada nativa de áudio e vídeo reduz a quantidade de modelos distintos no primeiro protótipo. O ganho é ter uma única fila de revisão, em vez de filas separadas para transcrição e inspeção visual. Antes disso, porém, é preciso definir regras de consentimento, retenção e dados sensíveis.
6. Piloto de pesquisa e trabalho de escritório no desktop
Quem ainda não está pronto para desenvolver pode começar pelo MiMo Desktop, que agora inclui Pro, Flash e UltraSpeed. Assim, dá para testar se o modelo lida com uma tarefa real de pesquisa ou documentação antes de pedir uma integração à engenharia. O benefício é uma etapa de descoberta mais barata. O sucesso no Desktop não comprova que um fluxo automatizado via API será confiável em escala.
7. Processamento noturno de tarefas acumuladas
Uma equipe de marketplace ou compliance pode enviar classificações não urgentes pela API de lote. A Xiaomi cobra metade das tarifas em tempo real para entrada e saída em lote no Flash e no Pro; o UltraSpeed não está disponível nessa modalidade. O benefício é direto e mensurável quando o prazo de conclusão é flexível. Tudo que afeta um cliente enquanto ele espera deve seguir pela rota em tempo real.
Três produtos que você pode criar
Melhor oportunidade: um assistente vertical de programação agêntica
Crie um agente de programação para uma stack cara e negligenciada, como verificações internas de migração em Java ou correção de testes em um repositório regulado. Os compradores são equipes de engenharia que consideram assistentes generalistas abrangentes, mas difíceis de governar.
A demanda é visível: agentic ai coding assistant recebe cerca de 2,900 buscas mensais nos EUA, tem intenção transacional e CPC de $19.04 e cresceu 200% em um ano no conjunto de dados de palavras-chave. Hoje, o GitHub lista o Copilot Business por $19 por licença ao mês e o Enterprise por $39. Isso oferece uma referência clara de preço para o comprador.
A menor versão comercializável conecta um repositório, uma fila de tarefas, um sandbox e um executor de testes. Use o Flash para exploração, envie ao Pro os casos reprovados ou de alto risco e mostre ao cliente custo, latência, patches e evidências dos testes por tarefa. A barreira competitiva está no conjunto de avaliações e nos controles específicos da stack, não em uma caixa de chat.
O problema é enfrentar um mercado concorrido e um trabalho sério de segurança. Um wrapper sem testes próprios, conhecimento do fluxo ou limites de aprovação será copiado rapidamente. Ainda assim, esta é a oportunidade mais forte, pois a busca reúne a maior demanda qualificada, intenção transacional e uma referência de preço que os compradores já conhecem.
Um gateway para programação com modelos abertos
Crie uma camada de roteamento para equipes que desejam usar um modelo open source sem obrigar cada pessoa desenvolvedora a dominar IDs de modelos, tipos de chave, limites de contexto e fallbacks. O cliente recebe um único endpoint interno, controles de política e comparações por tarefa entre Flash e Pro.
open source ai coding assistant recebe cerca de 1,600 buscas mensais nos EUA, com intenção comercial, CPC de $2.94 e crescimento anual de 1,977% nos dados de sugestões. O MVP precisa de autenticação, um adaptador de provedor, registros de custo e latência, uma pequena avaliação de programação e uma visão administrativa básica.
O ponto de atenção é que um modelo open source e uma API hospedada representam decisões de compra diferentes. O gateway precisa apresentar condições claras para o tratamento de dados e oferecer uma opção auto-hospedada ou outro recurso de governança que seja difícil de replicar. Caso contrário, os clientes podem chamar a Xiaomi diretamente.
Uma central multimodal de triagem de documentos e anexos
Crie um produto de entrada para equipes de suporte, sinistros ou operações que recebem textos longos, capturas de tela, mensagens de áudio e vídeos curtos. O sistema converte os arquivos em entradas compatíveis, solicita ao Flash uma decisão estruturada em texto e encaminha casos de baixa confiança para pessoas.
ai document analysis recebe cerca de 1,000 buscas mensais nos EUA. A busca tem CPC de $10.44 e faixa de lance no topo da página entre $3.23 e $19.87, um sinal de que os fornecedores valorizam esse lead, embora a tendência atual do termo esteja em queda. O MVP é composto por um único canal de upload, um esquema, uma fila de revisão e evidências vinculadas às fontes.
O desafio é a confiança. A saída do MiMo é texto, não uma decisão verificada, e uma janela de 1 milhão de tokens não garante atenção uniforme a todos os detalhes. Uma classe documental bem delimitada e revisão humana obrigatória funcionam melhor que um analisador universal.
O que o MiMo-V2.6 não resolve
A API entrega um motor capaz, não um sistema operacional para a empresa. Ela não define sua taxonomia, remove dados sensíveis, cria regras de aprovação, executa avaliações nem decide o que fazer quando a resposta é incerta. Essas são atribuições de produto e operações.
Não comece pelo UltraSpeed só porque ele parece melhor. Comece pelo Flash e registre as evidências. Não envie todos os arquivos apenas porque a janela de contexto é grande. Use somente o contexto relevante e preserve as referências às fontes. Também não confunda saída estruturada com verdade: um objeto JSON válido ainda pode trazer uma decisão ruim.
Ao usar o modo de raciocínio em várias chamadas de ferramenta, a Xiaomi recomenda levar o reasoning_content anterior adiante no histórico de mensagens. Se ele for descartado, o contexto visto pelo modelo muda. Caso use o recurso de busca na web, inclua esse custo no orçamento separadamente dos tokens.
Para comparar os modelos diretamente, consulte MiMo V2.6 Pro vs Flash. A regra prática continua sendo começar pelo Flash, migrar para o Pro depois da avaliação e adotar o UltraSpeed somente quando a latência tiver um preço.
Como diagnosticar problemas do Xiaomi MiMo na ordem certa
- Chave inválida: confirme se ela começa com
sk-,tp-outtp-. Combine-a com a URL-base correta. Nunca imprima a chave nos logs. - Resposta pouco útil no Studio: revise a tarefa, as categorias e o formato de saída antes de mexer na integração.
- Modelo selecionado incorretamente: use exatamente o ID em minúsculas
mimo-v2.6-flashoumimo-v2.6-pro. - Tráfego trava em escala: compare a carga observada com os limites informados de 100 requisições por minuto e 10 milhões de tokens por minuto para Pro e Flash.
- Comportamento inesperado de data: remova do exemplo atual da Xiaomi a data de sistema, já desatualizada, de dezembro de 2025. Informe uma data atual apenas se a tarefa precisar dela.
- Continuidade interrompida nas chamadas de ferramenta: mantenha
reasoning_contententre os turnos quando o modo de raciocínio estiver ativo, conforme a recomendação da Xiaomi. - Custos não batem: separe o saldo pré-pago, os créditos do Token Plan, as cobranças por token e o serviço de busca na web faturado à parte.
O que fazer na segunda-feira
Na segunda-feira, a liderança de operações de suporte deve separar 20 chamados fictícios, definir quatro categorias e uma próxima ação segura para cada um e testá-los no Studio com o Flash. Na terça-feira, uma pessoa da engenharia pode rodar o mesmo conjunto na API paga, salvar requisições sem dados sensíveis e respostas completas e comparar concordância, latência e uso de tokens. Somente depois disso a equipe deve conectar uma fila real, mantendo um desvio para revisão humana.
Como usar o Xiaomi MiMo?
Comece no AI Studio com uma versão sintética da tarefa. Para um fluxo via API, crie uma conta Xiaomi, escolha entre a modalidade pré-paga e o Token Plan, gere a chave correspondente, use a URL-base associada e chame mimo-v2.6-flash pela API compatível com a OpenAI ou com a Anthropic.
O Xiaomi MiMo é gratuito?
Alguns ambientes da Xiaomi podem oferecer testes ou acesso gratuito, mas a API de produção tem preços pré-pagos publicados e Token Plans pagos. Consulte O MiMo V2.6 é gratuito? para entender as formas de acesso.
Quanto custa o MiMo por mês?
Os Token Plans individuais têm faixas mensais de $6, $16, $50 e $100. Os planos para equipes custam $16, $50 ou $100 por licença ao mês. Na tabela de preços publicada, a modalidade pré-paga não tem mensalidade fixa; o valor é descontado de um saldo pré-pago conforme o uso de tokens.
O Xiaomi MiMo é bom para programação?
O modelo foi criado para programação e fluxos com agentes, e a Xiaomi publica benchmarks e exemplos de produto expressivos. A resposta para o negócio depende do seu repositório. Rode um conjunto fixo de tarefas e testes no Flash e no Pro e, depois, compare patches aceitos, latência e custo.
Vale a pena usar o Xiaomi MiMo?
Sim, vale fazer uma avaliação controlada quando preços baixos por token, entrada multimodal, contexto longo ou a opção de um modelo open source forem importantes. O que não vale é uma implantação apressada, sem testes específicos da tarefa, regras de dados e uma alternativa humana.
Se quiser implementar um desses fluxos de API com avaliação, monitoramento e uma transferência segura para pessoas, conheça os sistemas de produção com IA.
- Última atualização
- 22 de set. de 2026
- Categoria
- AI







