MiMo AI : comment utiliser Xiaomi MiMo V2.6 et son API
Testez MiMo AI dans Studio, choisissez la bonne clé et le bon modèle, puis lancez un premier workflow métier fiable avec l’API Xiaomi MiMo V2.6.

MiMo AI, avec MiMo-V2.6, permet de transformer un prompt validé en workflow métier reproductible via l’API de Xiaomi. Commencez dans Studio pour valider la tâche, utilisez Flash pour la première requête en production, puis ne changez de modèle que si les données de qualité ou de latence justifient le surcoût.
Le chemin le plus court est simple : testez une tâche fictive dans AI Studio, créez le bon type de clé, configurez un client compatible avec OpenAI sur l’URL de base de Xiaomi, puis examinez le JSON renvoyé avant de connecter de vraies données clients.
Cet ordre compte. Il permet de distinguer un problème de prompt d’un problème de compte. Si la tâche échoue dans Studio, modifier le code Python n’y changera rien. Si elle fonctionne dans Studio mais que l’API rejette la clé, l’origine probable se trouve dans le type d’identifiant utilisé, pas dans le modèle.
MiMo-V2.6, concrètement
MiMo-V2.6 est une famille de modèles avec deux points d’entrée pratiques. mimo-v2.6-flash est le choix économique par défaut pour les appels fréquents. mimo-v2.6-pro, plus cher, vise les tâches complexes qui s’étendent dans la durée. Les deux acceptent du texte, des images, de la vidéo et de l’audio, puis produisent du texte. Ils annoncent tous deux une fenêtre de contexte de 1 million de tokens, une sortie maximale de 128,000 tokens, l’appel d’outils, le streaming, les sorties structurées, la recherche web et la mise en cache du contexte.
Voyez le modèle comme un moteur et le mode d’accès comme une carte de carburant. Le moteur peut rester identique alors que la carte, le compteur et la station changent. Une clé en paiement à l’usage ne consomme pas le quota d’un Token Plan, et une clé Token Plan ne s’authentifie pas sur l’URL de base du paiement à l’usage.
Xiaomi propose Pro et Flash dans AI Studio, MiMo Code, MiMo Desktop, sa plateforme API et OpenRouter. Studio constitue le meilleur point de départ : l’équipe opérationnelle peut y juger la tâche avant que l’ingénierie ne l’intègre.

Comment lancer une première tâche avec MiMo AI
Commencez par une tâche inoffensive mais représentative. Pour trier des demandes d’assistance, ne collez pas le vrai nom d’un client, son adresse e-mail, son historique de commandes ni ses données de paiement. Utilisez un ticket fictif qui reproduit la forme du travail réel :
Classe ce ticket d’assistance fictif dans l’une des catégories suivantes : facturation, accès, bug ou autre. Indique ensuite une seule action à entreprendre : ma carte a été débitée, mais le solde de mon espace de travail n’a pas été mis à jour.
1. Valider la tâche dans Studio
Connectez-vous avec un compte Xiaomi, ouvrez AI Studio, sélectionnez MiMo-V2.6-Flash et envoyez le prompt fictif. Trois points sont à contrôler : la catégorie doit être correcte, l’action proposée exploitable et la réponse suffisamment régulière pour être convertie ensuite en schéma.
Ne cherchez pas encore l’élégance. Une première réponse utile peut indiquer billing et recommander de vérifier le règlement du paiement ou de faire remonter l’écart de solde. Si la réponse s’éparpille, resserrez les catégories et imposez une seule action. Studio sert de répétition, pas de système de production.
2. Choisir le mode d’accès avant de créer une clé
Pour un workflow API métier généraliste, le paiement à l’usage est le choix par défaut le plus simple. Créditez la console MiMo, créez une clé standard au format sk- dans API Keys, puis utilisez :
- URL de base :
https://api.xiaomimimo.com/v1 - Modèle :
mimo-v2.6-flash
Le Token Plan est un abonnement destiné aux charges de programmation assistée par IA. Il fournit une clé tp- distincte pour les particuliers ou ttp- pour les équipes, avec :
- URL de base :
https://token-plan-cn.xiaomimimo.com/v1 - Modèle :
mimo-v2.6-flashoumimo-v2.6-pro
La structure de l’API reste la même, mais la clé et l’URL de base vont toujours de pair. Xiaomi précise que le solde du paiement à l’usage et le quota du Token Plan ne sont pas interchangeables. Pour connaître toutes les modalités d’accès, consultez MiMo V2.6 est-il gratuit ?.
3. Envoyer la plus petite requête Python utile
La requête ci-dessous reprend l’exemple compatible OpenAI de Xiaomi, sans la date système obsolète de décembre 2025 présente dans l’exemple officiel. Elle utilise une tâche neutre, lit la clé depuis l’environnement et affiche la réponse complète afin de conserver l’identifiant du modèle, l’usage et le contenu renvoyés.
import os
import time
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MIMO_API_KEY"],
base_url="https://api.xiaomimimo.com/v1",
)
started = time.perf_counter()
response = client.chat.completions.create(
model="mimo-v2.6-flash",
messages=[{
"role": "user",
"content": (
"Classify this synthetic support ticket as billing, access, "
"bug, or other, then give one next action: My card was charged "
"but my workspace balance did not update."
),
}],
max_completion_tokens=120,
stream=False,
extra_body={"thinking": {"type": "disabled"}},
)
print(f"latency_seconds={time.perf_counter() - started:.3f}")
print(response.model_dump_json(indent=2))Installez la version actuelle du package Python OpenAI, exportez MIMO_API_KEY, puis exécutez le fichier. Si vous avez souscrit un Token Plan, modifiez à la fois la clé et base_url. N’en changez jamais un seul des deux.
Ce qui a été vérifié — et ce qui ne l’a pas été
Cet exemple n’a pas été exécuté, car l’environnement de publication ne disposait d’aucun compte MiMo autorisé ni d’aucune clé. Un appel sans identifiants a bien atteint https://api.xiaomimimo.com/v1/chat/completions. Il a renvoyé le statut HTTP 401, le code invalid_key et le message Invalid API Key en 0.067 seconde. Il s’agit d’une erreur de configuration réparable : fournissez une clé valide correspondant au bon mode d’accès.
L’authentification ayant échoué avant l’inférence, aucun identifiant de modèle, usage de tokens ou résultat ne peut être rapporté honnêtement. Lors d’une exécution réussie, conservez le JSON complet de la réponse, la latence mesurée côté client et une copie expurgée de la requête. Vous aurez ainsi assez d’éléments pour comparer les modèles et enquêter sur la facturation sans journaliser la clé ni les données clients.

Choisir Flash, Pro ou UltraSpeed selon la tâche
Commencez avec Flash. Il affiche les mêmes modalités d’entrée, la même fenêtre de contexte, la même sortie maximale et les mêmes limites de débit que Pro, pour des tarifs par token inférieurs. Ne basculez une tâche vers Pro qu’après avoir montré, sur un petit jeu d’évaluation, que de meilleures décisions justifient l’écart de prix.
Selon Xiaomi, UltraSpeed peut produire une réponse jusqu’à 20 fois plus vite que Pro, à qualité égale. Ses tarifs d’entrée hors cache et de sortie sont également 10 fois supérieurs à ceux de Pro. Ce compromis n’est raisonnable que si le temps de réponse possède une valeur métier mesurable.
Pour de courtes tâches de classification, la facture du modèle peut rester minime. Supposons qu’un ticket consomme 1,000 tokens d’entrée hors cache et 200 tokens de sortie. Aux tarifs publiés, 10,000 tickets coûteraient environ $1.96 avec Flash, $6.09 avec Pro ou $60.90 avec Pro-UltraSpeed. Le traitement par lots avec Flash réduirait ce coût théorique à environ $0.98.
Ces montants sont des scénarios arithmétiques, pas des résultats d’utilisation. Ils excluent les nouvelles tentatives, la recherche web, le stockage, la supervision, l’ingénierie et la validation humaine. Xiaomi facture séparément la recherche web hors Chine, à raison de $5 pour 1,000 appels. Le poste budgétaire fragile n’est pas le coût du support à lui seul, mais l’hypothèse selon laquelle chaque classification initiale nécessite une licence dans une autre application ou une intervention humaine avant le routage.

Sept workflows métier à tester
Ce classement tient compte de la clarté des données d’entrée, de la valeur d’une réponse structurée et de la facilité avec laquelle une équipe peut mesurer les résultats en toute sécurité avant de confier davantage de contrôle au modèle.
1. Trier une file d’assistance à fort volume
Un responsable des opérations support peut envoyer à Flash chaque nouveau ticket et, si nécessaire, une capture d’écran nettoyée. Le modèle classe le problème, propose une action et renvoie un texte que le système de routage convertit en champs. Le gain : accélérer le premier tri pour un coût de modèle qui peut rester inférieur à un dollar pour plusieurs milliers de tickets courts. Les agents humains gardent la main sur les remboursements, les modifications de compte et les cas ambigus.
2. Assurer la maintenance d’un dépôt logiciel
Un responsable de l’ingénierie peut fournir à un système de programmation un rapport de bug, le contexte pertinent du dépôt, les commandes de test et l’accès aux outils. Flash prend en charge l’exploration fréquente ; Pro récupère les cas qui n’atteignent pas un seuil d’évaluation. L’intérêt n’est pas de générer du code de manière générique, mais de réduire le nombre de licences d’assistants payants pour un workflow ciblé, tout en conservant un journal de chaque requête et de chaque action d’outil. Le risque tient davantage au système environnant, à la sandbox, aux tests et à la revue de code qu’à l’appel du modèle.
3. Analyser un vaste dossier documentaire
Un analyste des opérations peut réunir le texte extrait de contrats, des pages de règles et des images de pages numérisées, puis demander les exceptions selon un schéma fixe. La fenêtre de contexte de 1 million de tokens permet de traiter de volumineux dossiers de preuves, tandis que la sortie structurée offre un format prévisible aux logiciels en aval. Le bénéfice est une première revue plus rapide. Ce n’est pas un avis juridique : chaque exception citée doit toujours renvoyer vers sa page source.
4. Contrôler visuellement la qualité en e-commerce
Une équipe e-commerce peut envoyer une photo de produit accompagnée du texte de sa fiche et demander si la couleur visible, le nombre d’articles et les promesses concordent. Flash renvoie du texte qu’un moteur de règles accepte ou place en file d’attente. L’intérêt est de repérer les incohérences évidentes avant publication. Le modèle ne renvoie pas d’image retouchée : une chaîne de traitement d’image distincte reste nécessaire.
5. Examiner les appels enregistrés et les preuves à l’écran
Une équipe chargée de la réussite client peut fournir un enregistrement audio, une capture vidéo d’écran et une grille d’évaluation, puis demander une synthèse textuelle des engagements, des blocages non résolus et des actions de suivi. La prise en charge native de l’audio et de la vidéo réduit le nombre de modèles distincts nécessaires au premier prototype. Le gain est de regrouper les contrôles dans une seule file plutôt que de séparer transcription et vérification visuelle. Il faut d’abord fixer les règles de consentement, de conservation et de traitement des données sensibles.
6. Piloter la recherche et la bureautique sur ordinateur
Une personne chargée des opérations qui n’est pas prête à développer peut commencer dans MiMo Desktop, qui inclut désormais Pro, Flash et UltraSpeed. Elle peut vérifier si le modèle traite correctement une vraie tâche de recherche ou de documentation avant de solliciter l’ingénierie pour une intégration. Le bénéfice est une phase d’exploration moins coûteuse. Une réussite dans Desktop ne prouve pas qu’un workflow API automatisé sera fiable à grande échelle.
7. Traiter les dossiers en attente pendant la nuit
Une marketplace ou une équipe de conformité peut envoyer les classifications non urgentes à l’API de traitement par lots. Xiaomi facture les entrées et sorties par lots de Flash et Pro à la moitié de leur tarif en temps réel ; UltraSpeed n’y est pas disponible. Le gain est direct et mesurable lorsque le délai d’exécution reste flexible. Toute tâche qui affecte un client pendant qu’il attend doit emprunter le parcours en temps réel.
Trois produits à construire
Meilleure opportunité : un assistant de programmation agentique vertical
Construisez un agent de programmation dédié à une stack coûteuse et délaissée, par exemple les contrôles de migration Java en interne ou la réparation de tests dans un dépôt réglementé. Les acheteurs sont les équipes d’ingénierie qui jugent les assistants généralistes polyvalents, mais difficiles à gouverner.
La demande est tangible : agentic ai coding assistant génère environ 2,900 recherches mensuelles aux États-Unis, avec une intention transactionnelle et un CPC de $19.04, et a progressé de 200% sur un an dans le jeu de données de mots-clés. GitHub affiche actuellement Copilot Business à $19 par poste et par mois, et Enterprise à $39. Le repère budgétaire est donc clair pour les acheteurs.
La plus petite version commercialisable connecte un dépôt, une file de tickets, une sandbox et un lanceur de tests. Utilisez Flash pour l’exploration, transférez à Pro les cas en échec ou à haut risque, puis présentez au client le coût, la latence, les correctifs et les preuves de test pour chaque tâche. L’avantage défendable réside dans le jeu d’évaluation et les contrôles propres à la stack, pas dans une interface de chat.
Le marché est encombré et les exigences de sécurité bien réelles. Un simple habillage dépourvu de tests propriétaires, de connaissance métier ou de limites d’approbation sera vite copié. Cette piste reste la plus solide, car la requête combine la demande qualifiée la plus forte, une intention transactionnelle et un prix de référence déjà compris des acheteurs.
Une passerelle de programmation pour modèles ouverts
Créez une couche de routage pour les équipes qui veulent pouvoir utiliser un modèle open source sans obliger chaque développeur à maîtriser les identifiants de modèles, les types de clés, les limites de contexte et les mécanismes de repli. L’acheteur obtient un point d’accès interne unique, des règles de contrôle et des comparatifs Flash-Pro par type de tâche.
open source ai coding assistant génère environ 1,600 recherches mensuelles aux États-Unis, avec une intention commerciale, un CPC de $2.94 et une croissance annuelle de 1,977% dans les données de suggestions. Le MVP doit inclure l’authentification, un adaptateur de fournisseur, les journaux de coûts et de latence, une petite évaluation de code et une interface d’administration élémentaire.
Attention : un modèle open source et une API hébergée correspondent à deux décisions d’achat différentes. La passerelle doit proposer des conditions claires sur le traitement des données ainsi qu’une option auto-hébergée, ou une autre fonction de gouvernance défendable. Sinon, les clients peuvent appeler Xiaomi directement.
Un guichet de tri multimodal pour documents et pièces jointes
Créez un produit d’admission pour les équipes de support, de sinistres ou d’opérations qui reçoivent de longs textes, des captures d’écran, des notes audio et de courtes vidéos. Il transforme les fichiers en entrées compatibles, demande à Flash une décision textuelle structurée et transmet les cas peu fiables à des personnes.
ai document analysis génère environ 1,000 recherches mensuelles aux États-Unis. La requête affiche un CPC de $10.44 et une fourchette d’enchères en haut de page comprise entre $3.23 et $19.87 : malgré une tendance actuellement baissière, les fournisseurs accordent donc de la valeur à ce prospect. Le MVP se limite à un canal d’import, un schéma, une file de revue et des preuves reliées à leur source.
Le frein est la confiance. La sortie de MiMo est un texte, pas une décision vérifiée, et une fenêtre de 1 million de tokens ne garantit pas que chaque détail reçoive la même attention. Mieux vaut viser une catégorie étroite de documents et imposer une validation humaine que prétendre tout analyser.
Ce que MiMo-V2.6 ne résout pas
L’API fournit un moteur performant, pas le système d’exploitation de votre entreprise. Elle ne définit pas votre taxonomie, ne nettoie pas les données sensibles, ne crée pas les règles d’approbation, n’exécute pas les évaluations et ne décide pas de la marche à suivre lorsque la réponse est incertaine. Ces responsabilités relèvent du produit et des opérations.
Ne commencez pas par UltraSpeed sous prétexte que son nom paraît meilleur. Démarrez avec Flash et consignez les preuves. N’envoyez pas tous les fichiers simplement parce que la fenêtre de contexte est vaste. Conservez uniquement le contexte pertinent et gardez les références aux sources. Ne confondez pas sortie structurée et vérité : un objet JSON valide peut malgré tout contenir une mauvaise décision.
Si vous utilisez le mode de raisonnement sur plusieurs appels d’outils, Xiaomi recommande de conserver le reasoning_content antérieur dans l’historique des messages. Le supprimer revient à modifier le contexte présenté au modèle. Si vous utilisez la recherche web, budgétez-la séparément des tokens.
Pour comparer directement les modèles, consultez MiMo V2.6 Pro ou Flash. La règle pratique reste la même : Flash d’abord, Pro après évaluation et UltraSpeed uniquement lorsque la latence a un prix.
Dépanner dans le bon ordre
- Clé invalide : vérifiez si elle commence par
sk-,tp-outtp-, puis associez-la à la bonne URL de base. Ne l’affichez jamais dans les journaux. - Aucune réponse utile dans Studio : retravaillez la tâche, les catégories et le format de sortie avant de toucher à l’intégration.
- Mauvais modèle sélectionné : utilisez exactement l’identifiant en minuscules
mimo-v2.6-flashoumimo-v2.6-pro. - Le trafic se bloque à grande échelle : comparez la charge observée aux limites annoncées de 100 requêtes par minute et 10 millions de tokens par minute pour Pro et Flash.
- Comportement inattendu lié à la date : retirez de l’exemple actuel de Xiaomi la date système obsolète de décembre 2025. Ne fournissez la date courante que si la tâche l’exige.
- Rupture de continuité entre les appels d’outils : lorsque le mode de raisonnement est actif, conservez
reasoning_contententre les tours, comme le recommande Xiaomi. - Coûts incohérents : séparez le solde du paiement à l’usage, les crédits du Token Plan, les frais de tokens et le service de recherche web facturé indépendamment.
Le plan d’action pour lundi
Lundi, un responsable des opérations support devrait prendre 20 tickets fictifs, définir quatre catégories et une action sûre pour chacun, puis les tester dans Studio avec Flash. Mardi, un ingénieur peut exécuter le même jeu via l’API payante, enregistrer les requêtes expurgées et les réponses complètes, puis comparer la concordance, la latence et l’usage des tokens. Ce n’est qu’ensuite que l’équipe devrait connecter une vraie file, tout en maintenant une branche de validation humaine.
Comment utiliser Xiaomi MiMo ?
Commencez dans AI Studio avec une version fictive de la tâche. Pour un workflow API, créez un compte Xiaomi, choisissez le paiement à l’usage ou le Token Plan, générez la clé propre à ce mode d’accès, utilisez l’URL de base correspondante, puis appelez mimo-v2.6-flash via l’API compatible OpenAI ou Anthropic.
Xiaomi MiMo est-il gratuit ?
Certaines interfaces Xiaomi peuvent proposer des essais ou un accès gratuit, mais l’API de production affiche des tarifs en paiement à l’usage et des Token Plans payants. Consultez MiMo V2.6 est-il gratuit ? pour le détail des accès.
Combien coûte MiMo par mois ?
Les Token Plans individuels proposent des formules mensuelles à $6, $16, $50 et $100. Les offres pour équipes coûtent $16, $50 ou $100 par poste et par mois. Le paiement à l’usage n’a pas de forfait mensuel fixe dans la tarification publiée : il prélève un solde prépayé en fonction de la consommation de tokens.
Xiaomi MiMo est-il performant pour le code ?
Il est conçu pour le code et les workflows agentiques, et Xiaomi publie des benchmarks et des exemples de produits solides. La réponse métier dépend toutefois de votre dépôt. Exécutez un jeu fixe de tickets et de tests avec Flash et Pro, puis comparez les correctifs acceptés, la latence et le coût.
MiMo vaut-il la peine d’être utilisé ?
Oui, une évaluation contrôlée se justifie si le faible prix des tokens, les entrées multimodales, le contexte long ou la possibilité d’utiliser un modèle open source comptent. En revanche, un déploiement précipité sans tests propres à la tâche, règles de données ni recours humain ne se justifie pas.
Si vous souhaitez faire construire l’un de ces workflows API avec une évaluation, une supervision et un passage sécurisé vers des humains, découvrez les systèmes d’IA en production.
- Dernière mise à jour
- 22 sept. 2026
- Catégorie
- AI







