Tarifs Xiaomi MiMo V2.6 : tous les plans, modèles et coûts d'API en 2026

Kurnia Kharisma Agung Samiadjie
Écrit par

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Relu par

Katelin Teen

Dernière modification September 23, 2026

Vérifié par un expert
Illustration des tarifs et coûts d'API de Xiaomi MiMo V2.6

La réponse courte : ce que coûte vraiment Xiaomi MiMo V2.6

Cela fait deux ans que j'observe les pages de tarifs de l'IA, et la plupart des lancements de modèles enterrent le chiffre qu'on est venu chercher. Xiaomi a fait l'inverse : le 22 septembre 2026, toute la famille MiMo V2.6 a été mise en open source sous licence MIT, et les tarifs de l'API sont restés stables par rapport à la génération précédente.

Il y a donc en réalité deux prix à considérer. Il y a zéro, si vous téléchargez les poids et les exécutez sur votre propre matériel. Et il y a un prix par token via l'API, si vous préférez que quelqu'un d'autre héberge les GPU. Voici la liste complète des tarifs hébergés, d'après OpenRouter, vérifiée le jour du lancement :

Échelle des tarifs de l'API MiMo V2.6 montrant le coût par million de tokens pour Flash, Pro et Pro UltraSpeed
Échelle des tarifs de l'API MiMo V2.6 montrant le coût par million de tokens pour Flash, Pro et Pro UltraSpeed

Chaque variante dispose de la même fenêtre de contexte de 1M de tokens et est nativement omnimodale (texte, image, vidéo, audio), donc vous ne payez pas de supplément pour le contexte long ou les modalités supplémentaires. C'est inhabituel, et cela explique en grande partie pourquoi ces tarifs paraissent aussi agressifs.

Les quatre variantes et à quoi chacune sert

MiMo V2.6 n'est pas un modèle unique à un seul prix. C'est une famille de quatre checkpoints, et choisir le mauvais est le moyen le plus rapide de payer trop cher. Voici comment ils se positionnent.

MiMo V2.6 Pro (0,435 $ en entrée / 0,87 $ en sortie)

Pro est le fleuron : un modèle à mélange d'experts épars avec 1,02 billion de paramètres au total et 42 milliards actifs. C'est celui qui domine les benchmarks à poids ouverts, et celui à choisir pour un vrai travail agentique, de la programmation sur le long terme, un usage d'outils en plusieurs étapes. À 0,435 $ en entrée / 0,87 $ en sortie, il est moins cher que la plupart des modèles fermés de pointe auxquels il se mesure, ce qui résume toute l'histoire de cette sortie.

MiMo V2.6 Flash (0,14 $ en entrée / 0,28 $ en sortie)

Flash est le checkpoint d'efficacité : 309 milliards au total, 15 milliards actifs, décrit par Xiaomi comme le meilleur équilibre entre intelligence, efficacité et coût. À 0,14 $ en entrée / 0,28 $ en sortie, il coûte un tiers du prix de Pro et, selon les propres chiffres de Xiaomi, ne perd étonnamment que peu en performance. Sur AutomationBench, il obtient 52,3 contre 53,1 pour Pro. Pour la plupart des tâches à gros volume et bien délimitées, Flash est le choix le plus rentable.

MiMo V2.6 Pro UltraSpeed (4,35 $ en entrée / 8,70 $ en sortie)

UltraSpeed prête à confusion jusqu'à ce qu'on réalise qu'on n'achète pas plus d'intelligence. C'est exactement le même checkpoint Pro, servi à environ 10 fois la vitesse de sortie (environ 116 tokens par seconde). Xiaomi facture 10 fois le tarif Pro pour cela. C'est donc une taxe pure sur la latence : à payer uniquement quand la vitesse est réellement le goulot d'étranglement, comme un agent de chat en direct qu'un client regarde taper. Pour un traitement par lots exécuté de nuit, c'est 10 fois de l'argent gaspillé.

MiMo V2.6 Distill-Qwen-9B (poids gratuits uniquement)

Le distill 9B est un ajustement fin supervisé dense de Qwen3.5-9B sur des données générées par MiMo. Il n'est pas disponible sur l'API payante ; il existe comme point de départ compact, mono-GPU, pour l'inférence locale et la recherche ouverte. Des quantifications GGUF communautaires existent déjà pour llama.cpp, LM Studio et Ollama, c'est donc celui qu'on peut exécuter sur une station de travail.

La réduction sur le cache que presque tout le monde manque

Les tarifs affichés ci-dessus ne sont pas ce que paient réellement les gros utilisateurs. MiMo V2.6 Pro affiche les tokens de lecture en cache à environ 0,0036 $ par million, soit une réduction de 99 % sur le tarif d'entrée de 0,435 $. Le partenaire de benchmark de Xiaomi l'a résumé ainsi :

"Despite the improvement, it retains the same attractive pricing at $0.435 per 1M input tokens (with a 99% cache-hit discount) and $0.87 per 1M output tokens."

Pourquoi cela compte-t-il pour le prix ? Parce que toute charge de travail réelle envoie encore et encore le même contexte. Un agent de programmation relit le même dépôt. Un agent de support relit les mêmes politiques et macros à chaque ticket. Une fois ce contexte mis en cache, vous ne payez plus que des centimes pour les tokens d'entrée. Si votre cas d'usage réutilise les prompts, votre prix d'entrée effectif est bien inférieur au tarif affiché, et c'est cet écart qui fait vraiment décrocher le coût total de MiMo par rapport à la pointe du marché.

Comment les tarifs de MiMo V2.6 se comparent à la pointe du marché

C'est la comparaison pour laquelle ce lancement a été conçu. Sur l'indice d'intelligence d'Artificial Analysis, MiMo V2.6 Pro a obtenu un score de 46, le meilleur modèle à poids ouverts, à égalité avec Grok 4.7 sorti le même jour, et juste derrière les leaders fermés.

Diagramme en barres de l'indice d'intelligence Artificial Analysis avec MiMo V2.6 Pro à 46, tiré de Xiaomi MiMo
Diagramme en barres de l'indice d'intelligence Artificial Analysis avec MiMo V2.6 Pro à 46, tiré de Xiaomi MiMo

Le score seul ne raconte pas toute l'histoire du prix. Le graphique qui compte pour le coût est celui de l'intelligence par rapport au coût par tâche, où MiMo V2.6 Pro se situe dans le "quadrant le plus attractif", en vert, à environ 0,13 $ par tâche, tandis que Claude Opus 5 et GPT-6 Astra se trouvent à l'extrémité 3 $ à 8 $ du même axe.

Nuage de points de l'indice d'intelligence Artificial Analysis en fonction du coût par tâche, avec MiMo V2.6 Pro sur la frontière de Pareto, tiré de Xiaomi MiMo
Nuage de points de l'indice d'intelligence Artificial Analysis en fonction du coût par tâche, avec MiMo V2.6 Pro sur la frontière de Pareto, tiré de Xiaomi MiMo

Face au champ des modèles ouverts, c'est tout aussi tranchant. Flash égale les niveaux les moins chers comme DeepSeek V4.1 Flash, et le Pro de 1,02 billion devance le bien plus grand Kimi K3, à 2,8 billions, tout en le dominant sur la plupart des classements. Un commentateur de Hacker News, qui avait beaucoup utilisé le modèle, a résumé le calcul de valeur ainsi :

Hacker News

"Mimo 2.6 pro, the 1T model leads Kimi K3, a 2.8T param model in 14 out of 15 benchmarks (and the last one is near tie)!! Good to see they also kept the price the same, and landed in the greenest quadrant of the intelligence vs speed of AA."

Précision honnête, car un article sur les tarifs se doit d'être clair sur les limites : MiMo est en retard sur les meilleurs modèles fermés dans les classements les plus difficiles. Sur Terminal Bench 4.0, il obtient 34,9 contre 59,6 pour GPT-6 Astra, et sur ExploitBench il atteint 47,9 contre plus de 70 pour GPT-5.6 Sol et Claude. Si votre travail se situe sur ces terrains d'excellence, le prix bas du token ne fait pas toute la décision. Pour tout le reste, le rapport qualité-prix est difficile à contester.

Exemples chiffrés : ce que vous paieriez réellement

Les tarifs par million de tokens sont abstraits. Voici ce que coûteraient trois charges de travail réalistes sur MiMo V2.6, pour que les chiffres prennent tout leur sens.

  • Un développeur indépendant sur Flash. Disons que vous consommez 20M de tokens en entrée et 5M en sortie par mois en codant avec Flash. Cela donne 20 × 0,14 $ + 5 × 0,28 $ = 4,20 $ par mois. Une erreur d'arrondi.
  • Une petite équipe faisant tourner un agent de programmation sur Pro. 300M en entrée, 80M en sortie par mois sur Pro : 300 × 0,435 $ + 80 × 0,87 $ = 200,10 $ par mois, avant toute réduction de cache. Avec une forte réutilisation des prompts, la facture réelle se situe bien en dessous.
  • Une charge de travail de support à gros volume sur Flash. 10 000 tickets par mois, environ 8K en entrée et 1K en sortie chacun, soit 80M en entrée et 10M en sortie : 80 × 0,14 $ + 10 × 0,28 $ = 14 $ par mois en tokens bruts.

Ce dernier chiffre mérite qu'on s'y attarde. Dix mille conversations de support pour 14 $ de tokens de modèle. Si c'était le vrai coût du support par IA, tout le monde l'aurait déployé depuis des années. Ce n'est pas le cas, et l'écart entre "14 $ de tokens" et "un agent de support qui fonctionne" est exactement le sujet de la section suivante.

Les poids gratuits ne coûtent pas rien à faire tourner

MiMo V2.6 est véritablement ouvert sous licence MIT, donc "hébergez-le vous-même" est un conseil réel, pas du marketing. Mais le fait que les poids soient gratuits ne rend pas leur exécution gratuite. La facture matérielle est le poste caché.

Arbre de décision comparant l'auto-hébergement de MiMo V2.6 sur vos propres GPU au paiement de l'API hébergée
Arbre de décision comparant l'auto-hébergement de MiMo V2.6 sur vos propres GPU au paiement de l'API hébergée

Voici ce dont chaque variante a besoin, selon les fiches du modèle :

  • Pro (1,02T / 42B actifs) : le lancement de référence sur SGLang utilise un cluster de 2 nœuds, 16 GPU (tensor-parallèle 16). C'est un engagement matériel sérieux.
  • Flash (309B / 15B actifs) : fonctionne sur un seul nœud à 8 GPU.
  • Distill-Qwen-9B : assez petit pour un seul GPU, et des quantifications GGUF existent déjà pour les outils locaux.

Tous les checkpoints sont livrés en FP8, ce qui garde l'empreinte mémoire raisonnable, mais la lecture honnête est celle-ci : l'auto-hébergement ne bat l'API que lorsque vous avez un volume élevé et constant et des GPU inactifs à remplir. Pour un volume irrégulier ou faible, l'API hébergée à 0,14 $ - 0,87 $ par million de tokens est presque toujours moins chère que de garder un cluster allumé en permanence. Calculez votre propre taux d'utilisation avant de supposer que "poids gratuits" signifie "gratuit".

La partie que l'étiquette de prix ne montre jamais

C'est ici que je dois prendre du recul, car je construis et exploite de l'IA pour le support client dans la vraie vie, et la conversation sur les tarifs passe presque toujours à côté de la vraie facture.

Le coût en tokens de MiMo V2.6, ou de DeepSeek, ou de Qwen, ou de n'importe lequel d'entre eux, est la ligne budgétaire la plus petite d'un système en production. La partie coûteuse, c'est tout ce qui entoure le modèle.

Diagramme en barres empilées montrant les tokens du modèle comme une minuscule fraction du coût total d'un système de support client par IA en production
Diagramme en barres empilées montrant les tokens du modèle comme une minuscule fraction du coût total d'un système de support client par IA en production

Nous avons passé ces dernières années à déployer des agents IA sur des files de support en direct, et la leçon récurrente est qu'un modèle brut, aussi bon marché et intelligent soit-il, n'est pas un agent de support. Pour passer de "14 $ de tokens" à "un agent en qui j'ai confiance face à un client", il faut le connecter à votre helpdesk, le nourrir avec votre base de connaissances et vos anciens tickets, lui enseigner vos politiques, lui donner des actions qu'il peut effectuer en toute sécurité, et surtout, le tester avant sa mise en production. Nous avons vu des bots au ton assuré donner silencieusement de mauvaises réponses, c'est exactement pourquoi tout déploiement devrait d'abord être simulé sur des tickets historiques.

Rien de tout cela n'apparaît sur une page de tarifs OpenRouter. C'est la différence entre un modèle et un coéquipier qui fonctionne, et c'est là que se trouve le véritable coût du support client par IA.

Essayer eesel

Un modèle comme MiMo V2.6 est un moteur. eesel est le coéquipier que vous engagez pour le conduire. eesel est une plateforme de coéquipiers IA, et l'agent de support client par IA est un coéquipier de support prêt à travailler : il se connecte à votre helpdesk en quelques minutes, lit déjà vos anciens tickets et votre base de connaissances, et vous pouvez le simuler sur des milliers de vos conversations historiques réelles avant qu'il ne réponde à un seul client en direct. Plutôt que de facturer un tarif fixe par poste, eesel facture à l'usage, de sorte que le coût suit le travail réellement effectué.

Aperçu du tableau de bord du support client par IA eesel
Aperçu du tableau de bord du support client par IA eesel

Et si vous vivez dans un terminal, eesel dispose d'une CLI publique ainsi que d'un serveur MCP, de sorte que le même coéquipier et le même espace de travail que vous gérez dans le tableau de bord peuvent être pilotés depuis des scripts ou par des agents de programmation comme Claude Code, Codex et Cursor. C'est la façon la plus adaptée aux agents d'exploiter eesel : une personne le manipule à la main, un script l'automatise, ou un agent IA l'appelle, le tout face au même coéquipier de support. C'est cette couche qui transforme un modèle bon marché et capable en quelque chose qui résout réellement des tickets. Essayez gratuitement.

Questions fréquentes

Combien coûte Xiaomi MiMo V2.6 ?
Les poids sont téléchargeables gratuitement sous licence MIT. Sur l'API hébergée via OpenRouter, MiMo V2.6 Flash coûte 0,14 $ en entrée / 0,28 $ en sortie par million de tokens, Pro est à 0,435 $ / 0,87 $, et Pro UltraSpeed à 4,35 $ / 8,70 $. Ces tarifs représentent une fraction de ceux des modèles fermés de pointe, même si la facture réelle d'un système en production inclut aussi le travail autour du modèle, que notre décomposition des coûts détaille.
Quel est le moyen le moins cher d'utiliser Xiaomi MiMo V2.6 ?
Pour de faibles volumes, l'API Flash à 0,14 $ en entrée / 0,28 $ en sortie par million de tokens est la solution la moins chère et sans effort. Si vous disposez de GPU inactifs et d'un volume élevé et constant, l'auto-hébergement des poids gratuits élimine complètement la facture par token, mais vous prenez en charge le coût du cluster. Pour la plupart des équipes qui comparent les options, notre tour d'horizon des meilleurs agents IA open source détaille les compromis.
Xiaomi MiMo V2.6 est-il gratuit ?
Les poids du modèle sont véritablement gratuits et ouverts sous licence MIT, vous pouvez donc télécharger Pro, Flash et le distill 9B et les exploiter commercialement sans frais de licence. "Gratuit" ne concerne toutefois que les poids ; vous payez toujours soit les tokens de l'API hébergée, soit le matériel GPU pour les servir vous-même. Voir le meilleur modèle d'IA pour les tickets de support pour voir comment cela se traduit en pratique.
Comment les tarifs de Xiaomi MiMo V2.6 se comparent-ils à DeepSeek et Kimi K3 ?
MiMo V2.6 Flash égale les niveaux ouverts les moins chers à 0,14 $ / 0,28 $, et MiMo V2.6 Pro, à 0,435 $ / 0,87 $, se situe largement en dessous de la plupart des tarifs de pointe tout en dominant l'indice des poids ouverts d'Artificial Analysis avec un score de 46. Il rivalise en coût par tâche avec DeepSeek V4.1 Flash et devance le beaucoup plus grand Kimi K3 sur les mêmes classements.
Qu'est-ce que MiMo V2.6 Pro UltraSpeed, et pourquoi coûte-t-il 10 fois plus cher ?
UltraSpeed sert exactement le même checkpoint Pro à environ 10 fois la vitesse de sortie (environ 116 tokens par seconde), et Xiaomi le facture 10 fois le tarif Pro : 4,35 $ en entrée / 8,70 $ en sortie par million de tokens. Vous payez pour la latence, pas pour l'intelligence, donc cela n'a de sens que pour les charges de travail interactives ou en temps réel des agents IA où la vitesse est le goulot d'étranglement.
Xiaomi MiMo V2.6 propose-t-il une réduction sur le cache ?
Oui. MiMo V2.6 Pro affiche les tokens de lecture en cache à environ 0,0036 $ par million, soit une réduction de 99 % sur le tarif d'entrée de 0,435 $. Le contexte répété (prompts système, longs documents) devient donc très bon marché une fois mis en cache. Les charges de travail qui réutilisent le même prompt bénéficient d'un prix d'entrée effectif très inférieur au tarif affiché, ce qui compte beaucoup pour les usages de support client par IA où les mêmes politiques sont lues à chaque ticket.
Devrais-je utiliser Xiaomi MiMo V2.6 pour le support client ?
MiMo V2.6 est un moteur puissant et bon marché, mais un modèle brut n'est pas un agent de support. Il doit tout de même lire vos tickets, suivre vos politiques, effectuer des actions dans votre helpdesk et être testé avant de répondre à un vrai client. C'est cet écart que comble eesel, et vous pouvez le simuler sur d'anciens tickets avant sa mise en production.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Illustration du modèle à poids ouverts Xiaomi MiMo V2.6
Trending

Xiaomi MiMo V2.6 : caractéristiques, benchmarks et comment utiliser le modèle ouvert

MiMo V2.6 de Xiaomi est une famille de modèles omnimodaux à poids ouverts, avec un contexte de 1M de tokens et une licence MIT. Voici les vraies caractéristiques, les benchmarks et les tarifs de l'API.

Rama Adi NugrahaRama Adi NugrahaSep 23, 2026
Illustration de l'avis sur Xiaomi MiMo V2.6
Trending

Avis Xiaomi MiMo V2.6 : la frontière ouverte bon marché en vaut-elle la peine ?

Un avis concret sur Xiaomi MiMo V2.6 : ce que disent vraiment les benchmarks, le calcul de valeur qui le rend intéressant, à qui il s'adresse, et où il reste à la traîne.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 24, 2026
Illustration d'une équipe évaluant Gemini 3.8 Flash, avec un indicateur de vitesse, une fusée et une coche de verdict
Trending

Avis sur Gemini 3.8 Flash : rapide, verbeux et pas la mise à niveau que le numéro suggère

Un avis pratique sur Gemini 3.8 Flash : ce qu'il fait bien, où il pêche, le piège des 13 secondes que personne n'a mentionné, et si ça vaut le coup de passer de 3.7 Flash.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Illustration d'un robot rapide en train de coder sur un ordinateur portable pendant qu'une personne l'observe, représentant Gemini 3.8 Flash
Trending

Gemini 3.8 Flash : ce que c'est, des benchmarks honnêtes et mon avis

Google a lancé Gemini 3.8 Flash le 2 septembre 2026, trois semaines après 3.7. Même prix, meilleurs scores, et une ligne en petits caractères qui change la réponse.

Alicia Kirana UtomoAlicia Kirana UtomoSep 3, 2026
Un testeur regardant une fiche de verdict avec deux cadrans d'effort étiquetés bas et max, à côté de la baleine DeepSeek
Trending

Avis sur DeepSeek V4 Flash : un modèle, deux personnalités

Un avis sur DeepSeek V4 Flash construit sur les chiffres publiés par les deux classements. L'exécution bon marché et l'exécution intelligente sont les mêmes poids, et cela change le verdict.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
Illustration d'un chat très long étiré sur un bureau à côté d'une baie de serveurs, avec le logo LongCat
Trending

LongCat 2.0 : dans les coulisses du modèle ouvert de 1,6T de Meituan

LongCat 2.0 est le modèle MoE de 1,6T paramètres de Meituan, sous licence MIT, à 0,30 dollar par million de tokens en entrée. J'ai lu toutes les sources primaires pour voir ce qui est réellement livré.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration d'une équipe évaluant des alternatives de modèles d'IA à Xiaomi MiMo V2.6
Alternatives

Les 8 meilleures alternatives à Xiaomi MiMo V2.6 en 2026

MiMo V2.6 est actuellement le meilleur modèle ouvert le moins cher, mais ce n'est pas la seule option. Voici les 8 meilleures alternatives à Xiaomi MiMo V2.6, ouvertes et fermées.

Rama Adi NugrahaRama Adi NugrahaSep 23, 2026
Illustration de deux personnes consultant des graphiques et des compteurs de vitesse autour d'une étincelle Gemini, représentant les tarifs de Gemini 3.8 Flash
Trending

Tarifs de Gemini 3.8 Flash : chaque tarif, le coût caché et le piège

Gemini 3.8 Flash coûte 0,75 $/3,75 $ par million de tokens, exactement comme 3.7 Flash. Mais le prix affiché cache une taxe de verbosité, et les deux montants doublent le 1er janvier 2027.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Tarifs DeepSeek V4 Flash : ce que vous paierez réellement
Trending

Tarifs DeepSeek V4 Flash : ce que vous paierez réellement

DeepSeek V4 Flash affiche $0.14 en entrée et $0.28 en sortie par million de tokens. Des utilisateurs réels ont publié des taux mixtes sous le cent. Voici ce qui décide lequel des deux vous attend.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement