
Qu'est-ce que Kimi K3 ?
Kimi K3 est le modèle phare de Moonshot AI, le laboratoire chinois derrière le précédent modèle à poids ouverts Kimi K2. Moonshot décrit K3 comme « le premier modèle open source au monde de classe 3 billions, conçu pour une intelligence de pointe sur le code à long horizon, le travail de connaissance et le raisonnement ».
Ce qui frappe, c'est que Moonshot est étonnamment honnête sur la position de K3. Le billet de lancement affirme sans détour que « bien que ses performances globales restent en retrait par rapport aux modèles propriétaires les plus puissants, Claude Fable 5 et GPT 5.6 Sol, Kimi K3 a démontré des performances de niveau frontière sur l'ensemble de notre suite d'évaluation, surpassant systématiquement les autres modèles testés ». On voit rarement un laboratoire commencer par ce que son modèle n'est pas, ce qui rend le reste de leurs affirmations plus facile à croire.
Il y a un bémol à signaler d'entrée de jeu. Moonshot qualifie ce modèle d'open source, mais au lancement, il n'était accessible que via l'API. Le blog officiel indique que « les poids complets du modèle seront publiés d'ici le 27 juillet 2026 », et durant la semaine de lancement, le dépôt HuggingFace renvoyait encore une erreur 404. Donc si votre plan était de l'auto-héberger dès le premier jour, ce plan devra attendre quelques semaines.
Comment Kimi K3 fonctionne réellement
Si vous avez déjà développé avec ce type de modèles, la partie intéressante de K3 n'est pas le nombre de paramètres, c'est la façon dont Moonshot y est arrivé sans faire exploser les coûts. Voici le pipeline en une image.

Quelques éléments font le gros du travail :
- Un mélange d'experts très épars. K3 compte 2,8 billions de paramètres au total, mais il « n'active effectivement que 16 des 896 experts » par token, grâce à ce que Moonshot appelle un framework Stable LatentMoE. Le routage épars est ce qui permet d'obtenir un modèle énorme tout en restant abordable à exploiter : seule une infime partie s'active pour un token donné.
- Kimi Delta Attention (KDA). Un mécanisme d'attention linéaire hybride qui rend la fenêtre de contexte d'1 M de tokens pratique au lieu de ruineusement coûteuse.
- Attention Residuals (AttnRes). Un remplacement direct des connexions résiduelles standards, que Moonshot a publié séparément en open source sur github.com/MoonshotAI/Attention-Residuals.
- Un raisonnement toujours actif. K3 « réfléchit » en permanence, il n'existe pas de mode sans raisonnement moins coûteux. L'effort se règle via un champ
reasoning_effortqui n'accepte actuellement quemax, les niveaux inférieurs étant « à venir ».
Mis bout à bout, Moonshot revendique « une amélioration d'environ 2,5x de l'efficacité globale de mise à l'échelle par rapport à Kimi K2 ». C'est là la vraie histoire : pas seulement plus gros, mais beaucoup plus de résultat par unité de calcul d'entraînement. Une zone d'ombre honnête : le rapport technique complet et le nombre exact de paramètres actifs ne sont pas encore publiés, donc une partie du comment reste pour l'instant une promesse.
Comment Kimi K3 se classe sur les benchmarks
C'est ici que K3 mérite le label « frontière ». Moonshot a publié des graphiques comparatifs face à Fable 5, GPT-5.6 Sol, Opus 4.8 et GPT-5.5, et des tests indépendants ont commencé à les corroborer.

La tendance est constante. K3 est généralement un cran derrière Fable 5 et GPT-5.6 Sol, mais confortablement devant le niveau phare précédent. Quelques lectures concrètes des graphiques de Moonshot :
- Tâches web agentiques (BrowseComp) : K3 est en tête avec 91,2, devant GPT-5.6 Sol (90,4) et Fable 5 (88,0).
- Automation Bench : K3 premier avec 30,8, devançant de peu GPT-5.6 Sol (29,7) et Fable 5 (29,1).
- SWE Marathon (code à long horizon) : K3 domine avec 42,0, au-dessus d'Opus 4.8 (40,0) et de GPT-5.6 Sol (39,0).
- GDPval-AA v2 (travail de connaissance) : ici il glisse à la troisième place avec 1668, derrière Fable 5 (1760) et GPT-5.6 Sol (1748).
Les tests indépendants racontent la même histoire. Sur Artificial Analysis, K3 affiche un Intelligence Index de 57, classé 4ᵉ sur 189 modèles, et sur leur évaluation privée de travail de connaissance à long horizon, il « bat surtout Claude Opus 4.8 max et GPT-5.5 high, tout en perdant face à Claude Fable 5 et GPT-5.6 Sol ». La vitesse de sortie est plus ordinaire, environ 62 tokens/seconde. Mon avis : considérez K3 comme un solide numéro deux fiable plutôt qu'un tueur de géants, et lisez tout titre du genre « bat Opus 4.8 » comme spécifique à une tâche, car sur de nombreuses tâches, c'est exactement ce qu'il fait.
Ce qui a changé entre Kimi K2 et K3
Si vous connaissiez Kimi comme le modèle chinois bon marché et compétent, K3 réécrit deux de ces suppositions. Il est bien plus gros et bien plus efficace par unité de calcul, mais il n'est plus bon marché non plus.

C'est la ligne des prix qui a fait basculer tout le narratif. « Kimi est le tueur de modèles de pointe ultra bon marché » était une histoire de l'ère K2. Avec K3, Moonshot a relevé le prix jusqu'au territoire des modèles phares, en misant sur le fait que l'intelligence justifie ce tarif.
Le tarif de Kimi K3
Posons les vrais chiffres, car « modèle open source abordable » ne décrit plus ce que vous allez réellement payer. Le tarif officiel de l'API K3 est agréablement simple : un modèle, un prix, fixe sur toute la fenêtre de contexte.
| Modèle | Unité | Entrée (cache atteint) | Entrée (cache manqué) | Sortie | Fenêtre de contexte |
|---|---|---|---|---|---|
kimi-k3 | 1M tokens | $0.30 | $3.00 | $15.00 | 1,048,576 (1M) |
Deux choses me plaisent ici. Il n'y a aucun palier premium pour les longs prompts, la fenêtre d'1 M est tarifée de la même façon d'un bout à l'autre, contrairement à certains concurrents qui facturent plus au-delà d'un certain seuil de tokens. Et la remise de mise en cache du contexte est réelle : un cache atteint fait tomber l'entrée à 0,30 $/M, soit une économie de 90 %. Pour le travail sur de longs documents ou les agents à long horizon où la majeure partie de l'entrée est un contexte stable et mis en cache, c'est là que K3 devient vraiment compétitif.
Si vous utilisez l'application grand public plutôt que l'API, Kimi propose quatre formules d'abonnement, nommées d'après des tempos musicaux, en plus d'un plan gratuit :
| Formule | Mensuel | Annuel (par mois) | Inclusions notables |
|---|---|---|---|
| Gratuit | $0 | - | Chat basique |
| Moderato | $19 | $15 | Deep Research, Docs/Sheets/Slides, accès à Kimi Code |
| Allegretto | $39 | $31 | 2x crédits d'agent, 5x crédits Kimi Code |
| Allegro | $99 | $79 | 5x crédits d'agent, agents parallèles Swarm |
| Vivace | $199 | $159 | 10x crédits d'agent, concurrence Swarm maximale |
Source : tarifs d'abonnement Kimi. À noter : cette page affiche une bannière indiquant que de nouvelles formules arrivent et que les avantages de Kimi chat et Kimi Code seront séparés en produits distincts, donc cette grille pourrait bientôt changer.
Alors, comment se positionne réellement ce tarif de 3 $ / 15 $ ? Le seul point de comparaison solide et de première main est DeepSeek, dont le V4 Flash tourne à 0,14 $ / 0,28 $ par million, soit environ 21 fois moins cher en sortie que K3. DeepSeek reste la vraie option de pointe économique ; K3 ne joue plus sur ce terrain. La lecture de la communauté durant la semaine de lancement était plus directe : comme l'a formulé un commentateur sur Hacker News, on passe de « c'est totalement bon marché » à un modèle qui coûte à peu près ce que coûte le niveau Sonnet de Claude. L'avantage tarifaire de K3 n'est pas le taux par token affiché en une, c'est la fenêtre fixe d'1 M plus cette remise de cache de 90 %.
Ce que pense vraiment la communauté
La semaine de lancement d'un modèle de pointe open source est bruyante, et la réaction à K3 s'est nettement scindée entre l'enthousiasme pour ses capacités et le scepticisme sur le coût. Le signal le plus utile est venu des personnes qui l'ont réellement utilisé sur du travail concret.
Les retours sur la parité en code ont été les éloges les plus marqués :
"Je m'amuse avec depuis quelques heures, et je trouve que c'est un modèle incroyable. Je ne suis pas sûr de pouvoir faire la différence avec Fable dans un test en aveugle. Le quota du forfait Kimi Coding à 100 $ semble à peu près correspondre à ce que j'obtiens avec le forfait Anthropic à 200 $ quand j'utilise principalement Fable."
Il y a aussi un vrai moment d'émotion autour d'un modèle open source qui rivalise avec les laboratoires fermés :
"Kimi K3 a été officiellement lancé ! Regardez ce jeu voxel créé avec ce prompt basique : 'Voxel star wars pod-racers run'. Les modèles chinois ont comblé l'écart ! Nous entrons dans une nouvelle phase de l'IA."
Le battage médiatique d'avant-lancement avait placé la barre encore plus haut :
"K3 est une bête différente. Les rumeurs disent que Kimi K3 est un modèle bien plus grand, au niveau de Claude Opus 4.7."
Et le camp le plus calme l'a placé à peu près là où les chiffres le situent, un cran en dessous du tout premier rang :
"Euh, Fable n'est vraiment sorti qu'il y a 2 semaines, et GPT-5.6 Sol il y a seulement 1 semaine. Oui, Kimi K3 semble légèrement en dessous des deux, mais au-dessus de tous les autres modèles. Donc je dirais quelques semaines de retard, plus des mois maintenant..."
Le plus gros reproche ne portait pas sur la qualité, mais sur le coût, avec en plus une plainte récurrente selon laquelle K3 consomme plus de tokens que Fable pour accomplir la même tâche. Cette question d'efficacité en tokens est celle qui détermine réellement votre facture, et elle mérite d'être suivie à mesure que les tests indépendants mûrissent.
Ce que Kimi K3 peut construire
La présentation de lancement est vraiment amusante, et c'est la démonstration la plus claire du code à long horizon que vend Moonshot. En une seule exécution autonome de 48 heures, K3 a conçu une puce (Nangate 45 nm, 4 mm², simulée à plus de 8 700 tokens/seconde en décodage). Il a aussi construit « MiniTriton », un compilateur GPU de type Triton avec sa propre IR, égalant ou surpassant torch.compile sur certaines charges de travail. Et il a généré des jeux 3D jouables à partir de simples prompts :

La réaction de la communauté face au compilateur GPU a résumé l'ambiance, à parts égales entre l'émerveillement et le « montrez-moi les preuves » :
"Est-ce que quelqu'un a vu dans le billet de blog qu'il a réussi à coder un compilateur GPU entier à partir de rien ? On dirait qu'il a même surpassé triton sur certains kernels GPU. Ça me semble juste dingue. Je me demande s'ils vont l'open-sourcer et montrer combien de tokens ça a coûté."
Ce genre de démos est réel, mais ce sont aussi les meilleurs cas, des exécutions fortement échafaudées que tout laboratoire montre au lancement. L'écart entre « l'a fait une fois dans un bac à sable » et « le fait de façon fiable pour mon cas d'usage » est tout l'enjeu, ce qui m'amène à la partie qui m'importe le plus.
Un score de benchmark n'est pas un agent de support
Voici ce que chaque billet de lancement de modèle passe sous silence, et c'est ce qui compte si vous êtes arrivé ici en essayant de choisir un modèle pour le service client. Un score de 57 sur l'Intelligence Index vous dit que le moteur brut est solide. Il ne vous dit rien sur sa capacité à répondre en toute sécurité à vos clients.

Je construis des agents IA chez eesel, et ce que nous avons appris à nos dépens, c'est que la qualité du modèle ne représente peut-être qu'un tiers du problème. Nous avons vu des bots au ton confiant donner discrètement de mauvaises réponses, c'est exactement pourquoi nous simulons désormais chaque déploiement sur l'historique des tickets d'une entreprise avant qu'il ne parle à un client. Une simple clé API K3 brute ne vous offre rien de tout cela. Pour passer d'un excellent modèle à un coéquipier en qui vous auriez confiance sur la file, vous devez encore l'entraîner sur votre base de connaissances, l'intégrer à un routage qui escalade quand il n'est pas sûr, et le placer là où votre équipe travaille déjà. C'est là l'écart, et c'est le même écart que le modèle sous-jacent soit K3, Claude Opus, ou tout autre.
Essayer eesel
Si vous lisez un avis sur Kimi K3 parce que vous voulez une meilleure IA sur votre file de support, le modèle est la partie facile. eesel est la couche qui transforme un modèle de pointe en véritable agent de support : elle s'entraîne sur votre centre d'aide et vos anciens tickets, rédige ou résout entièrement les réponses au sein de votre helpdesk existant, et, surtout, vous permet de simuler l'ensemble sur votre véritable historique de tickets afin que vous voyiez le taux de résolution et le coût avant la mise en production.

Parce qu'eesel est agnostique vis-à-vis du modèle, vous pouvez surfer sur la vague de pointe, tourner sur le meilleur modèle du moment, sans réécrire de prompts ni surveiller une API brute. Et la tarification est conçue pour l'économie du support : basée sur l'usage, sans frais par siège, pour qu'un mois chargé ne vous pénalise pas d'avoir une équipe plus grande. Vous pouvez essayer eesel gratuitement et le simuler sur vos propres tickets en quelques minutes.
Questions fréquentes
Qu'est-ce que Kimi K3 ?
Combien coûte Kimi K3 ?
Kimi K3 est-il open source ?
Puis-je utiliser Kimi K3 pour le support client ?
Qu'est-ce que Kimi K3 peut vraiment construire ?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








Comment Kimi K3 se compare-t-il à Claude Fable 5 et GPT-5.6 ?