Avis sur Kimi K3 : le modèle frontière open source de Moonshot, testé

Alicia Kirana Utomo
Écrit par

Alicia Kirana Utomo

Katelin Teen
Relu par

Katelin Teen

Dernière modification July 21, 2026

Vérifié par un expert
Illustration éditoriale d'un grand modèle de langage raisonnant sur un long flux de documents

Qu'est-ce que Kimi K3 ?

Kimi K3 est le modèle phare de Moonshot AI, le laboratoire chinois derrière le précédent modèle à poids ouverts Kimi K2. Moonshot décrit K3 comme « le premier modèle open source au monde de classe 3 billions, conçu pour une intelligence de pointe sur le code à long horizon, le travail de connaissance et le raisonnement ».

Ce qui frappe, c'est que Moonshot est étonnamment honnête sur la position de K3. Le billet de lancement affirme sans détour que « bien que ses performances globales restent en retrait par rapport aux modèles propriétaires les plus puissants, Claude Fable 5 et GPT 5.6 Sol, Kimi K3 a démontré des performances de niveau frontière sur l'ensemble de notre suite d'évaluation, surpassant systématiquement les autres modèles testés ». On voit rarement un laboratoire commencer par ce que son modèle n'est pas, ce qui rend le reste de leurs affirmations plus facile à croire.

Il y a un bémol à signaler d'entrée de jeu. Moonshot qualifie ce modèle d'open source, mais au lancement, il n'était accessible que via l'API. Le blog officiel indique que « les poids complets du modèle seront publiés d'ici le 27 juillet 2026 », et durant la semaine de lancement, le dépôt HuggingFace renvoyait encore une erreur 404. Donc si votre plan était de l'auto-héberger dès le premier jour, ce plan devra attendre quelques semaines.

Comment Kimi K3 fonctionne réellement

Si vous avez déjà développé avec ce type de modèles, la partie intéressante de K3 n'est pas le nombre de paramètres, c'est la façon dont Moonshot y est arrivé sans faire exploser les coûts. Voici le pipeline en une image.

Comment fonctionne Kimi K3 : les entrées texte et image alimentent un routeur Stable LatentMoE qui sélectionne 16 des 896 experts, en passant par Kimi Delta Attention et un raisonnement toujours actif jusqu'à la réponse
Comment fonctionne Kimi K3 : les entrées texte et image alimentent un routeur Stable LatentMoE qui sélectionne 16 des 896 experts, en passant par Kimi Delta Attention et un raisonnement toujours actif jusqu'à la réponse

Quelques éléments font le gros du travail :

  • Un mélange d'experts très épars. K3 compte 2,8 billions de paramètres au total, mais il « n'active effectivement que 16 des 896 experts » par token, grâce à ce que Moonshot appelle un framework Stable LatentMoE. Le routage épars est ce qui permet d'obtenir un modèle énorme tout en restant abordable à exploiter : seule une infime partie s'active pour un token donné.
  • Kimi Delta Attention (KDA). Un mécanisme d'attention linéaire hybride qui rend la fenêtre de contexte d'1 M de tokens pratique au lieu de ruineusement coûteuse.
  • Attention Residuals (AttnRes). Un remplacement direct des connexions résiduelles standards, que Moonshot a publié séparément en open source sur github.com/MoonshotAI/Attention-Residuals.
  • Un raisonnement toujours actif. K3 « réfléchit » en permanence, il n'existe pas de mode sans raisonnement moins coûteux. L'effort se règle via un champ reasoning_effort qui n'accepte actuellement que max, les niveaux inférieurs étant « à venir ».

Mis bout à bout, Moonshot revendique « une amélioration d'environ 2,5x de l'efficacité globale de mise à l'échelle par rapport à Kimi K2 ». C'est là la vraie histoire : pas seulement plus gros, mais beaucoup plus de résultat par unité de calcul d'entraînement. Une zone d'ombre honnête : le rapport technique complet et le nombre exact de paramètres actifs ne sont pas encore publiés, donc une partie du comment reste pour l'instant une promesse.

Comment Kimi K3 se classe sur les benchmarks

C'est ici que K3 mérite le label « frontière ». Moonshot a publié des graphiques comparatifs face à Fable 5, GPT-5.6 Sol, Opus 4.8 et GPT-5.5, et des tests indépendants ont commencé à les corroborer.

Graphiques de benchmarks de Kimi K3 par Moonshot sur les agents généraux et les agents visuels, avec K3 mis en évidence, tirés du blog de lancement de Moonshot
Graphiques de benchmarks de Kimi K3 par Moonshot sur les agents généraux et les agents visuels, avec K3 mis en évidence, tirés du blog de lancement de Moonshot

La tendance est constante. K3 est généralement un cran derrière Fable 5 et GPT-5.6 Sol, mais confortablement devant le niveau phare précédent. Quelques lectures concrètes des graphiques de Moonshot :

  • Tâches web agentiques (BrowseComp) : K3 est en tête avec 91,2, devant GPT-5.6 Sol (90,4) et Fable 5 (88,0).
  • Automation Bench : K3 premier avec 30,8, devançant de peu GPT-5.6 Sol (29,7) et Fable 5 (29,1).
  • SWE Marathon (code à long horizon) : K3 domine avec 42,0, au-dessus d'Opus 4.8 (40,0) et de GPT-5.6 Sol (39,0).
  • GDPval-AA v2 (travail de connaissance) : ici il glisse à la troisième place avec 1668, derrière Fable 5 (1760) et GPT-5.6 Sol (1748).

Les tests indépendants racontent la même histoire. Sur Artificial Analysis, K3 affiche un Intelligence Index de 57, classé 4ᵉ sur 189 modèles, et sur leur évaluation privée de travail de connaissance à long horizon, il « bat surtout Claude Opus 4.8 max et GPT-5.5 high, tout en perdant face à Claude Fable 5 et GPT-5.6 Sol ». La vitesse de sortie est plus ordinaire, environ 62 tokens/seconde. Mon avis : considérez K3 comme un solide numéro deux fiable plutôt qu'un tueur de géants, et lisez tout titre du genre « bat Opus 4.8 » comme spécifique à une tâche, car sur de nombreuses tâches, c'est exactement ce qu'il fait.

Ce qui a changé entre Kimi K2 et K3

Si vous connaissiez Kimi comme le modèle chinois bon marché et compétent, K3 réécrit deux de ces suppositions. Il est bien plus gros et bien plus efficace par unité de calcul, mais il n'est plus bon marché non plus.

Ce qui a changé entre Kimi K2 et K3 : la taille est passée de 1 billion à 2,8 billions de paramètres, l'efficacité de mise à l'échelle a été multipliée par 2,5, le prix est passé d'ultra bon marché à un tarif premium de 3 $/15 $, et les poids ouverts arrivent désormais des semaines après le lancement
Ce qui a changé entre Kimi K2 et K3 : la taille est passée de 1 billion à 2,8 billions de paramètres, l'efficacité de mise à l'échelle a été multipliée par 2,5, le prix est passé d'ultra bon marché à un tarif premium de 3 $/15 $, et les poids ouverts arrivent désormais des semaines après le lancement

C'est la ligne des prix qui a fait basculer tout le narratif. « Kimi est le tueur de modèles de pointe ultra bon marché » était une histoire de l'ère K2. Avec K3, Moonshot a relevé le prix jusqu'au territoire des modèles phares, en misant sur le fait que l'intelligence justifie ce tarif.

Le tarif de Kimi K3

Posons les vrais chiffres, car « modèle open source abordable » ne décrit plus ce que vous allez réellement payer. Le tarif officiel de l'API K3 est agréablement simple : un modèle, un prix, fixe sur toute la fenêtre de contexte.

ModèleUnitéEntrée (cache atteint)Entrée (cache manqué)SortieFenêtre de contexte
kimi-k31M tokens$0.30$3.00$15.001,048,576 (1M)

Deux choses me plaisent ici. Il n'y a aucun palier premium pour les longs prompts, la fenêtre d'1 M est tarifée de la même façon d'un bout à l'autre, contrairement à certains concurrents qui facturent plus au-delà d'un certain seuil de tokens. Et la remise de mise en cache du contexte est réelle : un cache atteint fait tomber l'entrée à 0,30 $/M, soit une économie de 90 %. Pour le travail sur de longs documents ou les agents à long horizon où la majeure partie de l'entrée est un contexte stable et mis en cache, c'est là que K3 devient vraiment compétitif.

Si vous utilisez l'application grand public plutôt que l'API, Kimi propose quatre formules d'abonnement, nommées d'après des tempos musicaux, en plus d'un plan gratuit :

FormuleMensuelAnnuel (par mois)Inclusions notables
Gratuit$0-Chat basique
Moderato$19$15Deep Research, Docs/Sheets/Slides, accès à Kimi Code
Allegretto$39$312x crédits d'agent, 5x crédits Kimi Code
Allegro$99$795x crédits d'agent, agents parallèles Swarm
Vivace$199$15910x crédits d'agent, concurrence Swarm maximale

Source : tarifs d'abonnement Kimi. À noter : cette page affiche une bannière indiquant que de nouvelles formules arrivent et que les avantages de Kimi chat et Kimi Code seront séparés en produits distincts, donc cette grille pourrait bientôt changer.

Alors, comment se positionne réellement ce tarif de 3 $ / 15 $ ? Le seul point de comparaison solide et de première main est DeepSeek, dont le V4 Flash tourne à 0,14 $ / 0,28 $ par million, soit environ 21 fois moins cher en sortie que K3. DeepSeek reste la vraie option de pointe économique ; K3 ne joue plus sur ce terrain. La lecture de la communauté durant la semaine de lancement était plus directe : comme l'a formulé un commentateur sur Hacker News, on passe de « c'est totalement bon marché » à un modèle qui coûte à peu près ce que coûte le niveau Sonnet de Claude. L'avantage tarifaire de K3 n'est pas le taux par token affiché en une, c'est la fenêtre fixe d'1 M plus cette remise de cache de 90 %.

Ce que pense vraiment la communauté

La semaine de lancement d'un modèle de pointe open source est bruyante, et la réaction à K3 s'est nettement scindée entre l'enthousiasme pour ses capacités et le scepticisme sur le coût. Le signal le plus utile est venu des personnes qui l'ont réellement utilisé sur du travail concret.

Les retours sur la parité en code ont été les éloges les plus marqués :

Hacker News

"Je m'amuse avec depuis quelques heures, et je trouve que c'est un modèle incroyable. Je ne suis pas sûr de pouvoir faire la différence avec Fable dans un test en aveugle. Le quota du forfait Kimi Coding à 100 $ semble à peu près correspondre à ce que j'obtiens avec le forfait Anthropic à 200 $ quand j'utilise principalement Fable."

Il y a aussi un vrai moment d'émotion autour d'un modèle open source qui rivalise avec les laboratoires fermés :

LinkedIn

"Kimi K3 a été officiellement lancé ! Regardez ce jeu voxel créé avec ce prompt basique : 'Voxel star wars pod-racers run'. Les modèles chinois ont comblé l'écart ! Nous entrons dans une nouvelle phase de l'IA."

Le battage médiatique d'avant-lancement avait placé la barre encore plus haut :

"K3 est une bête différente. Les rumeurs disent que Kimi K3 est un modèle bien plus grand, au niveau de Claude Opus 4.7."

Et le camp le plus calme l'a placé à peu près là où les chiffres le situent, un cran en dessous du tout premier rang :

Hacker News

"Euh, Fable n'est vraiment sorti qu'il y a 2 semaines, et GPT-5.6 Sol il y a seulement 1 semaine. Oui, Kimi K3 semble légèrement en dessous des deux, mais au-dessus de tous les autres modèles. Donc je dirais quelques semaines de retard, plus des mois maintenant..."

Le plus gros reproche ne portait pas sur la qualité, mais sur le coût, avec en plus une plainte récurrente selon laquelle K3 consomme plus de tokens que Fable pour accomplir la même tâche. Cette question d'efficacité en tokens est celle qui détermine réellement votre facture, et elle mérite d'être suivie à mesure que les tests indépendants mûrissent.

Ce que Kimi K3 peut construire

La présentation de lancement est vraiment amusante, et c'est la démonstration la plus claire du code à long horizon que vend Moonshot. En une seule exécution autonome de 48 heures, K3 a conçu une puce (Nangate 45 nm, 4 mm², simulée à plus de 8 700 tokens/seconde en décodage). Il a aussi construit « MiniTriton », un compilateur GPU de type Triton avec sa propre IR, égalant ou surpassant torch.compile sur certaines charges de travail. Et il a généré des jeux 3D jouables à partir de simples prompts :

Un jeu en monde ouvert 3D généré par Kimi K3 à partir d'un seul prompt, montrant un cavalier à cheval dans un paysage automnal, tiré du blog Kimi K3 de Moonshot
Un jeu en monde ouvert 3D généré par Kimi K3 à partir d'un seul prompt, montrant un cavalier à cheval dans un paysage automnal, tiré du blog Kimi K3 de Moonshot

La réaction de la communauté face au compilateur GPU a résumé l'ambiance, à parts égales entre l'émerveillement et le « montrez-moi les preuves » :

Hacker News

"Est-ce que quelqu'un a vu dans le billet de blog qu'il a réussi à coder un compilateur GPU entier à partir de rien ? On dirait qu'il a même surpassé triton sur certains kernels GPU. Ça me semble juste dingue. Je me demande s'ils vont l'open-sourcer et montrer combien de tokens ça a coûté."

Ce genre de démos est réel, mais ce sont aussi les meilleurs cas, des exécutions fortement échafaudées que tout laboratoire montre au lancement. L'écart entre « l'a fait une fois dans un bac à sable » et « le fait de façon fiable pour mon cas d'usage » est tout l'enjeu, ce qui m'amène à la partie qui m'importe le plus.

Un score de benchmark n'est pas un agent de support

Voici ce que chaque billet de lancement de modèle passe sous silence, et c'est ce qui compte si vous êtes arrivé ici en essayant de choisir un modèle pour le service client. Un score de 57 sur l'Intelligence Index vous dit que le moteur brut est solide. Il ne vous dit rien sur sa capacité à répondre en toute sécurité à vos clients.

Un score de benchmark n'est pas un agent de support : un modèle de pointe brut vous donne un chiffre élevé, une clé API et un prompt vide, tandis qu'un coéquipier prêt pour le support est entraîné sur votre centre d'aide et vos anciens tickets, utilise un routage basé sur la confiance, est testé sur de vrais tickets avant sa mise en production, et vit à l'intérieur de votre helpdesk
Un score de benchmark n'est pas un agent de support : un modèle de pointe brut vous donne un chiffre élevé, une clé API et un prompt vide, tandis qu'un coéquipier prêt pour le support est entraîné sur votre centre d'aide et vos anciens tickets, utilise un routage basé sur la confiance, est testé sur de vrais tickets avant sa mise en production, et vit à l'intérieur de votre helpdesk

Je construis des agents IA chez eesel, et ce que nous avons appris à nos dépens, c'est que la qualité du modèle ne représente peut-être qu'un tiers du problème. Nous avons vu des bots au ton confiant donner discrètement de mauvaises réponses, c'est exactement pourquoi nous simulons désormais chaque déploiement sur l'historique des tickets d'une entreprise avant qu'il ne parle à un client. Une simple clé API K3 brute ne vous offre rien de tout cela. Pour passer d'un excellent modèle à un coéquipier en qui vous auriez confiance sur la file, vous devez encore l'entraîner sur votre base de connaissances, l'intégrer à un routage qui escalade quand il n'est pas sûr, et le placer là où votre équipe travaille déjà. C'est là l'écart, et c'est le même écart que le modèle sous-jacent soit K3, Claude Opus, ou tout autre.

Essayer eesel

Si vous lisez un avis sur Kimi K3 parce que vous voulez une meilleure IA sur votre file de support, le modèle est la partie facile. eesel est la couche qui transforme un modèle de pointe en véritable agent de support : elle s'entraîne sur votre centre d'aide et vos anciens tickets, rédige ou résout entièrement les réponses au sein de votre helpdesk existant, et, surtout, vous permet de simuler l'ensemble sur votre véritable historique de tickets afin que vous voyiez le taux de résolution et le coût avant la mise en production.

Vue d'ensemble du tableau de bord du helpdesk IA eesel
Vue d'ensemble du tableau de bord du helpdesk IA eesel

Parce qu'eesel est agnostique vis-à-vis du modèle, vous pouvez surfer sur la vague de pointe, tourner sur le meilleur modèle du moment, sans réécrire de prompts ni surveiller une API brute. Et la tarification est conçue pour l'économie du support : basée sur l'usage, sans frais par siège, pour qu'un mois chargé ne vous pénalise pas d'avoir une équipe plus grande. Vous pouvez essayer eesel gratuitement et le simuler sur vos propres tickets en quelques minutes.

Questions fréquentes

Qu'est-ce que Kimi K3 ?
Kimi K3 est le tout dernier modèle de Moonshot AI, lancé le 16 juillet 2026. C'est un modèle de mélange d'experts (mixture-of-experts) de 2,8 billions de paramètres, avec vision native et une fenêtre de contexte d'un million de tokens, présenté comme le premier modèle open source à l'échelle des 3 billions de paramètres. Si vous comparez des modèles pour le support client, notre comparatif des meilleurs agents IA est un meilleur point de départ qu'un seul modèle.
Combien coûte Kimi K3 ?
L'API Kimi K3 coûte 3,00 $ par million de tokens en entrée (cache manqué), 0,30 $ en cas de cache atteint, et 15,00 $ par million de tokens en sortie, un tarif fixe sur toute la fenêtre de contexte d'1 M. L'application grand public ajoute quatre formules d'abonnement, de 19 $ à 199 $ par mois. C'est un tarif de niveau Sonnet, pas l'offre bon marché pour laquelle Kimi K2 était connu.
Kimi K3 est-il open source ?
Moonshot le présente comme « le premier modèle open source au monde de classe 3 billions », mais les poids n'étaient pas disponibles au lancement. Moonshot annonce que les poids complets seront publiés d'ici le 27 juillet 2026, accompagnés d'un rapport technique. D'ici là, il n'est accessible que via l'API. Pour les équipes qui doivent déployer des agents en production, un modèle API qu'on ne peut pas encore auto-héberger mérite d'être anticipé.
Comment Kimi K3 se compare-t-il à Claude Fable 5 et GPT-5.6 ?
Selon les propres benchmarks de Moonshot et les tests indépendants d'Artificial Analysis, K3 se situe juste en dessous de Claude Fable 5 et GPT-5.6 Sol, tout en dépassant Claude Opus 4.8 et GPT-5.5 sur la plupart des tâches. Il arrive même en tête sur certains benchmarks agentiques et de code. À considérer comme un solide numéro deux, pas comme le nouveau modèle numéro un.
Puis-je utiliser Kimi K3 pour le support client ?
Vous pouvez l'appeler via l'API, mais un modèle brut n'est pas un agent de support. Il doit être entraîné sur votre centre d'aide et vos anciens tickets, intégré à un routage basé sur la confiance, et testé avant de répondre à de vrais clients. C'est exactement ce que gère eesel, qui est agnostique vis-à-vis du modèle : il fonctionne avec des modèles de pointe comme celui-ci sans que vous ayez à gérer les prompts. Découvrez comment nous abordons la prévention des hallucinations de l'IA dans le support.
Qu'est-ce que Kimi K3 peut vraiment construire ?
Lors de sa présentation de lancement, Moonshot a montré K3 concevant une puce de manière autonome en 48 heures, écrivant un compilateur GPU qui a surpassé Triton sur certains kernels, et générant des jeux 3D jouables à partir d'un simple prompt. Des démonstrations impressionnantes, même si la communauté a légitimement répondu « montrez-nous la facture en tokens ».

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Illustration représentant le grand modèle de langage Kimi K3 de Moonshot AI
Trending

Kimi K3 expliqué : le modèle de pointe ouvert de Moonshot

Un guide clair sur Kimi K3, le modèle ouvert à 2,8 billions de paramètres de Moonshot AI : ce que c'est, ses performances, son coût, et si le changement en vaut la peine.

Alicia Kirana UtomoAlicia Kirana UtomoJul 17, 2026
Bannière principale de l'avis Gemini 3.5 Pro en bleu Google
Trending

Avis Gemini 3.5 Pro : l'état honnête du modèle phare de Google

Un avis honnête sur Gemini 3.5 Pro : il n'est pas encore sorti. Voici ce que Google a confirmé, pourquoi il est en retard, les benchmarks qui existent vraiment, et ce qu'il faut utiliser aujourd'hui.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
Illustration d'Inkling, le modèle d'IA à poids ouverts de Thinking Machines Lab passé en revue
Trending

Avis sur Inkling : le modèle ouvert de Thinking Machines vaut-il le coup ?

Un avis honnête sur Inkling : ce dans quoi le premier modèle à poids ouverts de Thinking Machines Lab excelle vraiment, où le prix et les benchmarks déçoivent, et qui devrait vraiment l'utiliser.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustration d'Inkling, le modèle d'IA à poids ouverts de Thinking Machines Lab
Trending

Inkling expliqué : le modèle d'IA à poids ouverts de Thinking Machines

Ce qu'est vraiment Inkling : le premier modèle à poids ouverts de Thinking Machines Lab, ses vrais benchmarks, ce qu'il coûte à faire tourner, et s'il a sa place près d'une file de support.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Illustration comparant les meilleures alternatives au grand modèle de langage Kimi K3
Trending

Les 8 meilleures alternatives à Kimi K3 en 2026

Kimi K3 est un vrai modèle de pointe, mais ce n'est ni le moins cher ni le plus disponible : ses poids arrivent en retard. Voici les 8 meilleures alternatives à Kimi K3, avec de vrais prix d'API.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026
Bannière de l'avis sur PromptQL avec le logo PromptQL sur fond indigo
Trending

Avis sur PromptQL (2026) : l'agent de données de Hasura, testé

Un avis pratique sur PromptQL : comment l'agent de données de Hasura sépare planification et exécution, ce qu'il coûte, et si la promesse de fiabilité tient la route.

Alicia Kirana UtomoAlicia Kirana UtomoJul 10, 2026
Illustration de couverture de l'avis ChatGPT for Work dans le turquoise ChatGPT
Trending

Avis sur ChatGPT for Work : ça vaut le coup en 2026 ?

Un avis concret sur ChatGPT for Work : le prix des offres Business et Enterprise, ce que fait le nouvel agent ChatGPT Work, et où il a sa place (ou pas).

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Illustration éditoriale avec le logo Grok, des barres de benchmarks et une étiquette de prix représentant un avis sur Grok 4.5
Trending

Avis sur Grok 4.5 : benchmarks, prix et verdict

Grok 4.5 de xAI a été lancé le 8 juillet avec une 4e place à l'Intelligence Index et le meilleur résultat d'utilisation agentique d'outils du classement. Voici l'avis complet, les benchmarks, les prix, et qui devrait vraiment l'utiliser.

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026
Illustration éditoriale représentant une comparaison de modèles d'IA en tant qu'alternatives à Inkling
Trending

8 meilleures alternatives à Inkling en 2026

Inkling est ouvert et intéressant, mais il est cher pour un modèle à poids ouverts et ce n'est pas le modèle le plus intelligent que vous puissiez utiliser. Voici les 8 alternatives que j'essaierais vraiment, avec de vrais prix et les points forts de chacune.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement