Tarifs de Kimi K3 : ce que coûte vraiment le modèle de pointe de Moonshot

Kurnia Kharisma Agung Samiadjie
Écrit par

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Relu par

Katelin Teen

Dernière modification July 17, 2026

Vérifié par un expert
Illustration d'une tuile du modèle Kimi K3 à côté d'une rangée de cartes de paliers tarifaires, en bleu Kimi

Tarifs API de Kimi K3, les chiffres réels

Directement depuis la page tarifaire officielle de K3 de Moonshot, voici ce que facture l'API. Tous les prix sont en USD par million de tokens, taxes ajoutées au moment du paiement.

ModèleEntrée (succès de cache)Entrée (cache manqué)SortieFenêtre de contexte
kimi-k30,30 $3,00 $15,00 $1 048 576 tokens (1M)

Quatre éléments de ce tableau comptent plus que les chiffres principaux :

  • La remise de 90% sur le cache est la vraie histoire. Un token d'entrée mis en cache coûte 0,30 $ au lieu de 3,00 $. Pour toute charge de travail où vous envoyez le même prompt système, les mêmes documents ou le même contexte encore et encore (agents, longues conversations, RAG), la majeure partie de votre entrée finit en cache, et votre tarif effectif d'entrée s'effondre vers ce plancher de 0,30 $.
  • Le tarif reste uniforme sur toute la fenêtre de 1M. Pas de palier majoré pour les prompts longs. Gemini et Claude ont historiquement facturé plus au-delà d'un certain seuil de tokens ; K3 ne le fait pas. Si vous injectez régulièrement d'énormes contextes, ce tarif fixe est un avantage discret.
  • Il n'existe qu'un seul SKU K3. Le modèle raisonne toujours, avec reasoning_effort actuellement verrouillé sur max. Il n'y a pas de variante « sans réflexion » moins chère vers laquelle se rabattre, contrairement aux générations Kimi précédentes qui séparaient les modes chat et réflexion.
  • Les tokens de raisonnement sont des tokens de sortie. Comme K3 réfléchit toujours, et que cette réflexion compte comme sortie facturée à 15 $/M, une trace de raisonnement bavarde peut coûter plus cher que la réponse visible elle-même. C'est là que la facture de tokens vous rattrape sans prévenir.

Un modèle, un prix, un raisonnement toujours actif. Simple à appréhender, mais c'est justement ce raisonnement permanent qui explique pourquoi certains trouvent K3 plus cher en pratique que ce que suggère l'étiquette.

Comment fonctionne Kimi K3, et pourquoi il réfléchit autant

Avant d'aller plus loin sur l'argent, il est utile de voir ce que vous payez réellement sous le capot. K3 est un modèle à mélange d'experts de 2,8 billions de paramètres qui active 16 des 896 experts par token, enveloppé dans deux nouvelles astuces que Moonshot appelle Kimi Delta Attention et Attention Residuals. Ensemble, elles apportent environ 2,5 fois plus d'efficacité de mise à l'échelle par rapport à K2.

Comment Kimi K3 traite une requête : entrée texte et image, un routeur d'experts, Kimi Delta Attention, raisonnement toujours actif, puis une réponse
Comment Kimi K3 traite une requête : entrée texte et image, un routeur d'experts, Kimi Delta Attention, raisonnement toujours actif, puis une réponse

L'étape de raisonnement toujours actif est celle qui touche votre facture. Chaque requête passe par un cycle de réflexion complet avant de répondre, et chacun de ces tokens de réflexion est facturé comme de la sortie. C'est excellent pour les problèmes difficiles et du gaspillage pour « quelle est votre politique de retour ? ». C'est la principale raison pour laquelle K3 peut sembler plus cher qu'un modèle au même tarif nominal.

Les paliers d'abonnement de l'application Kimi

Si vous ne touchez pas à l'API et voulez simplement le produit de chat, Kimi.com vend quatre paliers payants nommés d'après des tempos musicaux, plus un palier gratuit. Les prix ci-dessous sont mensuels, avec le tarif mensuel effectif en facturation annuelle entre parenthèses.

PalierMensuelAnnuel (effectif/mois)Ce que vous obtenez
Free0 $-Accès chat de base
Moderato19 $15 $Crédits agent, Docs/Sheets/Slides, Deep Research, Websites Deploy, accès Kimi Code
Allegretto39 $31 $2x crédits agent, 5x crédits Kimi Code, tout ce qui est dans Moderato
Allegro99 $79 $5x crédits agent, 15x crédits Kimi Code, Swarm (agents en parallèle), plugins
Vivace199 $159 $10x crédits agent, 30x crédits Kimi Code, concurrence Swarm maximale, quotas les plus élevés

Source : tarifs d'abonnement Kimi. Deux points à souligner. Premièrement, tous les paliers payants incluent Swarm, où plusieurs agents travaillent en parallèle, et les paliers supérieurs ne font qu'augmenter la concurrence et les multiplicateurs de crédits. Deuxièmement, la page affiche une bannière annonçant l'arrivée de nouveaux plans et le fait que les avantages de Kimi et Kimi Code seront scindés en produits séparés, donc si vous vous abonnez surtout pour l'outil de code, attendez-vous à ce que cela devienne bientôt sa propre ligne.

Comment le tarif de Kimi K3 se compare à Claude, GPT et DeepSeek

Voici la comparaison que la plupart des gens sont venus chercher, classée du tarif de sortie le moins cher au plus cher. Les lignes DeepSeek et Kimi K3 proviennent des pages tarifaires officielles ; les lignes Claude, GPT et Gemini sont des instantanés d'agrégateurs de juillet 2026 qui évoluent mois après mois, donc vérifiez-les sur la page de chaque fournisseur avant d'arrêter un budget.

ModèleEntrée (manqué)SortieEntrée en cacheContexte
DeepSeek V4 Flash0,14 $0,28 $0,0028 $1M
DeepSeek V4 Pro0,435 $0,87 $0,0036 $1M
Gemini 3.x Pro~2,00 $~12,00 $-1M+
GPT-5.6 Sol~2,50 $~15,00 $-~400K
Claude Sonnet~3,00 $~15,00 $-200K-1M
Kimi K33,00 $15,00 $0,30 $1M
Claude Opus~5,00 $~25,00 $-200K-1M
Ce qui a changé entre Kimi K2 et K3 : taille, efficacité de mise à l'échelle, tarif API et calendrier des poids ouverts
Ce qui a changé entre Kimi K2 et K3 : taille, efficacité de mise à l'échelle, tarif API et calendrier des poids ouverts

En clair :

  • K3 est dans la moyenne, pas bon marché. Il se situe au niveau de Claude Sonnet et au-dessus de GPT-5.6 Sol et de Gemini 3 Pro. Si vous vous attendiez à une bonne affaire, ajustez vos attentes.
  • Il reste moins cher que Claude Opus d'environ 40% en entrée comme en sortie, donc face au palier phare d'Anthropic, il reste un bon rapport qualité-prix.
  • Il coûte environ 21 fois le tarif de sortie de DeepSeek V4 Flash (15 $ contre 0,28 $). DeepSeek reste l'option de pointe économique ; K3 ne joue pas sur ce terrain.
  • Le véritable atout de K3 est le contexte fixe de 1M associé à la remise de 90% sur le cache. Pour le travail sur documents longs et les agents à long horizon où la majeure partie de l'entrée est mise en cache, le coût effectif d'entrée descend à 0,30 $/M, et c'est là que K3 devient réellement compétitif.

Faites le calcul avec vos propres chiffres

Les tarifs affichés ne vous disent pas ce que vous allez dépenser ; c'est votre mix de trafic qui compte. Indiquez un volume mensuel approximatif et regardez comment la remise de cache de K3 change la donne face à Sonnet et DeepSeek.

Le levier qui fait le plus bouger votre facture n'est pas le modèle choisi, c'est votre taux de succès de cache. Poussez le curseur vers le haut et K3 comble discrètement la majeure partie de l'écart avec les options moins chères sur l'entrée, même si le tarif de sortie de 15 $ le maintient bien loin de DeepSeek.

Ce que vous payez réellement

La raison pour laquelle K3 peut facturer des tarifs au niveau de Sonnet, c'est que sur les benchmarks, il les mérite. Dans la propre suite d'évaluation de Moonshot, il se classe juste en dessous de Claude Fable 5 et GPT-5.6 Sol et devant presque tout le reste, et il domine nettement quelques tests agentiques (notre test complet de Kimi K3 détaille les chiffres).

Graphique de benchmark de Kimi K3 sur des tâches générales et d'agents visuels, face à Fable 5, GPT-5.6 Sol, Opus 4.8, GPT-5.5 et GLM-5.2, tiré du blog de Kimi K3
Graphique de benchmark de Kimi K3 sur des tâches générales et d'agents visuels, face à Fable 5, GPT-5.6 Sol, Opus 4.8, GPT-5.5 et GLM-5.2, tiré du blog de Kimi K3

Quelques points concrets : sur le graphique Automation Bench, K3 domine le classement avec 30,8, il domine SpreadsheetBench 2 avec 34,8, et il domine BrowseComp avec 91,2. Les tests indépendants d'Artificial Analysis placent son Intelligence Index à 57, classé 4ᵉ sur 189 modèles, et son Elo de travail de connaissance à long horizon à 1547, un bond de +732 par rapport à Kimi K2.6. Moonshot reconnaît elle-même honnêtement qu'au global il « reste à la traîne des modèles propriétaires les plus puissants ».

Les démonstrations vitrines sont ce qui a fait réagir tout le monde : lors d'une exécution autonome de 48 heures, K3 a conçu une puce ; lors d'une autre, il a écrit de zéro un compilateur GPU façon Triton qui a battu torch.compile sur certains kernels. Il a aussi produit des jeux voxel jouables à partir de prompts d'une ligne. Si le code est votre cas d'usage, il a sa place dans la discussion sur les meilleurs outils de codage IA.

Une scène de colisée voxel générée par Kimi K3 à partir d'un court prompt, tournant à 120 FPS, tirée du blog de Kimi K3
Une scène de colisée voxel générée par Kimi K3 à partir d'un court prompt, tournant à 120 FPS, tirée du blog de Kimi K3

Les bémols : poids retardés et un grand appétit de tokens

Deux éléments viennent nuancer l'histoire tarifaire.

Premièrement, le modèle « ouvert » était API uniquement au lancement. Moonshot a promis les poids complets d'ici le 27 juillet 2026, et le lendemain de la sortie, le dépôt Hugging Face renvoyait toujours une erreur 404. Donc si votre budget partait du principe que vous alliez auto-héberger et éviter entièrement les coûts d'API, il faudra patienter, et contrairement à un chatbot open source entièrement auto-hébergeable, en attendant l'arrivée des poids, c'est en pratique une API.

Deuxièmement, K3 est vorace. La plainte la plus fréquente de ceux qui l'ont testé, c'est qu'il consomme plus de tokens que Fable pour accomplir la même tâche. Combiné au raisonnement toujours actif au tarif de sortie de 15 $, cela signifie que le coût effectif par tâche accomplie peut être plus élevé que ce que suggère la simple comparaison par token. Simon Willison a résumé ce choc tarifaire sans détour :

"The new model is notable for the pricing: $3/million input tokens and $15/million output tokens, putting it at the same level as Anthropic's Claude Sonnet series [...] This is expensive - the pelican cost 25 cents!"

Ce que disent les gens

L'opinion se divise clairement. Les éloges sur la qualité sont nombreux, surtout de la part de ceux qui font du vrai travail de code.

Hacker News

"I've been playing around with it for the past few hours, and I think it's an amazing model. I'm not sure I could tell the difference between this and Fable in a blind test. The quota in the $100 Kimi Coding plan seems to roughly align with what I get from the $200 Anthropic plan when I primarily use Fable."

C'est un point de repère utile pour les paliers de l'application : un utilisateur intensif a trouvé que le quota de code du palier Allegro à 99 $ correspondait à peu près au plan à 200 $ d'Anthropic. Et la communauté des modèles ouverts de pointe le considère comme une étape marquante.

Hacker News

"Yup some here are in denial but what many said would happen did just happen. They're not "six months behind": the model is totally SOTA. Cheaper, faster and they don't just crush Sonnet 5 and Opus 4.8: on 6 of the 14 benchmarks they posted Kimi K3 is in front of Fable."

La lecture la plus posée est que les gros titres ont légèrement devancé les preuves, et que K3 se situe un peu en dessous du tout premier rang plutôt que de le dépasser.

Hacker News

"Umm, Fable only really came out 2 weeks ago, and GPT-5.6 Sol only 1 week ago. Yes, Kimi K3 appears a touch below them both, but above all other models. So I'd say a few weeks behind, not months now..."

Du prix par token au prix qui compte vraiment

Voici ce à quoi je reviens sans cesse après des années à déployer des agents IA sur de vraies files de support : le prix par token d'un modèle de pointe n'est presque jamais ce qu'une équipe de support finit réellement par payer. Un modèle brut vous donne un score de benchmark, une clé API et un prompt vide. Un agent de support fonctionnel a besoin de votre centre d'aide et de vos anciens tickets chargés, de l'escalade basée sur la confiance, de garde-fous pour qu'il n'invente pas une réponse avec assurance, et d'une connexion en direct avec votre helpdesk. Le modèle, c'est la partie facile, peut-être 10%.

L'écart entre un modèle de pointe brut et un coéquipier prêt pour le support : connaissances, routage, tests et intégration au helpdesk
L'écart entre un modèle de pointe brut et un coéquipier prêt pour le support : connaissances, routage, tests et intégration au helpdesk

C'est là que j'orienterais une équipe de support qui regarde du côté de Kimi K3. eesel est un agent IA pour le service client agnostique vis-à-vis du modèle : il se connecte à des helpdesks comme Zendesk et Freshdesk, s'entraîne sur vos tickets et documents existants, et vous permet de simuler tout le processus sur vos anciens tickets avant même de répondre à un vrai client, afin que vous voyiez le taux de résolution avant de vous engager. Et au lieu d'une facture de tokens qui varie selon l'ampleur de la réflexion d'un modèle bavard, vous êtes facturé à la résolution, donc votre coût suit les tickets résolus. C'est ce modèle qui pilote réellement les économies sur les coûts de support, pas un rang dans un classement.

Tableau de bord de rapports eesel AI montrant des analyses de résolution et d'utilisation
Tableau de bord de rapports eesel AI montrant des analyses de résolution et d'utilisation

Alors profitez de Kimi K3 pour le code et le raisonnement complexe, où il est réellement impressionnant. Pour l'automatisation du support, tarifez le résultat, pas le token. Vous pouvez essayer eesel gratuitement et observer la simulation tourner sur vos propres tickets.

Questions fréquentes

Combien coûte Kimi K3 via l'API ?
Le tarif de Kimi K3 est de 3,00 $ par 1M de tokens en entrée (cache manqué), 0,30 $ par 1M en cas de succès de cache (une remise de 90%), et 15,00 $ par 1M de tokens en sortie, uniforme sur toute la fenêtre de contexte de 1M de tokens. C'est à peu près le niveau de Claude Sonnet. Pour une équipe de support, le chiffre qui compte le plus est votre coût par résolution, pas le tarif brut par token.
Kimi K3 est-il gratuit ?
L'application Kimi propose un palier gratuit, mais les paliers les plus performants sont payants. L'API kimi-k3 fonctionne à l'usage, et les abonnements de l'application coûtent de 19 à 199 $ par mois. Si votre objectif est l'automatisation du service client par l'IA, la facture du modèle n'est qu'une ligne parmi d'autres, pas le coût total d'un agent qui fonctionne vraiment.
Pourquoi Kimi K3 est-il plus cher que les anciens modèles Kimi ?
Kimi K2 était le pari de pointe ultra-économique. K3 est un modèle bien plus grand, avec 2,8 billions de paramètres, tarifé quasiment au niveau des modèles phares, si bien que le récit du « modèle chinois bon marché » ne tient plus. Il reste moins cher que Claude Opus, mais bien plus onéreux que des options économiques comme DeepSeek. Voyez comment il se positionne face au précédent tarif de Kimi K2.7 Code, et la différence entre le RAG et un LLM brut pour le support.
Comment le tarif de Kimi K3 se compare-t-il à Claude et GPT ?
À 3/15 $, Kimi K3 se situe au niveau de Claude Sonnet et au-dessus de GPT-5.6 (~2,50/15 $) et de Gemini 3 Pro (~2/12 $), tout en restant moins cher que Claude Opus (~5/25 $). Il se situe dans la moyenne, ce n'est pas une bonne affaire. Pour une vue d'ensemble, comparez nos analyses des tarifs de Claude Sonnet 5 et des tarifs de GPT-5.6.
Puis-je utiliser le tarif de Kimi K3 pour budgétiser un agent de service client ?
Pas directement. Le tarif par token n'est qu'une partie de l'histoire une fois que vous ajoutez votre base de connaissances, les garde-fous, les règles d'escalade et les intégrations avec votre helpdesk. Un agent IA pour le service client agnostique vis-à-vis du modèle comme eesel facture à la résolution, donc votre coût suit les tickets résolus plutôt que les tokens consommés. Vous pouvez d'abord tester le taux de résolution sur vos propres données.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Illustration pour une sélection des meilleures alternatives à Google Gemini 3.6 Flash en 2026
AI

Les 6 meilleures alternatives à Gemini 3.6 Flash en 2026

Les meilleures alternatives à Gemini 3.6 Flash en 2026, avec de vrais prix et benchmarks : GPT-5.6 Luna, Claude Sonnet 5, Grok 4.5, Flash-Lite et plus encore.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Illustration éditoriale pour un test de Gemini 3.6 Flash, le modèle d'IA workhorse rapide de Google
AI

Test de Gemini 3.6 Flash : le cheval de bataille moins cher et plus rapide de Google

Un test pratique de Gemini 3.6 Flash : le nouveau prix, la baisse de 17% des tokens, où il surpasse GPT-5.6 et Claude Sonnet 5, et où il reste encore derrière.

Rama Adi NugrahaRama Adi NugrahaJul 22, 2026
Illustration d'un compteur de crédits et de trois niveaux de plans, représentant la tarification par crédits de Gumloop
AI

Tarifs Gumloop 2026 : ce qu'un crédit vous coûte vraiment

Les tarifs Gumloop démarrent à 37 $/mois pour 20 000 crédits. Voici ce qu'est réellement un crédit, les cinq compteurs de chaque conversation d'agent, et où la facture s'envole.

Rama Adi NugrahaRama Adi NugrahaAug 17, 2026
Illustration éditoriale d'ouverture pour Muse Image de Meta, un modèle de génération d'images agentique, en bleu Meta
AI

Muse Image de Meta : ce qu'il fait et ce qu'il vaut vraiment

Muse Image de Meta est un modèle d'image agentique et gratuit qui parcourt le web et écrit du code en pleine génération. Voici ce qu'il sait faire, et ce qu'il vaut vraiment.

Alicia Kirana UtomoAlicia Kirana UtomoJul 9, 2026
Bannière illustrée présentant une analyse des tarifs de Genspark AI, le super-agent IA tout-en-un
AI

Tarifs de Genspark AI (2026) : ce que ça coûte vraiment

Les tarifs de Genspark AI sont Free, Plus à partir de 24,99 $/mois et Pro à partir de 249,99 $/mois. Voici ce que les crédits permettent réellement d'obtenir, et les pièges que le prix affiché ne montre pas.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Bannière illustrée présentant un décryptage des tarifs Flowith, montrant les paliers d'abonnement et un modèle de facturation basé sur les crédits
AI

Tarifs Flowith (2026) : forfaits, crédits et coût réel

Un décryptage complet des tarifs Flowith : les quatre paliers basés sur les crédits, ce qu'achète réellement un crédit, les pièges qui n'apparaissent pas sur la page tarifs, et à qui s'adresse chaque forfait.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustration d'un canevas IA à embranchements générant des images, des diapositives et du texte
AI

Avis Flowith : le canevas d'agent IA en vaut-il la peine ? (2026)

Un avis concret sur Flowith : ce que font vraiment le canevas IA à embranchements et Agent Neo, ce que coûte Flowith en crédits, et qui devrait passer son tour.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Bannière illustrée pour un guide sur Flowith, l'espace de travail créatif basé sur un agent IA construit sur un canevas infini de nœuds
AI

Qu'est-ce que Flowith ? Le canevas d'agent IA, Agent Neo et les tarifs

Flowith est un agent IA qui travaille sur un canevas infini plutôt que dans une fenêtre de chat. Voici ce que fait vraiment Agent Neo, son prix, et ce à quoi il sert.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Deux personnes en conversation avec des formes d'onde vocales entre elles et le logo Grok au-dessus
AI

Avis sur Grok Voice Think Fast 2.0 : rapide, affilé, plafonné

Un avis pratique sur Grok Voice Think Fast 2.0 : la réalité des benchmarks, les particularités de l'API et le plafond de 10 sessions simultanées qui décide si vous pouvez le mettre en production.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement