Inkling expliqué : le modèle d'IA à poids ouverts de Thinking Machines

Alicia Kirana Utomo
Écrit par

Alicia Kirana Utomo

Katelin Teen
Relu par

Katelin Teen

Dernière modification July 20, 2026

Vérifié par un expert
Illustration d'Inkling, le modèle d'IA à poids ouverts de Thinking Machines Lab

Qu'est-ce qu'Inkling ?

Inkling est le premier modèle public de Thinking Machines Lab, et le laboratoire est étonnamment franc sur le fait qu'il ne cherche pas à remporter le classement. L'argument, c'est une base ouverte large et équilibrée que vous affinez pour votre propre usage, via la plateforme Tinker du labo. Autrement dit, Inkling se veut un point de départ à façonner, pas un chatbot auquel on s'abonne.

Les caractéristiques qui comptent, directement issues de la fiche modèle :

  • Architecture : un transformer Mixture-of-Experts (MoE), 975 Md de paramètres au total avec 41 Md actifs par token (il route chaque token vers 6 des 256 experts, plus 2 experts partagés). C'est pourquoi un modèle d'environ mille milliards de paramètres peut être servi à une vitesse raisonnable : seule une fraction fonctionne pour chaque token.
  • Entrées : texte, images et audio (WAV 16 kHz, de préférence moins de 20 minutes environ). La sortie est uniquement du texte.
  • Fenêtre de contexte : jusqu'à 1 M de tokens, ce qui le place dans le groupe de tête des modèles en matière de longueur.
  • Licence : Apache 2.0, l'usage commercial est donc autorisé et les poids sont sur Hugging Face.
  • Sortie : 15 juillet 2026.

La partie audio est l'élément inédit. Comme l'a formulé le commentaire le plus populaire du fil de lancement, c'est le "plus grand modèle à poids ouverts qui prend en charge l'audio", ce qui compte si vous voulez un jour qu'un modèle écoute un appel de support plutôt que de simplement lire sa transcription.

Comment Inkling est construit

Pour les amateurs de plomberie technique, Inkling fait quelques choix d'architecture inhabituels. Au lieu des désormais standard rotary position embeddings (RoPE), le rapport de l'équipe décrit un schéma de position relative intégré directement dans les logits d'attention, plus de courtes convolutions sur les keys et values avant qu'elles n'atteignent le cache. L'objectif pratique est le même que celui de tout modèle à long contexte : garder l'attention stable et peu coûteuse quand le contexte s'étire vers le million de tokens.

Le chemin d'attention relative d'Inkling : l'état caché se projette sur Q, K, V et R, avec une courte convolution sur K/V vers le cache et un biais de position relative ajouté aux logits d'attention, tel que schématisé par Thinking Machines dans le blog de lancement Hugging Face
Le chemin d'attention relative d'Inkling : l'état caché se projette sur Q, K, V et R, avec une courte convolution sur K/V vers le cache et un biais de position relative ajouté aux logits d'attention, tel que schématisé par Thinking Machines dans le blog de lancement Hugging Face

Pas besoin de décortiquer le schéma pour saisir l'essentiel : Inkling est conçu autour du contexte long et du raisonnement efficace, pas pour dominer un seul benchmark. Cela se retrouve aussi dans sa façon de "réfléchir".

Le curseur d'effort de raisonnement

Inkling est un modèle de raisonnement et propose un réglage d'"effort de réflexion" ajustable. Dans l'intégration Hugging Face, c'est un niveau reasoning_effort qui va de none et minimal jusqu'à low, medium, high, xhigh et max. Baissez-le et le modèle répond vite et à moindre coût ; montez-le et il dépense plus de tokens à réfléchir avant de répondre.

L'argument sur lequel Thinking Machines s'appuie ici est l'efficacité en tokens : ils affirment qu'Inkling atteint le même score Terminal-Bench que Nemotron 3 Ultra en dépensant environ un tiers des tokens pour y arriver. Pour quiconque paie au token ou loue un GPU, "même réponse, moins de tokens" est un chiffre plus utile qu'une victoire de justesse sur un benchmark.

Les benchmarks : solide, mais pas roi

C'est ici qu'il faut séparer l'argumentaire du fournisseur de la lecture indépendante. Les propres tableaux de Thinking Machines montrent des chiffres flatteurs à effort maximal, mais le signal le plus propre vient d'Artificial Analysis, qui benchmarke tout le monde de la même façon.

Leur verdict : Inkling obtient 41 points sur l'AA Intelligence Index, ce qui le classe #10 sur 97 sur leur classement sélectionné, bien au-dessus de la moyenne d'environ 25 pour les modèles à poids ouverts de cette taille. C'est donc un modèle intelligent. Mais il se situe en dessous des leaders de pointe (Claude Fable 5, GPT-5.6, Kimi K3, Grok 4.5, GLM-5.2) et atterrit dans un groupe avec des pairs comme DeepSeek V4 Flash. Les classements communautaires qui incluent davantage de modèles le placent encore plus bas, plus proche du #41, d'où vient le débat sur la légitimité du terme "compétitif".

Évaluation (Artificial Analysis)InklingCe que ça teste
GPQA Diamond87 %Raisonnement scientifique
AA-LCR63 %Raisonnement à contexte long
Terminal-Bench v2.155 %Codage agentique + usage du terminal
SciCode46 %Codage
AA-Omniscience (précision)40 %Connaissance
GDPval-AA v237 %Tâches de travail réelles
Humanity's Last Exam30 %Raisonnement + connaissance
CritPt5 %Raisonnement en physique

En lisant ce tableau honnêtement, on obtient une vraie personnalité : Inkling est solide en raisonnement scientifique et à long contexte, et nettement faible en physique et en fiabilité brute des connaissances (son indice de fiabilité des connaissances AA-Omniscience n'est que de 2 sur une échelle de −100 à 100). C'est un modèle avec des angles marqués, pas un généraliste bien lissé.

Le fil de lancement a saisi la même chose. Éloges et scepticisme se côtoyaient :

Hacker News

"Je viens de regarder les benchmarks et j'ai été un peu déçu qu'il semble se situer entre KimiK2.6 et KimiK2.7 sur la plupart d'entre eux."

Et la réponse la plus utile de tout le fil, celle qu'il vaut la peine d'afficher au-dessus de son écran avant de faire confiance à n'importe quelle comparaison de modèles :

Hacker News

"Vous voulez savoir à quel point un modèle est bon ? Faites-le tourner sur votre propre benchmark non public, c'est fondamentalement la seule façon d'avoir des réponses fiables auxquelles on peut à peu près se fier, tout le reste est manipulé, mal compris ou surestimé."

Cet instinct, que le seul benchmark qui compte, ce sont vos propres données, est exactement celui qu'il faut garder en tête si vous braquez un jour un modèle sur votre file de support. Plus de détails plus bas.

Quadrant de positionnement montrant Inkling dans le coin haute intelligence / prix élevé, tandis que des pairs à poids ouverts comme GLM, Qwen et DeepSeek se situent dans le coin haute intelligence / prix bas
Quadrant de positionnement montrant Inkling dans le coin haute intelligence / prix élevé, tandis que des pairs à poids ouverts comme GLM, Qwen et DeepSeek se situent dans le coin haute intelligence / prix bas

Combien coûte Inkling ?

C'est la partie qui m'a surpris. Inkling est à poids ouverts, et pourtant, sur l'API propre de Thinking Machines, il est tarifé comme un modèle de pointe propriétaire. Selon Artificial Analysis, il se classe #81 sur 97 côté prix, c'est-à-dire parmi les plus chers de sa catégorie.

Voie d'accèsCe que vous payezRemarques
API Thinking Machines - entrée1,87 $ / 1 M de tokensLa moyenne de la catégorie est d'environ 0,43 $ ; c'est cher
API Thinking Machines - sortie4,68 $ / 1 M de tokensLa moyenne de la catégorie est d'environ 1,25 $
Tarif mixte~1,10 $ / 1 M de tokensPour un mix 7:2:1 cache:entrée:sortie
Lecture/écriture du cache0,374 $ / 1 M de tokensUn hit de cache représente −80 % par rapport à l'entrée
Auto-héberger les poids0 $ pour le modèleApache 2.0 ; vous payez le matériel à la place
Fine-tuning avec TinkerService payantLe vrai modèle économique du laboratoire

Deux choses ressortent. D'abord, il n'y a actuellement qu'un seul fournisseur d'API, Thinking Machines lui-même, donc aucun hébergeur tiers moins cher ne vient encore casser les prix. Ensuite, "poids ouverts" ne rend le modèle gratuit que si vous êtes prêt à le faire tourner vous-même, ce qui est une vraie décision, pas une note de bas de page.

Échelle descendante de trois façons de faire tourner Inkling : les poids complets en BF16 nécessitent environ 2 To de VRAM, la quantification NVFP4 nécessite environ 600 Go, et le GGUF en 1 bit nécessite environ 95 % de moins et tourne sur une station de travail
Échelle descendante de trois façons de faire tourner Inkling : les poids complets en BF16 nécessitent environ 2 To de VRAM, la quantification NVFP4 nécessite environ 600 Go, et le GGUF en 1 bit nécessite environ 95 % de moins et tourne sur une station de travail

Faire tourner Inkling soi-même

Comme les poids sont ouverts, la communauté l'a fait tourner en local dès le premier jour. Le blog de lancement Hugging Face présente trois paliers approximatifs, que l'échelle ci-dessus résume : le checkpoint complet en BF16 demande environ 2 To de VRAM (territoire de datacenter), la quantification NVFP4 ramène cela à environ 600 Go sur du matériel Blackwell, et les versions GGUF 1 bit de la communauté réduisent cela d'environ 95 %, assez pour faire tourner une version fortement quantifiée sur une station de travail costaude.

Le support est arrivé rapidement aussi : intégration dès le jour zéro dans transformers 5.14, SGLang, vLLM et llama.cpp/Unsloth, plus des couches de brouillon pour le décodage spéculatif offrant une accélération sans perte. Voici un modèle en 1 bit tournant réellement dans le studio d'Unsloth, écrivant un jeu HTML complet et "réfléchissant" pendant 321 secondes avec une fenêtre d'un million de tokens :

Une version GGUF 1 bit d'Inkling tournant en local dans le studio d'Unsloth, écrivant un jeu de Sudoku HTML autonome après avoir réfléchi pendant 321 secondes, avec un compteur de contexte de 12,6 k / 1 048,6 k tokens, comme montré sur le blog de lancement Hugging Face
Une version GGUF 1 bit d'Inkling tournant en local dans le studio d'Unsloth, écrivant un jeu de Sudoku HTML autonome après avoir réfléchi pendant 321 secondes, avec un compteur de contexte de 12,6 k / 1 048,6 k tokens, comme montré sur le blog de lancement Hugging Face

Cette histoire de "faites-le tourner vous-même" est la vraie raison de s'intéresser à Inkling. Si vous hésitez entre un modèle ouvert et un modèle fermé, le compromis se joue entre contrôle et confort : vous possédez les poids, vos données ne quittent jamais votre infrastructure, et personne ne peut vous retirer le modèle sous les pieds, mais vous voilà désormais responsable des GPU.

L'angle entreprise

Pour les équipes qui veulent le contrôle sans surveiller un cluster de GPU, Inkling est apparu sur Databricks dès le jour zéro, accessible via l'Unity AI Gateway avec la gouvernance intégrée. L'argument entreprise avancé est le même que celui qui rend les poids ouverts attractifs : affiner sur vos propres données, rester dans votre périmètre de gouvernance, et éviter la tarification au token.

Panneau "Integrate external agents" de Databricks montrant Inkling accessible via l'Unity AI Gateway en une commande, fonctionnant avec des agents de codage comme Codex, Gemini, Copilot, OpenCode et Pi, comme montré sur le blog Databricks
Panneau "Integrate external agents" de Databricks montrant Inkling accessible via l'Unity AI Gateway en une commande, fonctionnant avec des agents de codage comme Codex, Gemini, Copilot, OpenCode et Pi, comme montré sur le blog Databricks

Devriez-vous choisir Inkling ?

Plutôt qu'une échappatoire du type "ça dépend de vos besoins", voici un chemin de décision direct basé sur ce en quoi Inkling est réellement bon et mauvais.

Inkling est-il le bon choix pour vous ?
Vous voulez auto-héberger un modèle ouvert et posséder les poids
Inkling est un très bon choix. Apache 2.0, téléchargeable, et il tourne en local jusqu'à une version en 1 bit. Prévoyez un budget pour les GPU.
Vous avez besoin d'audio natif ou d'une fenêtre de contexte d'1 M de tokens en poids ouverts
Peu de modèles ouverts égalent cela. Inkling est l'un des rares. Foncez.
Vous voulez juste l'API capable la moins chère
Cherchez ailleurs. À 1,87 $ en entrée / 4,68 $ en sortie, des pairs à poids ouverts moins chers (GLM, Qwen, DeepSeek) l'emportent sur le prix.
Vous voulez un agent d'IA opérationnel pour le support, pas un modèle brut
Un modèle seul ne répondra pas aux tickets en toute sécurité. Vous voulez une plateforme qui enveloppe un modèle dans vos connaissances, vos garde-fous et des tests. Continuez à lire.

Ce que la communauté en pense vraiment

Le fil de lancement sur Hacker News (1 214 points, ~292 commentaires) est l'instantané le plus clair de la façon dont les développeurs ont accueilli Inkling. L'ambiance était enthousiaste mais mesurée, et l'excitation portait moins sur les scores que sur qui l'a lancé :

Hacker News

"Sans oublier que c'est américain. C'est le premier modèle à poids ouverts compétitif non chinois depuis, quoi, Llama 3 ?"

Ce cadrage a suscité des objections (des gens ont cité Mistral, North de Cohere, Gemma et d'autres comme contre-exemples), mais le sentiment sous-jacent, qu'une option occidentale crédible à poids ouverts se faisait attendre, a traversé tout le fil. Il y avait aussi une bonne dose de "comment une entreprise qui donne son modèle survit-elle ?", la réponse retombant sur Tinker, l'activité de fine-tuning hébergée :

Hacker News

"L'histoire de la tech est jonchée des cadavres de services "open source mais on vend l'hébergement". Les modèles coûtent tellement cher à entraîner qu'on ne peut pas se permettre de perdre les gros clients une fois qu'ils deviennent vraiment rentables."

Reste la question ouverte de savoir si ce modèle économique tient la route. Mais pour l'instant, les développeurs ont eu droit à un modèle capable, multimodal et entièrement ouvert à explorer, et la plupart en étaient satisfaits.

Ce qu'un modèle comme Inkling signifie pour le support client

Voilà où j'ai passé ces dernières années, alors permettez-moi d'être direct. Je construis la couche d'agent qui se place au-dessus de modèles comme Inkling, et ce que j'ai appris en observant de vrais déploiements, c'est ceci : un meilleur modèle de base change rarement ce qui finit réellement par arriver dans une file de support.

Un modèle brut, aussi intelligent soit-il, ne connaît pas votre politique de remboursement, ne peut pas voir les 40 000 derniers tickets que votre équipe a déjà résolus, et n'a aucune idée du moment où il devrait se taire et passer la main à un humain. Pointez-le directement vers vos clients et il répondra avec assurance et de façon incorrecte, ce qui est pire que de ne pas répondre du tout. Ce mode d'échec, le bot confiant mais faux, est exactement la raison pour laquelle les hallucinations d'IA dans le support coûtent cher aux équipes, et pourquoi le modèle n'est jamais que le moteur.

La voiture, c'est la couche autour. C'est ce qu'est eesel : elle apprend de vos tickets résolus et de votre documentation d'aide (pas juste d'une page marketing), route selon le niveau de confiance pour que les réponses peu fiables soient mises en brouillon plutôt qu'envoyées, et, le point qui me tient le plus à cœur, elle vous permet de simuler l'agent sur vos propres tickets passés avant qu'un seul client ne le voie. Cette simulation, c'est le conseil "testez-le sur votre propre benchmark" de Hacker News, transformé en étape produit.

Schéma montrant un modèle à poids ouverts comme le moteur, une couche eesel qui apprend des tickets résolus, route selon le niveau de confiance et simule sur des tickets passés, et le coéquipier de support opérationnel qui en résulte
Schéma montrant un modèle à poids ouverts comme le moteur, une couche eesel qui apprend des tickets résolus, route selon le niveau de confiance et simule sur des tickets passés, et le coéquipier de support opérationnel qui en résulte

Cela signifie aussi que vous n'avez pas besoin de miser toute votre pile de support sur un seul modèle. Le meilleur modèle change toutes les quelques semaines (Inkling aujourd'hui, un autre le mois prochain), donc eesel reste indépendant du modèle et s'appuie sur le plus performant à chaque instant, tandis que ce qui compte vraiment pour vos clients, la connaissance, les garde-fous, le tri des tickets, reste stable.

Essayez eesel

Inkling est une sortie intéressante, mais une fiche modèle n'est pas un agent de support. Si votre véritable objectif est d'automatiser le support de niveau 1, ce qu'il vous faut, c'est la couche qui transforme n'importe quel modèle performant en coéquipier : eesel se branche sur votre helpdesk existant (Zendesk, Freshdesk, Gorgias, HubSpot, Front et plus de 100 autres), apprend de votre historique, et vous permet de simuler sur de vrais tickets passés avant de passer en production, pour que vous voyiez la couverture et la précision en amont, pas après qu'un client ait repéré une mauvaise réponse. Gridwise a utilisé exactement cette approche pour résoudre 73 % des demandes de niveau 1 dès son premier mois.

La tarification est basée sur l'usage, à environ 0,40 $ par ticket résolu, sans frais par siège, et vous pouvez commencer gratuitement. C'est la différence entre admirer un excellent moteur et vraiment aller quelque part.

Questions fréquentes

Qu'est-ce qu'Inkling ?
Inkling est le premier modèle d'IA à poids ouverts de Thinking Machines Lab, la startup de Mira Murati. C'est un modèle Mixture-of-Experts nativement multimodal (975 Md de paramètres au total / 41 Md actifs) qui prend du texte, de l'image et de l'audio en entrée et génère du texte, publié le 15 juillet 2026 sous licence Apache 2.0. Il est conçu pour être affiné (fine-tuné), pas utilisé comme un produit fini, et c'est exactement là qu'intervient une couche comme l'agent d'IA pour helpdesk d'eesel.
Inkling est-il gratuit et open source ?
Les poids sont téléchargeables gratuitement sous Apache 2.0, donc oui, vous pouvez auto-héberger Inkling et l'utiliser à des fins commerciales. Mais "modèle gratuit" ne veut pas dire "gratuit à faire tourner" : le matériel est la vraie facture, d'environ 2 To de VRAM pour les poids complets jusqu'à une station de travail pour la version quantifiée en 1 bit. Thinking Machines propose aussi une API propriétaire payante si vous ne voulez pas l'héberger vous-même.
Combien coûte l'utilisation d'Inkling ?
Sur l'API propre de Thinking Machines, Inkling coûte environ 1,87 $ pour 1 M de tokens en entrée et 4,68 $ pour 1 M de tokens en sortie, selon Artificial Analysis. C'est cher pour un modèle à poids ouverts de cette taille (la moyenne de la catégorie tourne plutôt autour de 0,43 $ en entrée / 1,25 $ en sortie), et c'est la plus grande bizarrerie du modèle. L'auto-hébergement échange ce coût par token contre un coût matériel.
Comment Inkling se compare-t-il à GLM, Kimi et DeepSeek ?
Inkling se situe dans le même groupe d'intelligence de haut niveau que des modèles comme DeepSeek V4 Flash, mais en dessous des leaders de pointe, et des testeurs de la communauté sur Hacker News notent qu'il se classe à peu près entre Kimi K2.6 et K2.7 sur les benchmarks. Ses traits distinctifs sont l'entrée audio native et une fenêtre de contexte d'1 M de tokens, plutôt qu'un score de benchmark au sommet.
Puis-je utiliser Inkling pour le support client ?
Oui, mais un modèle brut n'est pas un agent de support, aussi bons que soient ses benchmarks. Pour répondre à de vrais tickets, il faut une couche qui apprend de vos tickets résolus, qui route selon le niveau de confiance, et qu'on peut tester avant de la mettre en production. C'est exactement ce qu'apporte une plateforme de service client par IA comme eesel, et elle reste indépendante du modèle pour toujours utiliser le meilleur du moment.
Qui fabrique Inkling et qu'est-ce que Tinker ?
Inkling est fabriqué par Thinking Machines Lab, fondée par l'ex-CTO d'OpenAI Mira Murati. Le laboratoire distribue le modèle gratuitement et gagne de l'argent avec Tinker, sa plateforme de fine-tuning hébergée - le modèle "poids ouverts, on vend l'outillage" que Hacker News a longuement débattu pendant une bonne partie du fil de lancement.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Illustration d'Inkling, le modèle d'IA à poids ouverts de Thinking Machines Lab passé en revue
Trending

Avis sur Inkling : le modèle ouvert de Thinking Machines vaut-il le coup ?

Un avis honnête sur Inkling : ce dans quoi le premier modèle à poids ouverts de Thinking Machines Lab excelle vraiment, où le prix et les benchmarks déçoivent, et qui devrait vraiment l'utiliser.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustration éditoriale représentant une comparaison de modèles d'IA en tant qu'alternatives à Inkling
Trending

8 meilleures alternatives à Inkling en 2026

Inkling est ouvert et intéressant, mais il est cher pour un modèle à poids ouverts et ce n'est pas le modèle le plus intelligent que vous puissiez utiliser. Voici les 8 alternatives que j'essaierais vraiment, avec de vrais prix et les points forts de chacune.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Illustration éditoriale d'agents de codage en parallèle et de fenêtres de terminal, représentant le paysage des alternatives à ZCode
Trending

Les 8 meilleures alternatives à ZCode en 2026

ZCode est impressionnant et rugueux à la fois. Voici les 8 meilleures alternatives à ZCode en 2026, avec de vrais prix, des compromis honnêtes et pour qui chacune est faite.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Illustration éditoriale d'un classement de benchmarks avec une barre haute mise en évidence, représentant ZCode et le modèle GLM-5.2
Trending

ZCode : ce qu'est vraiment le nouvel agent de codage IA de Z.ai

Un test concret de ZCode, l'application de codage agentique gratuite de l'équipe GLM : le modèle GLM-5.2 qui la fait tourner, les vraies critiques de la semaine de lancement, et à qui elle s'adresse.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Illustration représentant le grand modèle de langage Kimi K3 de Moonshot AI
Trending

Kimi K3 expliqué : le modèle de pointe ouvert de Moonshot

Un guide clair sur Kimi K3, le modèle ouvert à 2,8 billions de paramètres de Moonshot AI : ce que c'est, ses performances, son coût, et si le changement en vaut la peine.

Alicia Kirana UtomoAlicia Kirana UtomoJul 17, 2026
Illustration éditoriale d'un grand modèle de langage raisonnant sur un long flux de documents
Trending

Avis sur Kimi K3 : le modèle frontière open source de Moonshot, testé

Un avis pratique sur Kimi K3 : l'architecture du modèle open source de 2,8 billions de paramètres, les benchmarks, les prix réels, et ce que pense vraiment la communauté durant sa semaine de lancement.

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026
Bannière de couverture qu'est-ce que PromptQL avec le logo PromptQL sur fond indigo
Trending

Qu'est-ce que PromptQL ? L'agent de données IA de Hasura, expliqué

Qu'est-ce que PromptQL ? Une explication claire de l'agent de données IA de Hasura : l'idée de planifier puis exécuter, ce à quoi il se connecte, son coût et à qui il s'adresse.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Bannière illustrée pour un guide sur les tarifs et les coûts d'API de Google Gemini 3.5 Pro
Trending

Tarifs de Gemini 3.5 Pro : ce qu'il coûte (et ce qui manque encore)

Une réponse honnête sur les tarifs de Gemini 3.5 Pro : ce n'est pas encore disponible. Voici ce que coûte le palier Pro actuel, les offres grand public et le vrai calcul de l'API.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
Illustration comparant les meilleures alternatives au grand modèle de langage Kimi K3
Trending

Les 8 meilleures alternatives à Kimi K3 en 2026

Kimi K3 est un vrai modèle de pointe, mais ce n'est ni le moins cher ni le plus disponible : ses poids arrivent en retard. Voici les 8 meilleures alternatives à Kimi K3, avec de vrais prix d'API.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement