Avis sur Inkling : le modèle ouvert de Thinking Machines vaut-il le coup ?

Kurnia Kharisma Agung Samiadjie
Écrit par

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Relu par

Katelin Teen

Dernière modification July 20, 2026

Vérifié par un expert
Illustration d'Inkling, le modèle d'IA à poids ouverts de Thinking Machines Lab passé en revue

Inkling vaut-il le coup pour vous ? (Vérification de 30 secondes)

Avant de plonger dans les détails, choisissez ce qui compte le plus pour vous et obtenez une réponse directe. C'est exactement la décision que je prendrais sur un vrai projet.

Ce qu'Inkling est vraiment

Un peu de contexte avant l'avis proprement dit. Inkling est le premier modèle public de Thinking Machines Lab, et le laboratoire est d'une franchise rafraîchissante en admettant qu'il ne court pas après le classement. L'argument de vente est une base ouverte large et équilibrée que vous affinez pour votre propre usage sur la plateforme Tinker du laboratoire. C'est un point de départ que vous façonnez, pas un chatbot auquel vous vous abonnez.

Les caractéristiques qui comptent, d'après la fiche du modèle :

  • Architecture : un transformer Mixture-of-Experts, 975 milliards de paramètres au total avec 41 milliards actifs par token (6 des 256 experts routés, plus 2 partagés). C'est ainsi qu'un modèle de près de mille milliards de paramètres peut servir à une vitesse raisonnable.
  • Entrées : texte, images et audio (WAV 16 kHz, idéalement moins de ~20 minutes). La sortie est uniquement du texte.
  • Fenêtre de contexte : jusqu'à 1 million de tokens.
  • Licence : Apache 2.0, donc l'usage commercial ne pose pas de problème, et les poids sont sur Hugging Face.
  • Sortie : le 15 juillet 2026.

L'audio est ce qui se démarque le plus. Comme l'a décrit le commentaire le plus voté du fil de lancement called it, c'est le "largest open weight model that supports audio" - ce qui compte au moment où vous voulez qu'un modèle écoute un appel de support plutôt que d'en lire la transcription.

Le chemin d'attention relative d'Inkling : l'état caché se projette sur Q, K, V et R, avec une convolution courte sur K/V dans le cache et un biais de position relative ajouté aux logits d'attention, comme schématisé par Thinking Machines dans le blog de lancement sur Hugging Face
Le chemin d'attention relative d'Inkling : l'état caché se projette sur Q, K, V et R, avec une convolution courte sur K/V dans le cache et un biais de position relative ajouté aux logits d'attention, comme schématisé par Thinking Machines dans le blog de lancement sur Hugging Face

Les benchmarks : intelligent, avec des arêtes vives

C'est ici que l'on sépare le discours du fournisseur de la lecture indépendante. Les propres tableaux de Thinking Machines montrent des chiffres flatteurs en effort maximal, mais le signal le plus net vient d'Artificial Analysis, qui évalue tout le monde de la même façon.

Leur verdict : Inkling obtient 41 sur l'AA Intelligence Index, 10e sur 97, bien au-dessus de la moyenne d'environ 25 pour les modèles ouverts de cette taille. C'est donc un modèle intelligent. Mais il se situe en dessous des leaders de pointe et se retrouve dans un groupe avec des modèles comme DeepSeek V4 Flash. Des outils de suivi communautaires plus larges le placent plutôt vers la 41e place, d'où est né le débat sur le fait de savoir si le qualifier de "compétitif" est juste.

Évaluation (Artificial Analysis)InklingCe que ça teste
GPQA Diamond87%Raisonnement scientifique
AA-LCR63%Raisonnement sur contexte long
Terminal-Bench v2.155%Codage agentique + usage du terminal
SciCode46%Programmation
AA-Omniscience (accuracy)40%Connaissances
GDPval-AA v237%Tâches de travail réelles
Humanity's Last Exam30%Raisonnement + connaissances
CritPt5%Raisonnement physique

Lu honnêtement, cela donne à Inkling une vraie personnalité : fort en raisonnement scientifique et sur contexte long, nettement faible en physique et en fiabilité brute des connaissances (son indice de fiabilité AA-Omniscience est d'un maigre 2 sur une échelle de −100 à 100). Des arêtes vives, pas un modèle lisse et polyvalent.

Il y a aussi, sous les scores, une affirmation d'efficacité vraiment utile. Inkling expose un curseur réglable d'effort de réflexion (de none à max dans l'intégration Hugging Face), et le laboratoire affirme atteindre le même score Terminal-Bench que Nemotron 3 Ultra en dépensant environ un tiers des tokens. Pour qui paie au token ou loue un GPU, "même réponse, moins de tokens" vaut mieux qu'un gain fractionnaire de benchmark.

Le fil de lancement a capté le même tableau mitigé que moi :

Hacker News

"I just looked at the benchmarks and was kinda disappointed that it seems to be between KimiK2.6 and KimiK2.7 on most of the benchmarks."

Le prix : le seul vrai reproche

C'est la partie qui m'a le plus surpris dans cet avis. Inkling est à poids ouverts, et pourtant, sur l'API propre de Thinking Machines, il a le prix d'un modèle propriétaire de pointe. Selon Artificial Analysis, il se classe 81e sur 97 en prix, parmi les plus chers de sa catégorie.

Voie d'accèsCe que vous payezRemarques
API Thinking Machines — entrée1,87 $ / 1M tokensMoyenne de la catégorie ~0,43 $ ; cher
API Thinking Machines — sortie4,68 $ / 1M tokensMoyenne de la catégorie ~1,25 $
Tarif mixte~1,10 $ / 1M tokensPour un mix de 7:2:1 cache:entrée:sortie
Lecture/écriture de cache0,374 $ / 1M tokensUn hit de cache est à −80 % par rapport à l'entrée
Auto-héberger les poids0 $ pour le modèleApache 2.0 ; vous payez le matériel
Fine-tuning TinkerService payantLe vrai modèle économique du laboratoire

Deux choses ressortent. D'abord, il n'existe actuellement qu'un seul fournisseur d'API, Thinking Machines lui-même, donc aucun hébergeur tiers moins cher ne le sous-cote encore. Ensuite, "poids ouverts" ne le rend gratuit que si vous êtes prêt à le faire tourner, ce qui est une vraie décision, pas un détail. Le verdict sur le prix est donc simple : louer Inkling est difficile à justifier ; le posséder peut être une bonne affaire.

Une version GGUF 1 bit d'Inkling tournant localement dans le studio d'Unsloth, écrivant un jeu de Sudoku en HTML autonome après avoir réfléchi pendant 321 secondes, avec un compteur de contexte de 12,6k / 1 048,6k tokens, tel que montré sur le blog de lancement Hugging Face
Une version GGUF 1 bit d'Inkling tournant localement dans le studio d'Unsloth, écrivant un jeu de Sudoku en HTML autonome après avoir réfléchi pendant 321 secondes, avec un compteur de contexte de 12,6k / 1 048,6k tokens, tel que montré sur le blog de lancement Hugging Face

Le faire tourner soi-même : le vrai argument de vente

Comme les poids sont ouverts, la communauté a fait tourner Inkling en local dès le premier jour. Le blog de lancement Hugging Face présente trois niveaux : le checkpoint complet en BF16 demande environ 2 To de VRAM (territoire de centre de données), la quantification NVFP4 ramène ça à environ 600 Go sur du matériel Blackwell, et les versions GGUF 1 bit de la communauté réduisent ça d'environ 95 %, suffisant pour un poste de travail costaud.

Le support des outils est aussi arrivé vite : intégration dès le jour zéro dans transformers 5.14, SGLang, vLLM et llama.cpp/Unsloth, plus des couches de brouillon pour le décodage spéculatif afin d'accélérer sans perte. Cette histoire de "le faire tourner soi-même" est la vraie raison de s'y intéresser. Le compromis est le contrôle contre la commodité : vous possédez les poids, vos données ne quittent jamais votre infrastructure, et personne ne peut vous retirer le modèle sous les pieds, mais vous voilà maintenant responsable des GPU.

Pour les équipes qui veulent ce contrôle sans avoir à materner un cluster, Inkling est apparu sur Databricks dès le jour zéro, accessible via l'Unity AI Gateway avec une gouvernance intégrée et sans tarification au token.

Avantages et inconvénients

Voici le bilan de cet avis, sans détour.

Ce qu'Inkling réussit

  • Vraiment ouvert — poids sous Apache 2.0, usage commercial, auto-hébergeable jusqu'à une version 1 bit.
  • Entrée audio native — le plus grand modèle à poids ouverts qui écoute, pas seulement qui lit.
  • Contexte d'1 million de tokens — à égalité avec le haut du panier en longueur.
  • Raisonnement efficace en tokens — le curseur d'effort apporte de vraies économies, pas juste un argument marketing.
  • Raisonnement scientifique + contexte long solide — 87% en GPQA Diamond, 63% en AA-LCR.

Où ça pêche

  • Cher à louer — 81e sur 97 en prix d'API, une drôle de place pour des poids ouverts.
  • Pas un gagnant du classement — se situe en dessous des leaders de pointe, milieu du peloton parmi les modèles ouverts.
  • Fiabilité des connaissances faible — indice AA-Omniscience de 2, plus un maigre 5% en raisonnement physique.
  • Un seul hébergeur d'API — pas encore de concurrence tierce sur le prix.
  • Matériel conséquent pour l'auto-hébergement — modèle "gratuit", ~2 To de VRAM pour la version complète.

Ce que la communauté pense vraiment

Le fil de lancement sur Hacker News (1 214 points, ~292 commentaires) donne la lecture la plus claire de l'accueil. L'ambiance était enthousiaste mais mesurée, et l'excitation portait moins sur les scores que sur qui l'avait lancé :

Hacker News

"Not to mention - it is American. This is the first competitive non-Chinese open weights model since what, Llama 3?"

Ce cadrage a suscité des contestations (des gens ont cité Mistral, North de Cohere, Gemma), mais le sentiment de fond selon lequel "une option occidentale crédible à poids ouverts se faisait attendre" a parcouru tout le fil. Il y a aussi eu un sain "comment une entreprise qui donne son modèle survit-elle ?", dont la réponse a atterri sur Tinker, l'activité hébergée de fine-tuning. Mais la phrase la plus utile pour quiconque fait son propre avis fut le rappel qu'aucun benchmark public n'est le vrai test :

Hacker News

"want to know how good a model is? Run it with your own non-public benchmark, basically the only way to get proper answers you can somewhat rely on, everything else is manipulated, misunderstood or over-relied on."

Accrochez-vous à cet instinct, car c'est exactement celui qui compte au moment où vous pointez un modèle vers votre file de support.

Ce qu'un modèle de la classe d'Inkling signifie pour le support

C'est là où j'ai passé ces dernières années, donc soyons directs. Je construis la couche d'agent qui se place au-dessus de modèles comme Inkling, et ce que j'ai appris en observant de vrais déploiements, c'est ceci : un meilleur modèle de base change rarement ce qui finit vraiment dans une file de support.

Un modèle brut, aussi intelligent soit-il, ne connaît pas votre politique de remboursement, ne peut pas voir les 40 000 derniers tickets que votre équipe a déjà résolus, et n'a aucune idée du moment où il devrait se taire et passer la main à un humain. Pointez-le directement vers les clients et il répondra avec assurance et à tort, ce qui est pire que de ne pas répondre. Ce mode de défaillance est exactement la raison pour laquelle les hallucinations de l'IA dans le support plombent les équipes, et c'est pourquoi le modèle n'est jamais que le moteur.

La voiture, c'est la couche autour. C'est ce qu'est eesel : il apprend de vos tickets résolus et de vos docs d'aide (pas seulement d'une page marketing), route selon le niveau de confiance pour que les réponses peu sûres soient mises en brouillon plutôt qu'envoyées, et, la partie qui me tient le plus à cœur, il vous permet de simuler l'agent sur vos propres tickets passés avant qu'un seul client ne le voie. Cette simulation, c'est le conseil "testez-le sur votre propre benchmark" de Hacker News, transformé en étape du produit.

Schéma montrant un modèle à poids ouverts comme moteur, une couche eesel qui apprend des tickets résolus, route selon le niveau de confiance et simule sur les tickets passés, et le coéquipier de support fonctionnel qui en résulte
Schéma montrant un modèle à poids ouverts comme moteur, une couche eesel qui apprend des tickets résolus, route selon le niveau de confiance et simule sur les tickets passés, et le coéquipier de support fonctionnel qui en résulte

Cela signifie aussi que vous ne pariez pas toute votre pile de support sur un seul modèle. Le meilleur modèle change toutes les quelques semaines (Inkling aujourd'hui, autre chose le mois prochain), donc eesel reste agnostique au modèle et adopte celui qui est le plus fort à chaque instant, tandis que la partie qui compte pour les clients - les connaissances, les garde-fous, le tri des tickets - reste stable.

Verdict

Inkling est un modèle à poids ouverts vraiment bon, avec une bizarrerie de prix qu'il faut anticiper. Si vous voulez posséder les poids, avez besoin d'audio ou de contexte long, et pouvez faire tourner le matériel, c'est l'une des sorties ouvertes les plus intéressantes de 2026 et cela vaut vraiment le coup de le télécharger. Si vous voulez juste l'API capable la moins chère, ou le meilleur score de benchmark, ce n'est pas le bon choix, et vous ne devriez pas le forcer.

Et si votre vrai objectif est de répondre à des tickets de support, souvenez-vous de ce à quoi cet avis revient sans cesse : une fiche de modèle n'est pas un agent de support. Le moteur ne fait que la moitié du travail.

Essayez eesel

Inkling est une sortie sympathique, mais une fiche de modèle n'est pas un agent de support. Si votre vrai objectif est d'automatiser le support de niveau 1, ce qu'il vous faut, c'est la couche qui transforme n'importe quel modèle puissant (ouvert ou fermé) en coéquipier : eesel se branche sur votre helpdesk existant (Zendesk, Freshdesk, Gorgias, HubSpot, Front et plus de 100 autres), apprend de votre historique, et vous permet de simuler sur de vrais tickets passés avant votre mise en production, pour que vous voyiez d'abord la couverture et la précision, pas après qu'un client ait repéré une mauvaise réponse. Gridwise a utilisé exactement cette approche pour résoudre 73% des demandes de niveau 1 dès leur premier mois.

La tarification est basée sur l'usage, à environ 0,40 $ par ticket résolu, sans frais par poste, et vous pouvez démarrer gratuitement. C'est la différence entre admirer un excellent moteur et vraiment aller quelque part avec.

Questions fréquentes

Inkling vaut-il le coup ?
Cela dépend de pourquoi vous le voulez. En tant que modèle ouvert que vous pouvez télécharger, auto-héberger et affiner, Inkling est un excellent choix, surtout si vous avez besoin d'une entrée audio native ou d'un contexte d'1 million de tokens. En tant qu'API capable la moins chère, cela ne vaut pas le coup - à environ 1,87 $ en entrée / 4,68 $ en sortie, son prix est celui d'un modèle propriétaire de pointe, donc des modèles ouverts concurrents moins chers gagnent sur le coût. Mon résumé de cet avis sur Inkling : excellent à posséder, cher à louer.
Inkling est-il vraiment bon comparé à Kimi et GLM ?
Il est vraiment intelligent - Artificial Analysis lui attribue 41 points sur son Intelligence Index, 10e sur 97 - mais il ne domine pas le peloton des modèles ouverts. Des testeurs de la communauté sur Hacker News ont constaté qu'il se situe, en benchmarks, à peu près entre Kimi K2.6 et K2.7. Ses vrais atouts sont l'audio natif et le contexte long, pas une victoire au classement.
Combien coûte Inkling ?
Sur l'API propre de Thinking Machines, Inkling coûte environ 1,87 $ par million de tokens en entrée et 4,68 $ par million de tokens en sortie, selon Artificial Analysis, qui le classe 81e sur 97 en prix - cher pour un modèle ouvert de cette taille. Les poids eux-mêmes sont gratuits sous licence Apache 2.0, donc l'auto-hébergement échange la facture au token contre une facture de matériel.
Inkling est-il gratuit et open source ?
Les poids peuvent être téléchargés gratuitement sous licence Apache 2.0, vous pouvez donc auto-héberger Inkling et l'utiliser commercialement. Mais "gratuit" ne veut pas dire "gratuit à faire tourner" : la version complète en BF16 demande environ 2 To de VRAM, et ne descend au niveau d'un poste de travail qu'avec un GGUF 1 bit fortement quantifié. Il existe aussi une API propriétaire payante si vous ne voulez pas gérer le matériel.
Puis-je utiliser Inkling pour le support client ?
Vous pouvez le brancher, mais un modèle brut n'est pas un agent de support, aussi bons que paraissent les chiffres de cet avis sur Inkling. Pour répondre aux vrais tickets en toute sécurité, il vous faut une couche qui apprend de vos tickets résolus, qui route selon le niveau de confiance, et qui peut être simulée avant sa mise en production. C'est ce qu'ajoute une plateforme de service client IA comme eesel, qui reste agnostique au modèle pour pouvoir utiliser le meilleur du moment.
Qui fabrique Inkling et qu'est-ce que Tinker ?
Inkling est le premier modèle à poids ouverts de Thinking Machines Lab, fondé par l'ex-CTO d'OpenAI Mira Murati. Le laboratoire distribue gratuitement le modèle et gagne de l'argent avec Tinker, sa plateforme hébergée de fine-tuning - le modèle "poids ouverts, on vend les outils" débattu sur Hacker News pendant toute la journée du lancement.
Quels sont les scores d'Inkling aux benchmarks ?
Selon Artificial Analysis : AA Intelligence Index 41 (10e sur 97), GPQA Diamond 87 %, contexte long AA-LCR 63 %, Terminal-Bench 55 %, SciCode 46 %, et Humanity's Last Exam 30 %. Il est faible en raisonnement physique (CritPt 5 %) et en fiabilité des connaissances (indice AA-Omniscience de 2 sur une échelle de -100 à 100). Des arêtes vives, pas un modèle lisse et polyvalent.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Illustration d'Inkling, le modèle d'IA à poids ouverts de Thinking Machines Lab
Trending

Inkling expliqué : le modèle d'IA à poids ouverts de Thinking Machines

Ce qu'est vraiment Inkling : le premier modèle à poids ouverts de Thinking Machines Lab, ses vrais benchmarks, ce qu'il coûte à faire tourner, et s'il a sa place près d'une file de support.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Illustration éditoriale représentant une comparaison de modèles d'IA en tant qu'alternatives à Inkling
Trending

8 meilleures alternatives à Inkling en 2026

Inkling est ouvert et intéressant, mais il est cher pour un modèle à poids ouverts et ce n'est pas le modèle le plus intelligent que vous puissiez utiliser. Voici les 8 alternatives que j'essaierais vraiment, avec de vrais prix et les points forts de chacune.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Illustration éditoriale d'agents de codage en parallèle et de fenêtres de terminal, représentant le paysage des alternatives à ZCode
Trending

Les 8 meilleures alternatives à ZCode en 2026

ZCode est impressionnant et rugueux à la fois. Voici les 8 meilleures alternatives à ZCode en 2026, avec de vrais prix, des compromis honnêtes et pour qui chacune est faite.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Illustration éditoriale d'un classement de benchmarks avec une barre haute mise en évidence, représentant ZCode et le modèle GLM-5.2
Trending

ZCode : ce qu'est vraiment le nouvel agent de codage IA de Z.ai

Un test concret de ZCode, l'application de codage agentique gratuite de l'équipe GLM : le modèle GLM-5.2 qui la fait tourner, les vraies critiques de la semaine de lancement, et à qui elle s'adresse.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Illustration éditoriale d'un grand modèle de langage raisonnant sur un long flux de documents
Trending

Avis sur Kimi K3 : le modèle frontière open source de Moonshot, testé

Un avis pratique sur Kimi K3 : l'architecture du modèle open source de 2,8 billions de paramètres, les benchmarks, les prix réels, et ce que pense vraiment la communauté durant sa semaine de lancement.

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026
Illustration représentant le grand modèle de langage Kimi K3 de Moonshot AI
Trending

Kimi K3 expliqué : le modèle de pointe ouvert de Moonshot

Un guide clair sur Kimi K3, le modèle ouvert à 2,8 billions de paramètres de Moonshot AI : ce que c'est, ses performances, son coût, et si le changement en vaut la peine.

Alicia Kirana UtomoAlicia Kirana UtomoJul 17, 2026
Bannière de l'avis sur PromptQL avec le logo PromptQL sur fond indigo
Trending

Avis sur PromptQL (2026) : l'agent de données de Hasura, testé

Un avis pratique sur PromptQL : comment l'agent de données de Hasura sépare planification et exécution, ce qu'il coûte, et si la promesse de fiabilité tient la route.

Alicia Kirana UtomoAlicia Kirana UtomoJul 10, 2026
Illustration comparant les meilleures alternatives au grand modèle de langage Kimi K3
Trending

Les 8 meilleures alternatives à Kimi K3 en 2026

Kimi K3 est un vrai modèle de pointe, mais ce n'est ni le moins cher ni le plus disponible : ses poids arrivent en retard. Voici les 8 meilleures alternatives à Kimi K3, avec de vrais prix d'API.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026
Bannière de couverture des alternatives à PromptQL sur un fond indigo
Trending

Les 8 meilleures alternatives à PromptQL en 2026

Les 8 meilleures alternatives à PromptQL en 2026, de Databricks Genie au projet open source Wren AI, avec de vrais tarifs, les forces de chacun, et pour qui ils conviennent réellement.

Rama Adi NugrahaRama Adi NugrahaJul 10, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement