
Inkling-Small en 30 secondes
| Sortie | 30 juillet 2026, quinze jours après Inkling |
| Fabricant | Thinking Machines Lab (Mira Murati) |
| Taille | 276B au total, 12B actifs, 42 couches |
| Licence | Apache 2.0, poids sur Hugging Face |
| Contexte | 1M de tokens sur la fiche, 524K via OpenRouter |
| Entrées | Texte, image, audio (WAV 16 kHz) |
| Prix API | $0,30 à $0,50 en entrée, $1,20 en sortie par 1M |
| Plancher auto-hébergement | 89 Go en quantification 2 bits |
| Point fort | Code, usage d'outils, boucles d'agents, contexte long |
| Point faible | Rappel factuel sans retrieval |
Ce qu'est réellement Inkling-Small
C'est dans l'architecture que se niche la partie intéressante, et elle explique les deux faces des résultats.
Inkling-Small est un transformeur decoder-only à 42 couches, avec une pile feed-forward de type mixture-of-experts éparse. Chaque token est routé vers 6 des 256 experts, plus 2 experts partagés qui s'activent sur chaque token sans exception. Le total de paramètres atteint 276B ; seuls 12B d'entre eux sont actifs par token. La fiche du modèle confirme des couches d'attention hybrides locales et globales, une numérique BF16 et NVFP4, ainsi qu'un entraînement sur des systèmes NVIDIA GB300 NVL72.
Comparez avec le parent. Inkling totalise 975B et 41B actifs sur 66 couches, donc la forme du routage est la même, mais avec environ un quart de la masse totale et moins d'un tiers de la masse active. Thinking Machines décrit le résultat comme « des performances comparables à Inkling avec un quart de sa taille ».
Ce ratio résume toute l'histoire ici. Un grand rapport total-sur-actif rend un modèle bon marché à servir, et un faible total de paramètres le rend oublieux. Inkling-Small a fortement misé sur le premier point et en a payé le prix sur le second. Pour la version générale de ce mécanisme, modèles d'IA sur mesure parcourt le même compromis sans tous les tableaux de benchmarks.
Il prend du texte, puis des images (entre 40 et 4096 pixels fonctionne le mieux), et de l'audio en WAV à 16 kHz, idéalement de moins de deux minutes. La sortie est uniquement du texte. L'effort de raisonnement est un curseur de 0 à 0,99, où bas correspond à 0,2, moyen se situe à 0,7 et maximum à 0,99, permettant d'échanger des tokens de réflexion contre de la latence à chaque appel.
L'entrée audio native est l'élément le plus rare de cette liste, ce qui explique pourquoi ce modèle revient sans cesse dans les conversations sur la voix. La limite mérite d'être signalée : l'audio entre, le texte sort, il n'y a donc aucune synthèse vocale ici. Les fournisseurs qui bouclent effectivement ce cercle sont couverts dans entreprises de voix IA.
Pour quelle tâche Inkling-Small est-il adapté ?
La réponse change beaucoup selon la charge de travail, et pour chacune d'elles, le propre tableau du fabricant fournit les preuves. Choisissez la tâche que vous avez réellement :
Les benchmarks : il surpasse vraiment son parent
Un modèle distillé ou réduit se retrouve normalement un peu derrière le modèle phare dont il est issu. Ce n'est pas le cas d'Inkling-Small, du moins pas sur les catégories pour lesquelles la plupart des gens achètent un modèle.

En code, il remporte SWEBench Verified avec 80,2% contre 77,6%, puis SWEBench Pro avec 55,9% contre 54,3%, avec Terminal Bench 2.1 à 64,7% contre 63,8%. Côté agentique, il remporte Toolathlon Verified avec 54,4% contre 45,5% et MCP Atlas avec 79,6% contre 76,0%, plus un Elo GDPval-AA v2 de 1269 contre 1238. En raisonnement général, il remporte GPQA Diamond avec 89,5% contre 87,2%, et Humanity's Last Exam avec 31,6% contre 29,7% en version texte seul.
Il publie aussi des chiffres que la fiche du parent ne rapporte même pas. SciCode 48,7%, CritPt 8,3%, puis ARC-AGI-1 à 84,0% et ARC-AGI-2 à 40,1%. Sur le respect des instructions, IFBench atteint 82,2% contre 79,8%, et cela compte plus qu'il n'y paraît pour tout ce qui doit obéir de façon fiable à un prompt système. Si c'est l'axe qui vous intéresse, agent IA contre chatbot basé sur des règles explique pourquoi, en production, l'obéissance l'emporte sur l'intelligence brute.
Les pertes côté raisonnement sont réelles, mais étroites. AIME 2026 chute à 95,5% contre 97,1%. Tau 3 Banking chute à 15,5% contre 23,7%, la régression la plus marquée de tout le bloc agentique, et à noter si votre charge de travail ressemble à des flux financiers structurés.
Un autre résultat mérite un signalement, car il est facile à manquer. Global-MMLU-Lite, le test multilingue, glisse de 88,7% à 86,7%. Une baisse de deux points, donc rien de dramatique, mais elle pointe dans la même direction que les chiffres de factualité : la coupe a porté sur l'étendue des connaissances. Si vous servez plusieurs langues, testez chacune d'elles plutôt que de faire confiance à l'agrégat, et agents de support multilingues montre à quoi ressemble ce test en pratique.
De façon indépendante, Artificial Analysis lui attribue 40 sur son Intelligence Index, au rang #15 sur 101, contre 41 et le rang #13 pour l'Inkling complet. Un seul point d'index d'écart, pour un quart de la taille. Que le score du fabricant et celui d'un tiers indépendant arrivent à la même conclusion est inhabituel, et c'est l'élément le plus solide de tout ce test.
Le seul chiffre qui devrait vous arrêter
Voici la partie qui n'a pas figuré dans le billet de lancement.
SimpleQA Verified, qui teste si un modèle connaît des réponses factuelles courtes, s'établit à 20,6% pour Inkling-Small contre 43,9% pour Inkling. Moins de la moitié. Et AA Omniscience, qui compense les bonnes réponses par les réponses fausses mais assurées, affiche -9,0 là où le parent obtient +2,1.
Un score Omniscience négatif signifie que le modèle affirme plus de choses fausses avec assurance que de choses correctes. Ce n'est pas un modèle qui dit « je ne suis pas sûr ». C'est un modèle qui comble le vide. Thinking Machines le liste lui-même parmi les limitations connues, citant « l'hallucination (générer du contenu plausible mais factuellement incorrect ou non étayé) » et « une performance dégradée dans les conversations longues à plusieurs tours », et déconseille tout déploiement médical, juridique ou critique pour la sécurité sans fine-tuning supplémentaire. Il faut lui reconnaître ce mérite : c'est une section de limitations plus franche que celle que la plupart des laboratoires prennent la peine de publier.
Pour un agent de code, cela compte à peine, puisque le compilateur fait office de vérificateur de faits. Pour tout ce qui est en contact avec le client, ça compte énormément, et j'ai vu ce mode de défaillance en production. Une équipe de support avec laquelle j'ai travaillé avait une base de connaissances affirmant qu'elle prenait en charge tous les modèles de véhicules, si bien que son bot confirmait allègrement la couverture pour des marques de voitures qui n'étaient même pas dans sa base de données. Rien d'hallucinatoire au sens spectaculaire du terme. Le modèle a simplement comblé un vide avec quelque chose de plausible. Cette équipe décrivait sa configuration initiale comme « des essais et erreurs au début ».
Un modèle à -9,0 sur Omniscience, c'est ce même mode de défaillance avec le volume monté. Les mesures d'atténuation sont connues et peu spectaculaires : du retrieval sur des sources que vous contrôlez, des citations qu'une personne peut vérifier, et un chemin de refus. Hallucinations de l'IA en support couvre l'ensemble complet, et la version pratique plus courte est prévention des hallucinations de l'IA.
Prix et vitesse : la vraie raison de s'y intéresser
C'est ici que le petit modèle gagne sa place dans le monde.
| Inkling-Small | Inkling | |
|---|---|---|
| Entrée par 1M | $0,30 à $0,50 | $1,00 |
| Sortie par 1M | $1,20 | $4,05 |
| Mixte (AA) | $0,22 | $0,72 |
| Vitesse de sortie | 131,1 tok/s | 84,8 tok/s |
| Temps jusqu'au premier token | 1,65 s | 1,82 s |
| Fournisseurs | 2 | 4 |
| AA Intelligence Index | 40 | 41 |
Les tokens de sortie coûtent 3,4 fois moins et arrivent 1,5 fois plus vite, pour un point d'intelligence en moins. Pour les boucles d'agents, où les tokens de sortie dominent la facture et où la latence s'accumule sur des dizaines de tours, ce n'est pas une différence marginale. Cela se reflète aussi dans les chiffres qu'une équipe de support suit réellement, car des premiers tokens plus rapides font bouger la résolution au premier contact ainsi que le reste des métriques du service client qui en découlent.
Deux mises en garde avant de bâtir un budget dessus. Le prix d'entrée n'est pas encore fixé : Artificial Analysis indique 0,30 dollar par 1M, tandis que la fiche OpenRouter affiche 0,45 dollar et que son API renvoie 0,50 dollar, donc vérifiez votre propre route. Par ailleurs, il n'y a que deux fournisseurs pour l'instant, contre quatre pour le parent, ce qui est mince si vous avez besoin de basculement.
La seconde mise en garde est la plus surprenante. La fiche du modèle annonce 1M de contexte. OpenRouter le sert actuellement à 524 288 tokens, exactement la moitié. Les poids supportent la fenêtre complète, l'API routée ne l'expose simplement pas encore. Si le million de tokens était la raison de choisir ce modèle, auto-hébergez ou vérifiez d'abord auprès de votre fournisseur. Taille de la fenêtre de contexte explique pourquoi le chiffre annoncé et le chiffre réellement utilisable divergent si souvent.
L'activité réelle de Thinking Machines est Tinker, sa plateforme hébergée de fine-tuning LoRA, et Inkling-Small y est pris en charge. Le stockage des checkpoints coûte 0,10 dollar par Go et par mois ; les tarifs d'entraînement par token ne sont pas publiés sur la page de présentation.
Faire tourner Inkling-Small soi-même
L'auto-hébergement est l'amélioration la plus nette par rapport au modèle parent, et ici les chiffres ne sont pas serrés.

Les chiffres d'Unsloth situent Inkling-Small à 543 Go en BF16, puis entre 132 et 170 Go en 4 bits, 128 Go en 3 bits, et 89 Go en 2 bits. L'Inkling complet nécessite 1 900 Go en BF16 et demande encore entre 270 et 285 Go même en quantification 1 bit. La fiche du modèle présente la même chose en termes de matériel : 600 Go de VRAM agrégée pour du BF16 (4x B300 ou 8x H200), qui descend à 180 Go pour le checkpoint NVFP4, soit un B300 ou une paire de H200.
Le chiffre de 89 Go est celui qui change qui peut faire tourner ceci. Cela tient dans une machine à 128 Go de mémoire unifiée, ce qui relève de l'achat d'une station de travail et non d'un centre de données. Et comme seuls 12B de paramètres sont actifs par token, une build fortement quantifiée reste utilisable au lieu de ramper.
Les réglages d'échantillonnage recommandés sont une température de 1,0, top_p à 1,0 et min_p à 0,0, sur un contexte de 1 048 576 tokens. La prise en charge dès le premier jour couvre transformers, vLLM, SGLang, TokenSpeed, Unsloth et Docker Model Runner, avec des builds quantifiées via llama.cpp, Ollama, LM Studio et Jan. Un point à surveiller : llama.cpp a besoin que la PR #25731 soit fusionnée. Les options d'auto-hébergement plus larges se trouvent dans meilleurs agents d'IA open source.
Avantages et inconvénients
Ce qui est bon
- Bat un modèle 3,5 fois plus grand en code et en usage d'outils, plus en respect des instructions
- 1,20 dollar par million de tokens de sortie, soit 3,4 fois moins cher que le parent
- 131 tokens par seconde, une vitesse nettement supérieure
- Apache 2.0, donc l'auto-hébergement commercial n'est pas restreint
- Fonctionne à 89 Go quantifié, dans la gamme des stations de travail
- Entrée audio et image native, encore rare à ce prix
- Une section de limitations franche de la part du fabricant lui-même
Ce qui ne l'est pas
- SimpleQA Verified à 20,6%, moins de la moitié du parent
- AA Omniscience à -9,0, donc plus de réponses fausses assurées que correctes
- Contexte de 1M sur le papier, mais 524K via OpenRouter aujourd'hui
- Seulement deux fournisseurs d'API, ce qui rend le basculement mince
- Tau 3 Banking chute à 15,5% contre 23,7%
- Les scores audio sont légèrement en retrait par rapport au parent sur les trois tests
- Sortie texte uniquement, donc pas de génération d'image ou d'audio
Ce que dit la communauté
La réaction a été bien plus discrète que le lancement du modèle phare, qui avait attiré plus de 1 200 points sur Hacker News. Le propre fil d'Inkling-Small en a récolté 33. Le situer par rapport au reste du paysage a été le premier réflexe :
"better than haiku 4.5 smaller than nemotron 3 ultra"
L'autre commentaire le comparait au rival évident en poids ouverts, notant qu'il est "About the same size as DeepSeek Flash 4, but also supports audio and image input." Un cadrage juste. DeepSeek V4 Flash est moins cher par token et uniquement textuel, donc la prise en charge audio et image est ici le véritable élément de différenciation, et le détail de la comparaison directe se trouve dans le test de Flash.
Le commentaire le plus incisif est arrivé avant même que les quantifications ne sortent, sur la publication Hugging Face :
"I didn't see a gguf yet, going to be most interesting if there's a quant that fits nicely into about 90 [GB] so it can run in 128GB unified memory. It's 12B active so should hopefully be pretty fast at 2 bit quant if it fits"
La build 2 bits d'Unsloth a atterri à 89 Go. La communauté de l'inférence locale avait deviné le chiffre cible avant même que la sortie n'existe, et elle a visé juste. Sur son premier mois, le dépôt Hugging Face a compté 15 500 téléchargements.
Une chose que j'ai remarquée : personne dans ces fils n'a mentionné la régression de factualité. Le cadrage du lancement portait sur la vitesse et la taille, c'est donc de cela qu'on a discuté.
Ce que cela signifie si vous voulez qu'il réponde à des tickets
Ici je vais être direct, parce que cette partie, c'est littéralement mon métier.
Un modèle bon marché et rapide ressemble à une victoire évidente pour le support. Le volume de tickets est élevé, les réponses sont courtes, et 1,20 dollar par million de tokens de sortie contre 4,05 représente de l'argent bien réel à grande échelle. C'est l'arithmétique derrière coût du service client IA, et c'est le même calcul qui alimente la comparaison avec un agent humain. Les équipes qui le suivent comme un coût unitaire finissent généralement par regarder le coût par résolution.
Mais le support est la seule charge de travail où -9,0 sur Omniscience devient le chiffre disqualifiant plutôt qu'une note de bas de page. Un agent de code qui invente une API se voit renvoyer une stack trace. Un agent de support qui invente un délai de retour l'envoie plutôt à un client, par écrit, avec votre logo dessus. Les acheteurs à qui je parle le savent déjà, et c'est l'objection qui revient en premier. Une responsable CX d'une marque de compléments alimentaires en DTC l'a formulé à peu près aussi clairement que possible :
"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
a DTC supplements CX lead, from an eesel sales call
C'est une demande pour une couche, pas pour un modèle. Quatre éléments doivent se trouver entre n'importe quel modèle et votre file d'attente.
- Du retrieval sur des sources que vous possédez, afin que les réponses viennent de votre centre d'aide et des tickets passés plutôt que des poids. Chatbot de base de connaissances IA couvre le principe ; côté outillage, il y a meilleurs outils de base de connaissances IA.
- Le routage par niveau de confiance, afin que le modèle réponde à ce dont il est sûr et escalade le reste. Le côté routage est gestion de l'escalade IA ; le transfert propre vers un humain est transfert d'agent.
- Un essai à blanc avant la mise en production, simulé sur vos propres tickets historiques plutôt que sur la suite de benchmarks de quelqu'un d'autre. C'est l'étape que les équipes ont tendance à sauter, et c'est aussi celle qui attrape les réponses fausses mais assurées.
- Une autonomie encadrée, en commençant comme copilote qui rédige des brouillons avant de répondre seul. Copilote IA est la rampe d'accès ; la déviation de niveau 1 est là où l'on arrive, mesurée par le taux de déviation.
Faites ces quatre choses et l'écart de factualité d'Inkling-Small cesse d'être un passif, parce que les faits ne sortent plus du modèle. Sautez-les, et ce que vous avez acheté, c'est une source rapide, bon marché et assurée de réponses plausibles. C'est la différence entre un agent IA de helpdesk et une simple clé API brute, et c'est la même conclusion à laquelle arrive agents IA contre chatbots IA depuis l'autre direction.
C'est aussi la raison pour laquelle une bonne couche de support reste agnostique vis-à-vis du modèle. Inkling-Small n'est pas le premier modèle de l'année à devenir le choix bon marché évident, et il ne sera pas le dernier. Tout ce qui est câblé en dur à un seul modèle doit être reconstruit à chaque mouvement du classement, ce qui est une mauvaise façon de faire tourner l'automatisation du service client.
Verdict
Pour la plupart des tâches, Inkling-Small est le meilleur achat face à son propre parent, et sur le prix, il n'y a pas photo. Même niveau d'intelligence selon la notation indépendante. Meilleur en code et en usage d'outils selon les propres chiffres du fabricant, 3,4 fois moins cher en sortie, 1,5 fois plus rapide, Apache 2.0, et assez petit pour être auto-hébergé sur une station de travail. Quinze jours après le modèle phare, le petit modèle a rendu ce dernier difficile à justifier.
Le bémol est précis et facile à formuler : il sait mesurablement moins, et il ne se comporte pas en conséquence. Donnez-lui un compilateur, une boucle d'outils ou une couche de retrieval, et il est excellent. Demandez-lui d'être la source de vérité, et il se trompera avec assurance.
Si vous le voulez pour du code ou des agents, adoptez-le dès aujourd'hui. Si vous le voulez à proximité des clients, budgétisez la couche au-dessus, pas seulement les tokens.
Pour le panorama plus large de ce qui se glisse dans ce créneau, commencez par alternatives à Inkling. Le rival le plus proche en prix et en taille a droit à son propre décryptage dans test de Kimi K3.
Et si le vrai travail consiste à trier une boîte de réception plutôt qu'à écrire du code, triage des tickets de support est la lecture la plus utile, avec déviation des tickets qui couvre ce qui se passe après ce triage.
Try eesel
Vous avez choisi Inkling-Small et vous avez maintenant besoin qu'il réponde en toute sécurité à de vrais tickets ? C'est exactement cet écart qu'eesel comble. Il se connecte à Zendesk, Freshdesk, Gorgias ou au helpdesk que vous utilisez en quelques minutes, apprend de vos tickets résolus et de votre centre d'aide plutôt que des poids du modèle, puis ne répond qu'à ce dont il est sûr et laisse le reste à votre équipe. Avant qu'il ne touche une file en production, vous pouvez le simuler sur votre propre historique de tickets et voir les réponses réelles qu'il aurait envoyées, ce qui est la vérification qu'un score de factualité de -9,0 rend incontournable. Il reste également agnostique vis-à-vis du modèle, donc le prochain modèle bon marché ne demande qu'un changement de réglage, pas une refonte.

Gratuit à l'essai, et facturé à l'usage, ce qui permet de vérifier les tarifs avant de s'engager. Try eesel ou voir comment il s'intègre comme logiciel de service client IA.
Sources
- Inkling-Small model card
- Introducing Inkling-Small
- Inkling model card
- Inkling-Small on Hugging Face
- Artificial Analysis: Inkling-Small
- Artificial Analysis: Inkling
- Unsloth: running Inkling locally
- OpenRouter: Inkling-Small
- Tinker fine-tuning platform
- Hacker News: Inkling-Small
- Hacker News: Hugging Face submission
Questions fréquentes
Inkling-Small en vaut-il la peine ?
Inkling-Small est-il meilleur qu'Inkling ?
Combien coûte Inkling-Small ?
Peut-on faire tourner Inkling-Small en local ?
Inkling-Small est-il adapté au support client ?
Quelle est la fenêtre de contexte d'Inkling-Small ?
Inkling-Small est-il gratuit et open source ?
thinkingmachines/Inkling-Small, donc l'auto-hébergement et l'usage commercial sont possibles. Gratuit à télécharger ne veut pas dire gratuit à exécuter, et la facture matérielle remplace celle des tokens. Thinking Machines vend aussi un accès via Tinker, sa plateforme hébergée de fine-tuning.Qui fabrique Inkling-Small et quand a-t-il été lancé ?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.







