
Ce qu'est vraiment Inkling-Small
Thinking Machines Lab est la société de Mira Murati, et son modèle d'affaires consiste à offrir les poids et à vendre l'outillage qui les entoure. Inkling-Small est le deuxième modèle à sortir : Apache 2.0, publié sur Hugging Face sous le nom thinkingmachines/Inkling-Small, et téléchargé environ 15 500 fois lors de son premier mois.
Le fournisseur le décrit comme faisant "un quart de la taille" de l'original, et pour une fois le chiffre marketing tient la route. Le parent est à 975B au total / 41B actifs sur 66 couches. Celui-ci est à 276B au total / 12B actifs sur 42 couches. C'est effectivement très proche d'un quart sur les deux mesures.

L'architecture est un Mixture-of-Experts plutôt agressif. Chaque couche contient 256 experts, et le routeur en sélectionne 6 par token, plus 2 experts partagés toujours actifs. L'attention est hybride, alternant couches locales et globales, et les poids sont livrés à la fois en BF16 et en NVFP4. L'entraînement s'est déroulé sur du matériel NVIDIA GB300 NVL72.
La conséquence pratique de cette forme : vous payez 276B en mémoire et 12B en calcul. C'est tout le truc, et c'est pourquoi un modèle avec un quart de billion de paramètres peut servir plus vite qu'un modèle dense d'un dixième de sa taille. Si le vocabulaire du MoE vous est nouveau, la mécanique se généralise à la plupart des agents IA open source actuels.
Il existe aussi un curseur d'effort de raisonnement qui va de 0 à 0,99, avec les paliers suggérés par le fournisseur à 0,2 pour faible, 0,7 pour moyen et 0,99 pour maximum. C'est un réglage sur la durée pendant laquelle le modèle réfléchit avant de répondre, et il fait varier votre facture de tokens plus que tout autre paramètre que vous toucherez.
Ce qui entre, et ce qui sort
C'est le point que les gens comprennent le plus souvent mal, il vaut donc la peine d'être direct.

Les entrées sont du texte, des images entre 40 et 4096 pixels, et de l'audio en WAV 16 kHz de moins de deux minutes. La sortie est uniquement du texte. Il n'y a pas de synthèse vocale dans ce modèle.
Cela compte si vous prévoyiez une ligne téléphonique. Un modèle qui entend l'audio mais ne peut pas parler n'est que la moitié d'un pipeline vocal, et il vous faut encore la synthèse vocale, la téléphonie, la gestion du barge-in et la détection de tour de parole en plus. Si c'est votre projet, le panorama des fournisseurs dans les entreprises de voix IA est un meilleur point de départ qu'un modèle brut.
La compréhension audio est aussi la seule capacité où le petit modèle a perdu du terrain face à son parent sur toute la ligne : VoiceBench 90,1 contre 91,4, Audio MC 54,9 contre 56,6, MMAU 77,0 contre 77,2. Les écarts sont faibles, mais tous vont dans la même direction.
La fenêtre de contexte sur laquelle personne ne s'accorde
Voici un constat vérifiable qui a pris deux minutes et vous épargne un après-midi.
La fiche du modèle indique que la fenêtre de contexte est de 1M de tokens. OpenRouter, l'un des deux seuls fournisseurs à le proposer, l'héberge à 524 288 tokens. C'est exactement la moitié, ce qui indique une décision d'hébergement délibérée plutôt qu'une coquille.
Aucun des deux chiffres n'est un mensonge. L'un décrit ce que l'architecture peut adresser, l'autre ce qu'un point de terminaison précis acceptera aujourd'hui. Le mode de défaillance consiste à concevoir un pipeline de bourrage de documents en fonction du chiffre de la fiche et à se heurter à un mur en production. Si vous construisez quelque chose qui s'appuie sur une longue fenêtre, lisez le plafond sur le point de terminaison que vous appelez réellement. Le même piège touche les utilisateurs d'agents de codage, ce qui m'a amené à traiter la taille de la fenêtre de contexte séparément.
Le nombre de fournisseurs est l'autre point faible : 2 fournisseurs, contre 4 pour le modèle parent. Pour un modèle qui entame son cinquième jour de deuxième semaine, c'est attendu, mais cela signifie moins de marge en cas de basculement.
Ce qu'il coûte
La tarification de la sortie est établie. 1,20 $ par million de tokens de sortie, confirmé par le fournisseur, Artificial Analysis et OpenRouter. Face aux 4,05 $ du parent, c'est le titre.
La tarification de l'entrée n'est pas établie, et je préfère vous le dire plutôt que choisir un chiffre pour paraître sûr de moi :
| Source | Entrée par 1M | Sortie par 1M |
|---|---|---|
| Artificial Analysis | 0,30 $ | 1,20 $ |
| Page du modèle OpenRouter | 0,45 $ | 1,20 $ |
| Réponse de l'API OpenRouter | 0,50 $ | 1,20 $ |
| Modèle parent (Inkling) | référence | 4,05 $ |
Budgétez sur la base de 0,50 $ et rien ne vous surprendra. Sur une base mixte, Artificial Analysis situe Inkling-Small à 0,22 $ par million contre 0,72 $ pour le parent, soit environ un tiers du coût pour le même niveau d'intelligence.
La vitesse est la moitié sous-estimée de l'affaire. 131,1 tokens de sortie par seconde contre 84,8 pour le parent, avec un délai avant le premier token de 1,65 s contre 1,82 s. Sur son Intelligence Index, le petit modèle obtient 40 points et se classe 15e sur 101, contre 41 points et 13e place pour le parent. Même niveau, plus rapide, moins cher. C'est une combinaison inhabituelle et la principale raison de s'intéresser à cette sortie.
Le fine-tuning se fait via la propre plateforme Tinker de Thinking Machines, qui prend en charge le modèle. Les tarifs d'entraînement par token ne sont publiés nulle part où j'ai pu les trouver, et la page de tarification sur tinker-docs.thinkingmachines.ai/pricing renvoie actuellement une erreur 404. Le stockage des checkpoints coûte 0,10 $ par Go et par mois. Si le fine-tuning est le plan, l'arbitrage face à la récupération est exposé dans RAG versus fine-tuning.
L'exécuter soi-même
C'est là que le "gratuit" des poids gratuits est mis à l'épreuve. Les versions quantifiées d'Unsloth donnent des chiffres réels là-dessus, et le chiffre en 2 bits est le plus intéressant : 89 Go, ce qui tient dans une machine à mémoire unifiée de 128 Go.
Il y a un joli détail dans la discussion de lancement. Un commentateur sur Hacker News, andy99, a dit qu'il espérait quelque chose autour de 90 Go avant que la moindre version quantifiée ne soit publiée. Unsloth est arrivé à 89.
Juste à la limite : 3 bits (128 Go)
Trop gros : 4 bits (132-170 Go), NVFP4 (180 Go+), BF16 (543 Go)
Trop gros : le 4 bits commence à 132 Go, NVFP4 (180 Go+), BF16 (543 Go)
Trop gros : BF16 (543 Go)
Suggestion de la fiche : 4x B300 ou 8x H200 pour le BF16
Entrée : 0,30 $ à 0,50 $ par million, selon la source
Fournisseurs : 2 aujourd'hui
Deux remarques pratiques si vous partez en local. L'échantillonnage devrait être à température 1,0, top_p 1,0, min_p 0,0, ce qui est suffisamment inhabituel pour être noté. Et le support llama.cpp est arrivé via la PR #25731, alors vérifiez que votre build l'inclut avant de déboguer des problèmes fantômes.
Où il trouve sa place, et où vraiment pas
Sur son propre tableau comparatif du fabricant, le petit modèle bat son parent de 975B sur la plupart de ce qu'on appellerait l'exécution. SWEBench Verified 80,2 contre 77,6, SWEBench Pro 55,9 contre 54,3, Terminal Bench 2.1 à 64,7 contre 63,8, Toolathlon 54,4 contre 45,5, MCP Atlas 79,6 contre 76,0, GPQA 89,5 contre 87,2, IFBench 82,2 contre 79,8.
Puis il y a l'autre colonne. AIME glisse à 95,5 depuis 97,1. Global-MMLU-Lite chute à 86,7 depuis 88,7, ce qui vaut la peine d'être signalé si vous envisagiez un agent de support multilingue par-dessus. Et Tau 3 Banking tombe à 15,5 depuis 23,7, la régression la plus marquée de la feuille, sur un benchmark spécifiquement consacré à l'usage d'outils multi-tours dans un contexte orienté client.
La paire la plus importante pour quiconque envisage du travail de support est SimpleQA Verified à 20,6 % contre 43,9 % pour le parent, avec un score Omniscience de -9,0 contre +2,1 pour le parent. Un score Omniscience négatif signifie que le modèle a tort avec plus d'assurance qu'il n'a raison. Personne dans les fils de lancement ne l'a mentionné, ce qui est dommage, car c'est le chiffre le plus déterminant pour la décision dans toute cette sortie.
Je veux être juste ici, car c'est un choix de conception plutôt qu'un défaut. Un modèle à 12B actifs a moins de place pour mémoriser le monde qu'un modèle à 41B actifs, et Thinking Machines a clairement dépensé cette place dans le raisonnement et l'usage d'outils à la place. Si votre modèle va chercher l'information de toute façon, les connaissances mémorisées sont un poids mort. C'est le bon pari pour un agent.
C'est le mauvais pari pour un bot qui répond aux questions de mémoire. C'est exactement le type de défaillance que j'ai vu se produire en direct. Une équipe de support technique B2B avec laquelle j'ai travaillé a découvert que son bot confirmait "oui, nous prenons en charge votre modèle de véhicule" pour des véhicules qui n'étaient pas dans sa base de données, parce que le centre d'aide disait que l'entreprise prenait en charge tous les modèles. Le modèle n'était pas défectueux. Il faisait de l'inférence assurée sur une source vague, exactement ce qu'un score Omniscience négatif prédit. J'ai détaillé tout le schéma dans la prévention des hallucinations.
Donc la lecture honnête : utilisez Inkling-Small là où une couche de récupération fournit les faits et le modèle fournit le raisonnement. Ne l'utilisez pas comme source de vérité.
Ce qui signifie que la qualité de vos sources devient le plafond de la précision du modèle, et bien les choisir est un levier plus important que le choix du checkpoint. Mon tour d'horizon des outils de base de connaissances est le point de départ pratique.
Ce que cela signifie si vous mettez de l'IA sur une file de support
Un modèle est un moteur, pas une voiture. Cette distinction est au cœur de agents IA contre chatbots, et c'est pourquoi un tableau de benchmarks vous dit si peu sur une file d'attente.
L'écart entre "ça obtient de bons benchmarks" et "ça répond à mes clients" est le produit dans son entier, et il est fait surtout de composants peu glamours :
- Ancrage (grounding). Le modèle doit lire votre centre d'aide, vos macros et vos tickets résolus, pas ses données d'entraînement. C'est le rôle d'une couche comme un chatbot de base de connaissances IA.
- Routage par confiance. Quelque chose doit décider quand le modèle ne devrait pas répondre du tout, ce qui est au cœur de la gestion d'escalade IA.
- Un essai à blanc. Vous voulez connaître le taux de résolution avant les clients, pas après. La simulation sur votre propre historique de tickets est la seule façon honnête d'obtenir ce chiffre.
- Transfert (handoff). Quand l'IA s'arrête, un humain reprend la conversation en cours avec le contexte complet, selon les meilleures pratiques de transfert. La version plus douce de cela est un copilote IA, où le modèle rédige et un humain envoie.
- Mesure. Le taux de déviation (deflection) est le chiffre qui décide si tout cela a fonctionné. Traduisez-le en argent avec le coût par résolution.
- Couverture. Savoir quels sujets l'IA devrait prendre en charge du tout est un exercice à part, exposé dans ce guide de déviation de tickets.
Une responsable CX de compléments alimentaires DTC à qui j'ai parlé a formulé l'exigence en une phrase : "I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone." Aucun checkpoint de modèle ne vous donne cela. Un seuil de confiance et une règle de routage, oui, intégrés dans le système de tickets IA que vous utilisez déjà.
Le volet métriques de cette décision mérite d'être lu séparément, car "résolu" signifie des choses différentes selon les équipes. Commencez par les métriques de support, puis la résolution au premier contact.
C'est aussi la réponse à la question construire-versus-acheter que soulève naturellement un checkpoint gratuit sous Apache 2.0. Les poids sont la partie la moins chère du projet. Les 0,50 $ par million de tokens d'entrée sont la partie la moins chère du projet. Les parties coûteuses sont le pipeline de récupération, le harnais d'évaluation, la logique d'escalade et la personne qui maintient les trois le trimestre prochain.

Envie d'utiliser un modèle comme celui-ci sur de vrais tickets ?
Si le prix et la vitesse d'Inkling-Small ont attiré votre attention, ce que vous voulez en réalité, c'est cette économie enveloppée dans des garde-fous. eesel se connecte à Zendesk, Freshdesk et le reste de votre pile, s'entraîne sur vos tickets passés et votre centre d'aide plutôt que sur la mémoire d'un modèle, et vous permet de simuler l'ensemble du processus sur votre historique de tickets avant qu'un seul client ne le voie. Vous fixez le seuil de confiance ; tout ce qui est en dessous part vers un humain avec le contexte attaché. Gratuit à essayer, et vous verrez votre propre taux de résolution avant de vous engager.
Comment il se positionne face aux autres options en poids ouverts
La catégorie des poids ouverts est encombrée et les différences sont plus resserrées que ne le suggèrent les articles de lancement.
| Inkling-Small | Inkling (parent) | DeepSeek V4 Flash | |
|---|---|---|---|
| Paramètres | 276B / 12B actifs | 975B / 41B actifs | taille comparable |
| Entrées | texte, image, audio | texte, image, audio | texte uniquement |
| Sortie par 1M | 1,20 $ | 4,05 $ | plus bas |
| Vitesse | 131,1 tok/s | 84,8 tok/s | très rapide |
| AA Intelligence Index | 40 (#15) | 41 (#13) | voir le test |
La lecture de la communauté a été courte et raisonnablement juste. Le fil principal sur Hacker News n'a attiré que 33 points et deux commentaires, dont l'un notait que c'est "About the same size as DeepSeek Flash 4, but also supports audio and image input." C'est le différenciateur en une phrase : entrée multimodale à un prix de petit modèle.
Le voisin le plus proche en prix et en forme est DeepSeek V4 Flash, qui le sous-cote par token mais n'accepte que du texte.
À l'autre bout de l'échelle, Kimi K3 facture des tarifs de pointe pour des poids ouverts, ce qui rend les 1,20 $ d'Inkling-Small généreux en comparaison.
Si vous voulez la version en forme de verdict de cet article plutôt que l'explicatif, c'est le test d'Inkling-Small. Le parent de 975B a aussi son propre article explicatif Inkling.
Deux autres à consulter avant de trancher : mon test d'Inkling traite du problème de tarification du parent, et les alternatives à Inkling cartographient le champ plus large.
Chiffres de sécurité, pour être complet : StrongREJECT 98,4, FORTRESS 71,6 et 96,9, MMMU Pro 74,0, ARC-AGI-1 84,0, ARC-AGI-2 40,1, SciCode 48,7, CritPt 8,3, AA-Briefcase 917, GDPval-AA v2 1269 contre 1238 pour le parent.
Mon avis
Inkling-Small est le plus intéressant des deux sorties Inkling, et je le dis en tant que personne qui n'avait pas été convaincue par la tarification de la première. Il est plus rapide et coûte environ un tiers d'un modèle qu'il surpasse dans l'ensemble, il accepte l'audio et les images, et à 89 Go quantifié, c'est le premier modèle de cette catégorie qu'une petite équipe peut posséder entièrement.
Les réserves sont précises plutôt que vagues. Lisez le plafond de contexte réel de votre fournisseur plutôt que celui de la fiche. Budgétez l'entrée à 0,50 $. Et ne le traitez pas comme une source de connaissance, car un score Omniscience de -9,0 vous dit d'avance qu'il aura tort avec assurance.
Pour tout ce qui touche au client, le modèle est la décision facile. La couche d'automatisation autour de lui est celle qui déterminera si ça fonctionne, et cela reste vrai quel que soit le checkpoint qui l'emportera le mois prochain.
Si cet article vous fait peser un déploiement plutôt qu'un simple téléchargement, commencez par la déviation de niveau 1. Déterminez ensuite où le modèle ne devrait pas répondre du tout, ce qui est le rôle du triage des tickets.
Sources
- Fiche modèle de Thinking Machines Lab,
thinkingmachines/Inkling-Smallsur Hugging Face (architecture, tableau de benchmarks, recommandations matérielles, réglages d'échantillonnage) - Artificial Analysis (Intelligence Index, débit, TTFT, tarification mixte, Omniscience)
- Page modèle et API d'OpenRouter (fenêtre de contexte servie, tarification en entrée, nombre de fournisseurs)
- Tailles des versions quantifiées d'Unsloth
- Fil de lancement sur Hacker News
- eesel Customer Voice Dossier (GENERAL BYTES, avec permission ; extraits anonymisés de support technique B2B et de compléments alimentaires DTC)
Questions fréquentes
Qu'est-ce qu'Inkling-Small ?
Inkling-Small est-il gratuit et open source ?
Combien coûte Inkling-Small ?
Quelle est la fenêtre de contexte d'Inkling-Small ?
Puis-je exécuter Inkling-Small localement ?
Inkling-Small est-il bon pour le support client ?
De quel matériel Inkling-Small a-t-il besoin ?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








Comment Inkling-Small se compare-t-il à DeepSeek V4 Flash et Kimi K3 ?