
Ce qu'est vraiment Inkling-Small
Thinking Machines Lab est la structure de Mira Murati, et son modèle économique consiste à offrir les poids et à vendre l'outillage qui les entoure. Inkling-Small est le deuxième modèle publié : Apache 2.0, publié sur Hugging Face sous le nom thinkingmachines/Inkling-Small, et téléchargé environ 15 500 fois lors de son premier mois.
Le fournisseur le présente comme « un quart de la taille » de l'original, et pour une fois le chiffre marketing se vérifie. Le modèle parent compte 975B au total / 41B actifs répartis sur 66 couches. Celui-ci compte 276B au total / 12B actifs répartis sur 42 couches. C'est vraiment proche d'un quart sur les deux plans.

L'architecture est un Mixture-of-Experts assez agressif. Chaque couche contient 256 experts, et le routeur en sélectionne 6 par token, plus 2 experts partagés toujours actifs. L'attention est hybride, alternant couches locales et globales, et les poids sont livrés à la fois en BF16 et en NVFP4. L'entraînement s'est déroulé sur du matériel NVIDIA GB300 NVL72.
La conséquence pratique de cette forme : vous payez 276B en mémoire et 12B en calcul. C'est tout le principe, et c'est pourquoi un modèle comptant un quart de billion de paramètres peut servir plus vite qu'un modèle dense d'un dixième de sa taille. Si le vocabulaire des MoE vous est nouveau, la mécanique se généralise à la plupart des agents IA open source actuels.
Il existe également un curseur d'effort de raisonnement allant de 0 à 0,99, avec des paliers suggérés par le fournisseur à 0,2 pour bas, 0,7 pour moyen et 0,99 pour maximum. C'est un réglage sur la durée de réflexion du modèle avant de répondre, et il fait varier votre facture de tokens plus que tout autre paramètre que vous toucherez.
Ce qui entre et ce qui sort
C'est le point que l'on comprend le plus souvent de travers, il vaut donc la peine d'être direct.

Les entrées sont du texte, des images entre 40 et 4096 pixels, et de l'audio en WAV 16 kHz de moins de deux minutes. La sortie est uniquement du texte. Ce modèle n'a aucune synthèse vocale.
C'est important si vous prévoyiez une ligne téléphonique. Un modèle qui entend l'audio mais ne peut pas parler n'est que la moitié d'un pipeline vocal, et il vous faut encore ajouter la synthèse vocale, la téléphonie, la gestion des interruptions (barge-in) et la détection des tours de parole par-dessus. Si c'est votre projet, le panorama des fournisseurs dans les entreprises d'IA vocale est un meilleur point de départ qu'un modèle brut.
La compréhension audio est aussi la seule capacité où le petit modèle a perdu du terrain face à son parent sur tous les points : VoiceBench 90,1 contre 91,4, Audio MC 54,9 contre 56,6, MMAU 77,0 contre 77,2. Les écarts sont faibles, mais ils vont tous dans le même sens.
La fenêtre de contexte sur laquelle personne ne s'accorde
Voici une découverte vérifiable qui a pris deux minutes et qui évite une après-midi de galère.
La fiche du modèle indique une fenêtre de contexte de 1M de tokens. OpenRouter, l'un des deux seuls fournisseurs à le proposer, l'héberge à 524 288 tokens. C'est exactement la moitié, ce qui indique une décision d'hébergement délibérée plutôt qu'une coquille.
Aucun des deux chiffres n'est un mensonge. L'un décrit ce que l'architecture peut adresser, l'autre ce qu'un endpoint précis accepte aujourd'hui. Le mode d'échec typique consiste à concevoir un pipeline de bourrage de documents selon le chiffre de la fiche et à se heurter à un mur en production. Si vous construisez quelque chose qui repose sur une fenêtre longue, lisez le plafond sur l'endpoint que vous appelez réellement. Le même piège attrape les utilisateurs d'agents de codage, ce qui m'a poussé à traiter la taille de la fenêtre de contexte séparément.
Le nombre de fournisseurs est l'autre point faible : 2 fournisseurs, contre 4 pour le modèle parent. Pour un modèle qui n'en est qu'à cinq jours dans sa deuxième semaine, c'est attendu, mais cela signifie aussi moins de marge en cas de basculement.
Ce que ça coûte
Le prix de la sortie est fixé. 1,20 $ par million de tokens de sortie, confirmé par le fournisseur, Artificial Analysis et OpenRouter. Face aux 4,05 $ du modèle parent, c'est le point marquant.
Le prix de l'entrée n'est pas fixé, et je préfère vous le dire ainsi plutôt que de choisir un chiffre et de paraître sûr de moi :
| Source | Entrée par million | Sortie par million |
|---|---|---|
| Artificial Analysis | $0.30 | $1.20 |
| Page du modèle OpenRouter | $0.45 | $1.20 |
| Réponse de l'API OpenRouter | $0.50 | $1.20 |
| Modèle parent (Inkling) | référence | $4.05 |
Budgétez sur la base de 0,50 $ et rien ne vous surprendra. En base mixte (blended), Artificial Analysis place Inkling-Small à 0,22 $ par million contre 0,72 $ pour le modèle parent, soit environ un tiers du coût pour le même niveau d'intelligence.
La vitesse est la moitié sous-estimée de l'accord. 131,1 tokens de sortie par seconde contre 84,8 pour le modèle parent, avec un temps jusqu'au premier token (TTFT) de 1,65 s contre 1,82 s. Sur son Intelligence Index, le petit modèle obtient 40 points et se classe 15e sur 101, contre 41 et la 13e place pour le modèle parent. Même niveau, plus rapide, moins cher. C'est une combinaison inhabituelle et la principale raison de s'intéresser à cette sortie.
Le fine-tuning passe par la propre plateforme Tinker de Thinking Machines, qui prend en charge le modèle. Les tarifs d'entraînement par token ne sont publiés nulle part où j'ai pu le vérifier, et la page de tarification à tinker-docs.thinkingmachines.ai/pricing renvoie actuellement une erreur 404. Le stockage des checkpoints coûte 0,10 $ par Go et par mois. Si le fine-tuning est le plan, l'arbitrage face au retrieval est détaillé dans RAG contre fine-tuning.
L'exécuter soi-même
C'est là que le « gratuit » des poids gratuits est mis à l'épreuve. Les builds quantisées d'Unsloth donnent des chiffres concrets, et celui en 2 bits est le plus intéressant : 89 Go, qui tiennent dans une machine de 128 Go de mémoire unifiée.
Il y a un joli détail dans la discussion de lancement. Un commentateur de Hacker News, andy99, disait espérer quelque chose autour de 90 Go avant même la sortie des versions quantisées. Unsloth a atterri à 89.
Juste à la limite : 3 bits (128 Go)
Trop volumineux : 4 bits (132-170 Go), NVFP4 (180 Go+), BF16 (543 Go)
Trop volumineux : le 4 bits commence à 132 Go, NVFP4 (180 Go+), BF16 (543 Go)
Trop volumineux : BF16 (543 Go)
Suggestion de la fiche : 4x B300 ou 8x H200 pour le BF16
Entrée : de 0,30 $ à 0,50 $ par million, selon la source
Fournisseurs : 2 aujourd'hui
Deux remarques pratiques si vous passez en local. L'échantillonnage doit être temperature 1.0, top_p 1.0, min_p 0.0, ce qui est suffisamment inhabituel pour être noté. Et le support de llama.cpp est arrivé via la PR #25731, vérifiez donc que votre build l'inclut avant de déboguer des problèmes fantômes.
Où il a sa place, et où vraiment pas
Sur le propre tableau comparatif de son créateur, le petit modèle surpasse son parent de 975B sur la plupart de ce que l'on pourrait appeler l'exécution. SWEBench Verified 80,2 contre 77,6, SWEBench Pro 55,9 contre 54,3, Terminal Bench 2.1 à 64,7 contre 63,8, Toolathlon 54,4 contre 45,5, MCP Atlas 79,6 contre 76,0, GPQA 89,5 contre 87,2, IFBench 82,2 contre 79,8.
Puis il y a l'autre colonne. AIME redescend à 95,5 depuis 97,1. Global-MMLU-Lite chute à 86,7 depuis 88,7, ce qui vaut la peine d'être signalé si vous envisagiez un agent de support multilingue construit dessus. Et Tau 3 Banking chute de 23,7 à 15,5, la plus forte régression individuelle du tableau, sur un benchmark portant spécifiquement sur l'usage d'outils multi-tours dans un contexte orienté client.
La paire la plus importante pour quiconque envisage du travail de support est SimpleQA Verified à 20,6 % contre 43,9 % pour le modèle parent, accompagnée d'un score Omniscience de -9,0 contre +2,1 pour le parent. Un score Omniscience négatif signifie que le modèle se trompe avec plus d'assurance qu'il n'a raison. Personne dans les fils de discussion du lancement ne l'a mentionné, ce qui est dommage, car c'est le chiffre le plus déterminant de toute la sortie.
Je veux être juste ici, car c'est un choix de conception plutôt qu'un défaut. Un modèle avec 12B actifs a moins de marge pour mémoriser le monde qu'un modèle avec 41B actifs, et Thinking Machines a clairement consacré cette marge au raisonnement et à l'usage d'outils plutôt qu'à la mémorisation. Si votre modèle va de toute façon chercher l'information, les connaissances mémorisées sont un poids mort. C'est le bon pari pour un agent.
C'est le mauvais pari pour un bot qui répond de mémoire. C'est exactement le type d'échec que j'ai vu se produire en direct. Une équipe de support technique B2B avec laquelle j'ai travaillé a découvert que son bot confirmait « oui, nous prenons en charge votre modèle de véhicule » pour des véhicules absents de sa base de données, parce que le centre d'aide indiquait que l'entreprise prenait en charge tous les modèles. Le modèle n'était pas défaillant. Il faisait une inférence confiante à partir d'une source vague, exactement ce que prédit un score Omniscience négatif. J'ai détaillé ce schéma complet dans la prévention des hallucinations.
La lecture honnête est donc : utilisez Inkling-Small là où une couche de récupération fournit les faits et où le modèle fournit le raisonnement. Ne l'utilisez pas comme source de vérité.
Ce qui signifie que la qualité de vos sources devient le plafond de la précision du modèle, et bien les choisir est un levier plus important que le choix du checkpoint. Mon tour d'horizon des outils de base de connaissances est le point de départ pratique.
Ce que cela signifie si vous mettez de l'IA sur une file de support
Un modèle est un moteur, pas une voiture. Cette distinction résume à elle seule les agents IA face aux chatbots, et c'est pourquoi un tableau de benchmarks vous dit si peu sur une file d'attente.
L'écart entre « ça obtient de bons scores aux benchmarks » et « ça répond à mes clients » constitue le produit tout entier, et il est fait pour l'essentiel de pièces peu glamour :
- L'ancrage (grounding). Le modèle doit lire votre centre d'aide, vos macros et vos tickets résolus, pas ses données d'entraînement. C'est le travail d'une couche de chatbot de base de connaissances IA.
- Le routage par confiance. Quelque chose doit décider quand le modèle ne devrait pas répondre du tout, ce qui est au cœur de la gestion de l'escalade IA.
- Un essai à blanc. Vous voulez connaître le taux de résolution avant vos clients, pas après. Simuler sur votre propre historique de tickets est la seule façon honnête d'obtenir ce chiffre.
- Le transfert (handoff). Quand l'IA s'arrête, une personne reprend la conversation en cours avec tout le contexte, selon les bonnes pratiques de transfert. La version plus douce est un copilote IA, où le modèle rédige et une personne envoie.
- La mesure. Le taux de déviation (deflection rate) est le chiffre qui décide si tout cela a fonctionné. Traduisez-le en argent avec le coût par résolution.
- La couverture. Savoir quels sujets l'IA devrait même traiter est un exercice à part entière, détaillé dans ce guide de déviation des tickets.
Une responsable CX supplémentation chez une marque DTC à qui j'ai parlé a résumé l'exigence en une phrase : « J'ai besoin d'une IA qui ne traite que les tickets pour lesquels elle est confiante et qui laisse tous les autres tranquilles ». Aucun checkpoint de modèle ne vous donne cela. Un seuil de confiance et une règle de routage, oui, intégrés dans le système de tickets IA que vous utilisez déjà.
Le volet métriques de cette décision mérite d'être lu séparément, car « résolu » signifie des choses différentes selon les équipes. Commencez par les métriques de support, puis par la résolution au premier contact.
C'est aussi la réponse à la question construire contre acheter qu'un checkpoint gratuit sous Apache 2.0 soulève naturellement. Les poids sont la partie la moins chère du projet. Les 0,50 $ par million de tokens d'entrée sont la partie la moins chère du projet. Les parties coûteuses sont le pipeline de récupération, le harnais d'évaluation, la logique d'escalade, et la personne qui entretiendra ces trois éléments le trimestre prochain.

Vous voulez utiliser un modèle comme celui-ci sur de vrais tickets ?
Si le prix et la vitesse d'Inkling-Small ont attiré votre attention, ce que vous voulez vraiment, c'est cette économie enveloppée de garde-fous. eesel se connecte à Zendesk, Freshdesk et le reste de votre pile, s'entraîne sur vos tickets passés et votre centre d'aide plutôt que sur la mémoire d'un modèle, et vous permet de simuler l'ensemble du processus sur votre historique de tickets avant qu'un seul client ne le voie. Vous fixez le seuil de confiance ; tout ce qui est en dessous part vers une personne avec le contexte joint. Gratuit à essayer, et vous verrez votre propre taux de résolution avant de vous engager.
Comment il se positionne face aux autres options à poids ouverts
Le segment des poids ouverts est encombré et les différences sont plus étroites que ne le laissent penser les articles de lancement.
| Inkling-Small | Inkling (parent) | DeepSeek V4 Flash | |
|---|---|---|---|
| Paramètres | 276B / 12B actifs | 975B / 41B actifs | taille comparable |
| Entrées | texte, image, audio | texte, image, audio | texte uniquement |
| Sortie par million | $1.20 | $4.05 | plus bas |
| Vitesse | 131,1 tok/s | 84,8 tok/s | très rapide |
| AA Intelligence Index | 40 (#15) | 41 (#13) | voir la review |
La lecture de la communauté a été brève et raisonnablement juste. Le fil principal sur Hacker News n'a récolté que 33 points et deux commentaires, dont l'un notait qu'il est « à peu près de la même taille que DeepSeek Flash 4, mais prend aussi en charge l'entrée audio et image ». C'est le différenciateur résumé en une phrase : entrée multimodale au prix d'un petit modèle.
Le voisin le plus proche en prix et en forme est DeepSeek V4 Flash, qui le sous-cote par token mais ne prend en charge que le texte.
À l'autre extrémité de l'échelle, Kimi K3 facture des tarifs de frontière pour des poids ouverts, ce qui rend les 1,20 $ d'Inkling-Small généreux en comparaison.
Si vous voulez la version verdict de cet article plutôt que la version explicative, c'est la review d'Inkling-Small. Le parent de 975B a aussi son propre article explicatif Inkling.
Deux autres articles valent le détour avant de vous décider : ma review d'Inkling couvre le problème de tarification du modèle parent, et les alternatives à Inkling cartographient le paysage plus large.
Chiffres de sécurité, pour être complet : StrongREJECT 98,4, FORTRESS 71,6 et 96,9, MMMU Pro 74,0, ARC-AGI-1 84,0, ARC-AGI-2 40,1, SciCode 48,7, CritPt 8,3, AA-Briefcase 917, GDPval-AA v2 1269 contre 1238 pour le parent.
Mon avis
Inkling-Small est la plus intéressante des deux sorties Inkling, et je le dis en tant que personne qu'avait déçue la tarification de la première. Il est plus rapide et coûte environ un tiers d'un modèle qu'il surpasse dans l'ensemble, il accepte l'audio et les images, et à 89 Go en version quantisée, c'est le premier modèle de cette catégorie qu'une petite équipe peut posséder intégralement.
Les réserves sont précises, pas vagues. Lisez le vrai plafond de contexte de votre fournisseur plutôt que celui de la fiche. Budgétez l'entrée à 0,50 $. Et ne le traitez pas comme une source de connaissances, car un score Omniscience de -9,0, c'est le modèle qui vous dit à l'avance qu'il se trompera avec assurance.
Pour tout ce qui est orienté client, le modèle est la décision facile. C'est la couche d'automatisation qui l'entoure qui détermine si cela fonctionne, et cela reste vrai quel que soit le checkpoint qui l'emportera le mois prochain.
Si cet article vous a fait envisager un déploiement plutôt qu'un téléchargement, commencez par la déviation de niveau 1. Déterminez ensuite où le modèle ne devrait pas répondre du tout, ce qui est le travail du triage des tickets.
Sources
- Fiche du modèle Thinking Machines Lab,
thinkingmachines/Inkling-Smallsur Hugging Face (architecture, tableau de benchmarks, recommandations matérielles, paramètres d'échantillonnage) - Artificial Analysis (Intelligence Index, débit, TTFT, tarification mixte, Omniscience)
- Page du modèle et API d'OpenRouter (fenêtre de contexte servie, prix d'entrée, nombre de fournisseurs)
- Tailles des builds quantisées d'Unsloth
- Fil de lancement sur Hacker News
- eesel Customer Voice Dossier (GENERAL BYTES, avec autorisation ; extraits anonymisés de support technique B2B et de compléments alimentaires DTC)
Questions fréquentes
Qu'est-ce qu'Inkling-Small ?
Inkling-Small est-il gratuit et open source ?
Combien coûte Inkling-Small ?
Quelle est la fenêtre de contexte d'Inkling-Small ?
Puis-je exécuter Inkling-Small en local ?
Inkling-Small est-il adapté au service client ?
De quel matériel Inkling-Small a-t-il besoin ?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








Comment Inkling-Small se compare-t-il à DeepSeek V4 Flash et Kimi K3 ?