Inkling-Small à l'essai : un quart de la taille, presque aussi malin

Alicia Kirana Utomo
Écrit par

Alicia Kirana Utomo

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 4, 2026

Vérifié par un expert
Illustration comparant un petit noyau de modèle bien ordonné à un autre, bien plus grand et emmêlé, pour un avis sur Inkling-Small

Inkling-Small en 30 secondes

Sortie30 juillet 2026, quinze jours après Inkling
FabricantThinking Machines Lab (Mira Murati)
Taille276B au total, 12B actifs, 42 couches
LicenceApache 2.0, poids sur Hugging Face
Contexte1M de tokens sur la fiche, 524K via OpenRouter
EntréesTexte, image, audio (WAV 16 kHz)
Prix API$0,30 à $0,50 en entrée, $1,20 en sortie par 1M
Plancher auto-hébergement89 Go en quantification 2 bits
Point fortCode, usage d'outils, boucles d'agents, contexte long
Point faibleRappel factuel sans retrieval

Ce qu'est réellement Inkling-Small

C'est dans l'architecture que se niche la partie intéressante, et elle explique les deux faces des résultats.

Inkling-Small est un transformeur decoder-only à 42 couches, avec une pile feed-forward de type mixture-of-experts éparse. Chaque token est routé vers 6 des 256 experts, plus 2 experts partagés qui s'activent sur chaque token sans exception. Le total de paramètres atteint 276B ; seuls 12B d'entre eux sont actifs par token. La fiche du modèle confirme des couches d'attention hybrides locales et globales, une numérique BF16 et NVFP4, ainsi qu'un entraînement sur des systèmes NVIDIA GB300 NVL72.

Comparez avec le parent. Inkling totalise 975B et 41B actifs sur 66 couches, donc la forme du routage est la même, mais avec environ un quart de la masse totale et moins d'un tiers de la masse active. Thinking Machines décrit le résultat comme « des performances comparables à Inkling avec un quart de sa taille ».

Ce ratio résume toute l'histoire ici. Un grand rapport total-sur-actif rend un modèle bon marché à servir, et un faible total de paramètres le rend oublieux. Inkling-Small a fortement misé sur le premier point et en a payé le prix sur le second. Pour la version générale de ce mécanisme, modèles d'IA sur mesure parcourt le même compromis sans tous les tableaux de benchmarks.

Il prend du texte, puis des images (entre 40 et 4096 pixels fonctionne le mieux), et de l'audio en WAV à 16 kHz, idéalement de moins de deux minutes. La sortie est uniquement du texte. L'effort de raisonnement est un curseur de 0 à 0,99, où bas correspond à 0,2, moyen se situe à 0,7 et maximum à 0,99, permettant d'échanger des tokens de réflexion contre de la latence à chaque appel.

L'entrée audio native est l'élément le plus rare de cette liste, ce qui explique pourquoi ce modèle revient sans cesse dans les conversations sur la voix. La limite mérite d'être signalée : l'audio entre, le texte sort, il n'y a donc aucune synthèse vocale ici. Les fournisseurs qui bouclent effectivement ce cercle sont couverts dans entreprises de voix IA.

Pour quelle tâche Inkling-Small est-il adapté ?

La réponse change beaucoup selon la charge de travail, et pour chacune d'elles, le propre tableau du fabricant fournit les preuves. Choisissez la tâche que vous avez réellement :

Inkling-Small ou l'Inkling complet ?

Choisissez votre charge de travail. Les chiffres proviennent des fiches modèles Thinking Machines pour les deux modèles.

Prenez le petit modèle

Il gagne franchement, et vous conservez des tokens de sortie 3,4 fois moins chers. Il n'y a aucune raison de payer pour le grand modèle ici.

BenchmarkSmallInkling
SWEBench Verified80.2%77.6%
SWEBench Pro55.9%54.3%
Terminal Bench 2.164.7%63.8%
Prenez le petit modèle

L'écart sur Toolathlon est de près de neuf points, ce qui est beaucoup pour un modèle aussi moins cher. Les boucles d'agents longues sont là où cette différence de prix s'accumule.

BenchmarkSmallInkling
Toolathlon Verified54.4%45.5%
MCP Atlas79.6%76.0%
GDPval-AA v2 (Elo)12691238
Ancrez-le, ou passez au plus grand

C'est le seul endroit où la réduction de taille se voit vraiment. Un score Omniscience négatif signifie que les réponses fausses mais assurées dépassent les bonnes, donc soit vous lui donnez du retrieval sur vos propres sources, soit vous utilisez le modèle plus grand.

BenchmarkSmallInkling
SimpleQA Verified20.6%43.9%
AA Omniscience-9.0+2.1
Global-MMLU-Lite86.7%88.7%
Assez proche pour ne pas compter

Le parent l'emporte de peu sur AIME, le petit l'emporte de peu sur GPQA. Les deux sont assez élevés pour que ce soit la différence de prix qui tranche.

BenchmarkSmallInkling
AIME 202695.5%97.1%
GPQA Diamond89.5%87.2%
HLE (text only)31.6%29.7%
Léger avantage au parent

L'audio est la seule modalité où la réduction a coûté quelque chose de mesurable mais faible. Les deux modèles prennent en charge le WAV 16 kHz nativement, ce qui reste rare.

BenchmarkSmallInkling
VoiceBench90.1%91.4%
Audio MC54.9%56.6%
MMAU77.0%77.2%

Les benchmarks : il surpasse vraiment son parent

Un modèle distillé ou réduit se retrouve normalement un peu derrière le modèle phare dont il est issu. Ce n'est pas le cas d'Inkling-Small, du moins pas sur les catégories pour lesquelles la plupart des gens achètent un modèle.

Scorecard showing where Inkling-Small beats and trails its larger parent model
Scorecard showing where Inkling-Small beats and trails its larger parent model

En code, il remporte SWEBench Verified avec 80,2% contre 77,6%, puis SWEBench Pro avec 55,9% contre 54,3%, avec Terminal Bench 2.1 à 64,7% contre 63,8%. Côté agentique, il remporte Toolathlon Verified avec 54,4% contre 45,5% et MCP Atlas avec 79,6% contre 76,0%, plus un Elo GDPval-AA v2 de 1269 contre 1238. En raisonnement général, il remporte GPQA Diamond avec 89,5% contre 87,2%, et Humanity's Last Exam avec 31,6% contre 29,7% en version texte seul.

Il publie aussi des chiffres que la fiche du parent ne rapporte même pas. SciCode 48,7%, CritPt 8,3%, puis ARC-AGI-1 à 84,0% et ARC-AGI-2 à 40,1%. Sur le respect des instructions, IFBench atteint 82,2% contre 79,8%, et cela compte plus qu'il n'y paraît pour tout ce qui doit obéir de façon fiable à un prompt système. Si c'est l'axe qui vous intéresse, agent IA contre chatbot basé sur des règles explique pourquoi, en production, l'obéissance l'emporte sur l'intelligence brute.

Les pertes côté raisonnement sont réelles, mais étroites. AIME 2026 chute à 95,5% contre 97,1%. Tau 3 Banking chute à 15,5% contre 23,7%, la régression la plus marquée de tout le bloc agentique, et à noter si votre charge de travail ressemble à des flux financiers structurés.

Un autre résultat mérite un signalement, car il est facile à manquer. Global-MMLU-Lite, le test multilingue, glisse de 88,7% à 86,7%. Une baisse de deux points, donc rien de dramatique, mais elle pointe dans la même direction que les chiffres de factualité : la coupe a porté sur l'étendue des connaissances. Si vous servez plusieurs langues, testez chacune d'elles plutôt que de faire confiance à l'agrégat, et agents de support multilingues montre à quoi ressemble ce test en pratique.

De façon indépendante, Artificial Analysis lui attribue 40 sur son Intelligence Index, au rang #15 sur 101, contre 41 et le rang #13 pour l'Inkling complet. Un seul point d'index d'écart, pour un quart de la taille. Que le score du fabricant et celui d'un tiers indépendant arrivent à la même conclusion est inhabituel, et c'est l'élément le plus solide de tout ce test.

Le seul chiffre qui devrait vous arrêter

Voici la partie qui n'a pas figuré dans le billet de lancement.

SimpleQA Verified, qui teste si un modèle connaît des réponses factuelles courtes, s'établit à 20,6% pour Inkling-Small contre 43,9% pour Inkling. Moins de la moitié. Et AA Omniscience, qui compense les bonnes réponses par les réponses fausses mais assurées, affiche -9,0 là où le parent obtient +2,1.

Un score Omniscience négatif signifie que le modèle affirme plus de choses fausses avec assurance que de choses correctes. Ce n'est pas un modèle qui dit « je ne suis pas sûr ». C'est un modèle qui comble le vide. Thinking Machines le liste lui-même parmi les limitations connues, citant « l'hallucination (générer du contenu plausible mais factuellement incorrect ou non étayé) » et « une performance dégradée dans les conversations longues à plusieurs tours », et déconseille tout déploiement médical, juridique ou critique pour la sécurité sans fine-tuning supplémentaire. Il faut lui reconnaître ce mérite : c'est une section de limitations plus franche que celle que la plupart des laboratoires prennent la peine de publier.

Pour un agent de code, cela compte à peine, puisque le compilateur fait office de vérificateur de faits. Pour tout ce qui est en contact avec le client, ça compte énormément, et j'ai vu ce mode de défaillance en production. Une équipe de support avec laquelle j'ai travaillé avait une base de connaissances affirmant qu'elle prenait en charge tous les modèles de véhicules, si bien que son bot confirmait allègrement la couverture pour des marques de voitures qui n'étaient même pas dans sa base de données. Rien d'hallucinatoire au sens spectaculaire du terme. Le modèle a simplement comblé un vide avec quelque chose de plausible. Cette équipe décrivait sa configuration initiale comme « des essais et erreurs au début ».

Un modèle à -9,0 sur Omniscience, c'est ce même mode de défaillance avec le volume monté. Les mesures d'atténuation sont connues et peu spectaculaires : du retrieval sur des sources que vous contrôlez, des citations qu'une personne peut vérifier, et un chemin de refus. Hallucinations de l'IA en support couvre l'ensemble complet, et la version pratique plus courte est prévention des hallucinations de l'IA.

Prix et vitesse : la vraie raison de s'y intéresser

C'est ici que le petit modèle gagne sa place dans le monde.

Inkling-SmallInkling
Entrée par 1M$0,30 à $0,50$1,00
Sortie par 1M$1,20$4,05
Mixte (AA)$0,22$0,72
Vitesse de sortie131,1 tok/s84,8 tok/s
Temps jusqu'au premier token1,65 s1,82 s
Fournisseurs24
AA Intelligence Index4041

Les tokens de sortie coûtent 3,4 fois moins et arrivent 1,5 fois plus vite, pour un point d'intelligence en moins. Pour les boucles d'agents, où les tokens de sortie dominent la facture et où la latence s'accumule sur des dizaines de tours, ce n'est pas une différence marginale. Cela se reflète aussi dans les chiffres qu'une équipe de support suit réellement, car des premiers tokens plus rapides font bouger la résolution au premier contact ainsi que le reste des métriques du service client qui en découlent.

Deux mises en garde avant de bâtir un budget dessus. Le prix d'entrée n'est pas encore fixé : Artificial Analysis indique 0,30 dollar par 1M, tandis que la fiche OpenRouter affiche 0,45 dollar et que son API renvoie 0,50 dollar, donc vérifiez votre propre route. Par ailleurs, il n'y a que deux fournisseurs pour l'instant, contre quatre pour le parent, ce qui est mince si vous avez besoin de basculement.

La seconde mise en garde est la plus surprenante. La fiche du modèle annonce 1M de contexte. OpenRouter le sert actuellement à 524 288 tokens, exactement la moitié. Les poids supportent la fenêtre complète, l'API routée ne l'expose simplement pas encore. Si le million de tokens était la raison de choisir ce modèle, auto-hébergez ou vérifiez d'abord auprès de votre fournisseur. Taille de la fenêtre de contexte explique pourquoi le chiffre annoncé et le chiffre réellement utilisable divergent si souvent.

L'activité réelle de Thinking Machines est Tinker, sa plateforme hébergée de fine-tuning LoRA, et Inkling-Small y est pris en charge. Le stockage des checkpoints coûte 0,10 dollar par Go et par mois ; les tarifs d'entraînement par token ne sont pas publiés sur la page de présentation.

Faire tourner Inkling-Small soi-même

L'auto-hébergement est l'amélioration la plus nette par rapport au modèle parent, et ici les chiffres ne sont pas serrés.

Memory ladder showing Inkling-Small quantization sizes against a 128 GB workstation limit
Memory ladder showing Inkling-Small quantization sizes against a 128 GB workstation limit

Les chiffres d'Unsloth situent Inkling-Small à 543 Go en BF16, puis entre 132 et 170 Go en 4 bits, 128 Go en 3 bits, et 89 Go en 2 bits. L'Inkling complet nécessite 1 900 Go en BF16 et demande encore entre 270 et 285 Go même en quantification 1 bit. La fiche du modèle présente la même chose en termes de matériel : 600 Go de VRAM agrégée pour du BF16 (4x B300 ou 8x H200), qui descend à 180 Go pour le checkpoint NVFP4, soit un B300 ou une paire de H200.

Le chiffre de 89 Go est celui qui change qui peut faire tourner ceci. Cela tient dans une machine à 128 Go de mémoire unifiée, ce qui relève de l'achat d'une station de travail et non d'un centre de données. Et comme seuls 12B de paramètres sont actifs par token, une build fortement quantifiée reste utilisable au lieu de ramper.

Les réglages d'échantillonnage recommandés sont une température de 1,0, top_p à 1,0 et min_p à 0,0, sur un contexte de 1 048 576 tokens. La prise en charge dès le premier jour couvre transformers, vLLM, SGLang, TokenSpeed, Unsloth et Docker Model Runner, avec des builds quantifiées via llama.cpp, Ollama, LM Studio et Jan. Un point à surveiller : llama.cpp a besoin que la PR #25731 soit fusionnée. Les options d'auto-hébergement plus larges se trouvent dans meilleurs agents d'IA open source.

Avantages et inconvénients

Ce qui est bon

  • Bat un modèle 3,5 fois plus grand en code et en usage d'outils, plus en respect des instructions
  • 1,20 dollar par million de tokens de sortie, soit 3,4 fois moins cher que le parent
  • 131 tokens par seconde, une vitesse nettement supérieure
  • Apache 2.0, donc l'auto-hébergement commercial n'est pas restreint
  • Fonctionne à 89 Go quantifié, dans la gamme des stations de travail
  • Entrée audio et image native, encore rare à ce prix
  • Une section de limitations franche de la part du fabricant lui-même

Ce qui ne l'est pas

  • SimpleQA Verified à 20,6%, moins de la moitié du parent
  • AA Omniscience à -9,0, donc plus de réponses fausses assurées que correctes
  • Contexte de 1M sur le papier, mais 524K via OpenRouter aujourd'hui
  • Seulement deux fournisseurs d'API, ce qui rend le basculement mince
  • Tau 3 Banking chute à 15,5% contre 23,7%
  • Les scores audio sont légèrement en retrait par rapport au parent sur les trois tests
  • Sortie texte uniquement, donc pas de génération d'image ou d'audio

Ce que dit la communauté

La réaction a été bien plus discrète que le lancement du modèle phare, qui avait attiré plus de 1 200 points sur Hacker News. Le propre fil d'Inkling-Small en a récolté 33. Le situer par rapport au reste du paysage a été le premier réflexe :

Hacker News

"better than haiku 4.5 smaller than nemotron 3 ultra"

L'autre commentaire le comparait au rival évident en poids ouverts, notant qu'il est "About the same size as DeepSeek Flash 4, but also supports audio and image input." Un cadrage juste. DeepSeek V4 Flash est moins cher par token et uniquement textuel, donc la prise en charge audio et image est ici le véritable élément de différenciation, et le détail de la comparaison directe se trouve dans le test de Flash.

Le commentaire le plus incisif est arrivé avant même que les quantifications ne sortent, sur la publication Hugging Face :

Hacker News

"I didn't see a gguf yet, going to be most interesting if there's a quant that fits nicely into about 90 [GB] so it can run in 128GB unified memory. It's 12B active so should hopefully be pretty fast at 2 bit quant if it fits"

La build 2 bits d'Unsloth a atterri à 89 Go. La communauté de l'inférence locale avait deviné le chiffre cible avant même que la sortie n'existe, et elle a visé juste. Sur son premier mois, le dépôt Hugging Face a compté 15 500 téléchargements.

Une chose que j'ai remarquée : personne dans ces fils n'a mentionné la régression de factualité. Le cadrage du lancement portait sur la vitesse et la taille, c'est donc de cela qu'on a discuté.

Ce que cela signifie si vous voulez qu'il réponde à des tickets

Ici je vais être direct, parce que cette partie, c'est littéralement mon métier.

Un modèle bon marché et rapide ressemble à une victoire évidente pour le support. Le volume de tickets est élevé, les réponses sont courtes, et 1,20 dollar par million de tokens de sortie contre 4,05 représente de l'argent bien réel à grande échelle. C'est l'arithmétique derrière coût du service client IA, et c'est le même calcul qui alimente la comparaison avec un agent humain. Les équipes qui le suivent comme un coût unitaire finissent généralement par regarder le coût par résolution.

Mais le support est la seule charge de travail où -9,0 sur Omniscience devient le chiffre disqualifiant plutôt qu'une note de bas de page. Un agent de code qui invente une API se voit renvoyer une stack trace. Un agent de support qui invente un délai de retour l'envoie plutôt à un client, par écrit, avec votre logo dessus. Les acheteurs à qui je parle le savent déjà, et c'est l'objection qui revient en premier. Une responsable CX d'une marque de compléments alimentaires en DTC l'a formulé à peu près aussi clairement que possible :

"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

a DTC supplements CX lead, from an eesel sales call

C'est une demande pour une couche, pas pour un modèle. Quatre éléments doivent se trouver entre n'importe quel modèle et votre file d'attente.

  1. Du retrieval sur des sources que vous possédez, afin que les réponses viennent de votre centre d'aide et des tickets passés plutôt que des poids. Chatbot de base de connaissances IA couvre le principe ; côté outillage, il y a meilleurs outils de base de connaissances IA.
  2. Le routage par niveau de confiance, afin que le modèle réponde à ce dont il est sûr et escalade le reste. Le côté routage est gestion de l'escalade IA ; le transfert propre vers un humain est transfert d'agent.
  3. Un essai à blanc avant la mise en production, simulé sur vos propres tickets historiques plutôt que sur la suite de benchmarks de quelqu'un d'autre. C'est l'étape que les équipes ont tendance à sauter, et c'est aussi celle qui attrape les réponses fausses mais assurées.
  4. Une autonomie encadrée, en commençant comme copilote qui rédige des brouillons avant de répondre seul. Copilote IA est la rampe d'accès ; la déviation de niveau 1 est là où l'on arrive, mesurée par le taux de déviation.

Faites ces quatre choses et l'écart de factualité d'Inkling-Small cesse d'être un passif, parce que les faits ne sortent plus du modèle. Sautez-les, et ce que vous avez acheté, c'est une source rapide, bon marché et assurée de réponses plausibles. C'est la différence entre un agent IA de helpdesk et une simple clé API brute, et c'est la même conclusion à laquelle arrive agents IA contre chatbots IA depuis l'autre direction.

C'est aussi la raison pour laquelle une bonne couche de support reste agnostique vis-à-vis du modèle. Inkling-Small n'est pas le premier modèle de l'année à devenir le choix bon marché évident, et il ne sera pas le dernier. Tout ce qui est câblé en dur à un seul modèle doit être reconstruit à chaque mouvement du classement, ce qui est une mauvaise façon de faire tourner l'automatisation du service client.

Verdict

Pour la plupart des tâches, Inkling-Small est le meilleur achat face à son propre parent, et sur le prix, il n'y a pas photo. Même niveau d'intelligence selon la notation indépendante. Meilleur en code et en usage d'outils selon les propres chiffres du fabricant, 3,4 fois moins cher en sortie, 1,5 fois plus rapide, Apache 2.0, et assez petit pour être auto-hébergé sur une station de travail. Quinze jours après le modèle phare, le petit modèle a rendu ce dernier difficile à justifier.

Le bémol est précis et facile à formuler : il sait mesurablement moins, et il ne se comporte pas en conséquence. Donnez-lui un compilateur, une boucle d'outils ou une couche de retrieval, et il est excellent. Demandez-lui d'être la source de vérité, et il se trompera avec assurance.

Si vous le voulez pour du code ou des agents, adoptez-le dès aujourd'hui. Si vous le voulez à proximité des clients, budgétisez la couche au-dessus, pas seulement les tokens.

Pour le panorama plus large de ce qui se glisse dans ce créneau, commencez par alternatives à Inkling. Le rival le plus proche en prix et en taille a droit à son propre décryptage dans test de Kimi K3.

Et si le vrai travail consiste à trier une boîte de réception plutôt qu'à écrire du code, triage des tickets de support est la lecture la plus utile, avec déviation des tickets qui couvre ce qui se passe après ce triage.

Try eesel

Vous avez choisi Inkling-Small et vous avez maintenant besoin qu'il réponde en toute sécurité à de vrais tickets ? C'est exactement cet écart qu'eesel comble. Il se connecte à Zendesk, Freshdesk, Gorgias ou au helpdesk que vous utilisez en quelques minutes, apprend de vos tickets résolus et de votre centre d'aide plutôt que des poids du modèle, puis ne répond qu'à ce dont il est sûr et laisse le reste à votre équipe. Avant qu'il ne touche une file en production, vous pouvez le simuler sur votre propre historique de tickets et voir les réponses réelles qu'il aurait envoyées, ce qui est la vérification qu'un score de factualité de -9,0 rend incontournable. Il reste également agnostique vis-à-vis du modèle, donc le prochain modèle bon marché ne demande qu'un changement de réglage, pas une refonte.

eesel AI helpdesk dashboard showing live ticket activity and AI resolutions
eesel AI helpdesk dashboard showing live ticket activity and AI resolutions

Gratuit à l'essai, et facturé à l'usage, ce qui permet de vérifier les tarifs avant de s'engager. Try eesel ou voir comment il s'intègre comme logiciel de service client IA.

Sources

Questions fréquentes

Inkling-Small en vaut-il la peine ?
Pour le code, les agents et l'usage d'outils, oui. Il obtient 80,2% sur SWEBench Verified contre 77,6% pour son modèle parent, tourne à 131 tokens de sortie par seconde et facture 1,20 dollar par million de tokens de sortie. Pour tout ce qui doit être factuellement juste sans couche de récupération (retrieval), il faut être prudent : SimpleQA Verified tombe à 20,6% contre 43,9% pour le parent. Mon verdict rapide sur Inkling-Small : un excellent exécutant et une encyclopédie médiocre.
Inkling-Small est-il meilleur qu'Inkling ?
Selon le propre tableau de son fabricant, il gagne en code, en usage agentique d'outils et en respect des instructions, et perd en mathématiques, en factualité et en audio. De façon indépendante, Artificial Analysis place Inkling-Small à 40 sur son Intelligence Index contre 41 pour Inkling, ce qui les situe au même niveau. Le petit modèle est plus rapide et bien moins cher, donc pour la plupart des tâches, c'est le meilleur choix.
Combien coûte Inkling-Small ?
La sortie coûte 1,20 dollar par million de tokens, contre 4,05 dollars pour le modèle complet. L'entrée se situe entre 0,30 et 0,50 dollar par million selon le fournisseur utilisé. Les poids eux-mêmes sont gratuits sous licence Apache 2.0. Si vous raisonnez plutôt en budget support qu'en budget dev, les chiffres qui comptent sont dans coût du service client IA et coût par résolution.
Peut-on faire tourner Inkling-Small en local ?
Oui, et c'est la partie la plus solide de l'histoire. Unsloth indique 543 Go en BF16, qui descend à 89 Go avec une quantification en 2 bits, ce qui tient dans une station de travail dotée de 128 Go de mémoire unifiée. Le modèle Inkling complet de 975B nécessite 1 900 Go en BF16, à titre de comparaison. Si l'objectif est l'auto-hébergement, le panorama plus large est couvert dans meilleurs agents d'IA open source.
Inkling-Small est-il adapté au support client ?
Pas seul, et les chiffres de factualité en sont exactement la raison. Un modèle qui obtient -9,0 sur AA Omniscience répond avec assurance au-delà des limites de ce qu'il sait réellement, ce qui, dans une file de support, revient à promettre une politique de remboursement qui n'existe pas. Il a besoin d'être ancré dans votre propre documentation, plus d'un routage par niveau de confiance, ce qu'ajoute justement une plateforme de service client IA. Le mécanisme est détaillé dans hallucinations de l'IA en support.
Quelle est la fenêtre de contexte d'Inkling-Small ?
La fiche du modèle annonce 1M de tokens, et Unsloth confirme 1 048 576. Il vaut mieux le savoir avant de bâtir un plan là-dessus : OpenRouter l'expose actuellement à 524 288 tokens, donc l'API routée ne donne que la moitié de ce que les poids supportent. Le comportement en contexte long en général est traité dans taille de la fenêtre de contexte.
Inkling-Small est-il gratuit et open source ?
Les poids sont sous licence Apache 2.0 sur Hugging Face sous thinkingmachines/Inkling-Small, donc l'auto-hébergement et l'usage commercial sont possibles. Gratuit à télécharger ne veut pas dire gratuit à exécuter, et la facture matérielle remplace celle des tokens. Thinking Machines vend aussi un accès via Tinker, sa plateforme hébergée de fine-tuning.
Qui fabrique Inkling-Small et quand a-t-il été lancé ?
Thinking Machines Lab, fondée par l'ancienne directrice technique d'OpenAI Mira Murati, l'a lancé le 30 juillet 2026, quinze jours après le Inkling complet. C'est sa deuxième sortie en poids ouverts, et la liste de ce à quoi il fait face se trouve dans alternatives à Inkling.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Illustration d'une puce de modèle compacte routant un token vers deux chemins d'experts allumés parmi beaucoup d'éteints, pour un explicatif Inkling-Small
Trending

Inkling-Small expliqué : un modèle de 276B dont 12B font le travail

Ce qu'est vraiment Inkling-Small : un MoE à poids ouverts de 276B/12B signé Thinking Machines, la fenêtre de contexte sur laquelle la documentation et les fournisseurs ne s'accordent pas, ce que coûte réellement un million de tokens, et sa place dans une pile de support.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration éditoriale représentant une comparaison de modèles d'IA en tant qu'alternatives à Inkling
Trending

8 meilleures alternatives à Inkling en 2026

Inkling est ouvert et intéressant, mais il est cher pour un modèle à poids ouverts et ce n'est pas le modèle le plus intelligent que vous puissiez utiliser. Voici les 8 alternatives que j'essaierais vraiment, avec de vrais prix et les points forts de chacune.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Illustration d'Inkling, le modèle d'IA à poids ouverts de Thinking Machines Lab passé en revue
Trending

Avis sur Inkling : le modèle ouvert de Thinking Machines vaut-il le coup ?

Un avis honnête sur Inkling : ce dans quoi le premier modèle à poids ouverts de Thinking Machines Lab excelle vraiment, où le prix et les benchmarks déçoivent, et qui devrait vraiment l'utiliser.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustration d'Inkling, le modèle d'IA à poids ouverts de Thinking Machines Lab
Trending

Inkling expliqué : le modèle d'IA à poids ouverts de Thinking Machines

Ce qu'est vraiment Inkling : le premier modèle à poids ouverts de Thinking Machines Lab, ses vrais benchmarks, ce qu'il coûte à faire tourner, et s'il a sa place près d'une file de support.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Illustration of a developer at a laptop watching an agentic coding loop run through code, checks and a bot
Trending

Claude Opus 5 à l'essai : un codage quasi frontière pour moitié moins cher

Un test concret de Claude Opus 5 : ce que disent vraiment les benchmarks, le taux d'hallucination qui a grimpé, et sa place ou non dans une file de support en production.

Alicia Kirana UtomoAlicia Kirana UtomoJul 27, 2026
Illustration d'un modèle de contrôle de robot humanoïde, représentant Gemini Robotics 2
Trending

Gemini Robotics 2 : ce que montrent les chiffres de DeepMind

Gemini Robotics 2 lance trois modèles et un tableau de réussite par tâche où la plupart des scores restent sous 80%. Ce tableau est ce qu'il y a de plus utile dans toute cette sortie.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Illustration d'un modèle produisant des panneaux d'image, de vidéo et d'audio, représentant FLUX 3 de Black Forest Labs
Trending

FLUX 3 : ce que Black Forest Labs a réellement livré

FLUX 3 est un seul modèle pour l'image, la vidéo, l'audio et les actions robotiques. Il n'a pourtant ni API, ni prix, ni poids ouverts pour l'instant. Voici ce que vous pouvez obtenir et ce que vous ne pouvez pas.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration de panneaux d'image, de vidéo et de documents alimentant un modèle vision-langage, avec le logo Qwen
Trending

Qwen 3.7 Flash : spécifications, tarifs et ce qu'il fait vraiment

Qwen 3.7 Flash a été lancé sans article de blog, sans benchmarks et sans poids ouverts. Voici la fiche technique complète, la tarification par paliers, et ce que Qwen n'a jamais prétendu.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Illustration comparing a heavyweight reasoning model against a fast balanced model on cost and capability
Trending

Claude Opus 5 vs Sonnet 5 : lequel utiliser ?

Claude Opus 5 coûte 1,7x le prix par token de Sonnet 5, et termine pourtant certaines tâches moins cher. Voici la comparaison directe sur le prix, les benchmarks et le coût réel par tâche.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement