Inkling-Small expliqué : un modèle de 276B où 12B font le travail

Rama Adi Nugraha
Écrit par

Rama Adi Nugraha

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 4, 2026

Vérifié par un expert
Illustration d'une puce de modèle compacte qui achemine un token le long de deux chemins d'experts allumés parmi de nombreux autres éteints, pour un article explicatif sur Inkling-Small

Ce qu'est vraiment Inkling-Small

Thinking Machines Lab est la société de Mira Murati, et son modèle d'affaires consiste à offrir les poids et à vendre l'outillage qui les entoure. Inkling-Small est le deuxième modèle à sortir : Apache 2.0, publié sur Hugging Face sous le nom thinkingmachines/Inkling-Small, et téléchargé environ 15 500 fois lors de son premier mois.

Le fournisseur le décrit comme faisant "un quart de la taille" de l'original, et pour une fois le chiffre marketing tient la route. Le parent est à 975B au total / 41B actifs sur 66 couches. Celui-ci est à 276B au total / 12B actifs sur 42 couches. C'est effectivement très proche d'un quart sur les deux mesures.

Illustration du routage mixture-of-experts dans Inkling-Small, montrant 6 experts allumés parmi de nombreux autres plus 2 experts partagés, avec 276B au total et 12B actifs par token
Illustration du routage mixture-of-experts dans Inkling-Small, montrant 6 experts allumés parmi de nombreux autres plus 2 experts partagés, avec 276B au total et 12B actifs par token

L'architecture est un Mixture-of-Experts plutôt agressif. Chaque couche contient 256 experts, et le routeur en sélectionne 6 par token, plus 2 experts partagés toujours actifs. L'attention est hybride, alternant couches locales et globales, et les poids sont livrés à la fois en BF16 et en NVFP4. L'entraînement s'est déroulé sur du matériel NVIDIA GB300 NVL72.

La conséquence pratique de cette forme : vous payez 276B en mémoire et 12B en calcul. C'est tout le truc, et c'est pourquoi un modèle avec un quart de billion de paramètres peut servir plus vite qu'un modèle dense d'un dixième de sa taille. Si le vocabulaire du MoE vous est nouveau, la mécanique se généralise à la plupart des agents IA open source actuels.

Il existe aussi un curseur d'effort de raisonnement qui va de 0 à 0,99, avec les paliers suggérés par le fournisseur à 0,2 pour faible, 0,7 pour moyen et 0,99 pour maximum. C'est un réglage sur la durée pendant laquelle le modèle réfléchit avant de répondre, et il fait varier votre facture de tokens plus que tout autre paramètre que vous toucherez.

Ce qui entre, et ce qui sort

C'est le point que les gens comprennent le plus souvent mal, il vaut donc la peine d'être direct.

Diagramme montrant Inkling-Small acceptant du texte, de l'image et de l'audio en entrée mais ne produisant que du texte en sortie, sans synthèse vocale
Diagramme montrant Inkling-Small acceptant du texte, de l'image et de l'audio en entrée mais ne produisant que du texte en sortie, sans synthèse vocale

Les entrées sont du texte, des images entre 40 et 4096 pixels, et de l'audio en WAV 16 kHz de moins de deux minutes. La sortie est uniquement du texte. Il n'y a pas de synthèse vocale dans ce modèle.

Cela compte si vous prévoyiez une ligne téléphonique. Un modèle qui entend l'audio mais ne peut pas parler n'est que la moitié d'un pipeline vocal, et il vous faut encore la synthèse vocale, la téléphonie, la gestion du barge-in et la détection de tour de parole en plus. Si c'est votre projet, le panorama des fournisseurs dans les entreprises de voix IA est un meilleur point de départ qu'un modèle brut.

La compréhension audio est aussi la seule capacité où le petit modèle a perdu du terrain face à son parent sur toute la ligne : VoiceBench 90,1 contre 91,4, Audio MC 54,9 contre 56,6, MMAU 77,0 contre 77,2. Les écarts sont faibles, mais tous vont dans la même direction.

La fenêtre de contexte sur laquelle personne ne s'accorde

Voici un constat vérifiable qui a pris deux minutes et vous épargne un après-midi.

La fiche du modèle indique que la fenêtre de contexte est de 1M de tokens. OpenRouter, l'un des deux seuls fournisseurs à le proposer, l'héberge à 524 288 tokens. C'est exactement la moitié, ce qui indique une décision d'hébergement délibérée plutôt qu'une coquille.

Aucun des deux chiffres n'est un mensonge. L'un décrit ce que l'architecture peut adresser, l'autre ce qu'un point de terminaison précis acceptera aujourd'hui. Le mode de défaillance consiste à concevoir un pipeline de bourrage de documents en fonction du chiffre de la fiche et à se heurter à un mur en production. Si vous construisez quelque chose qui s'appuie sur une longue fenêtre, lisez le plafond sur le point de terminaison que vous appelez réellement. Le même piège touche les utilisateurs d'agents de codage, ce qui m'a amené à traiter la taille de la fenêtre de contexte séparément.

Le nombre de fournisseurs est l'autre point faible : 2 fournisseurs, contre 4 pour le modèle parent. Pour un modèle qui entame son cinquième jour de deuxième semaine, c'est attendu, mais cela signifie moins de marge en cas de basculement.

Ce qu'il coûte

La tarification de la sortie est établie. 1,20 $ par million de tokens de sortie, confirmé par le fournisseur, Artificial Analysis et OpenRouter. Face aux 4,05 $ du parent, c'est le titre.

La tarification de l'entrée n'est pas établie, et je préfère vous le dire plutôt que choisir un chiffre pour paraître sûr de moi :

SourceEntrée par 1MSortie par 1M
Artificial Analysis0,30 $1,20 $
Page du modèle OpenRouter0,45 $1,20 $
Réponse de l'API OpenRouter0,50 $1,20 $
Modèle parent (Inkling)référence4,05 $

Budgétez sur la base de 0,50 $ et rien ne vous surprendra. Sur une base mixte, Artificial Analysis situe Inkling-Small à 0,22 $ par million contre 0,72 $ pour le parent, soit environ un tiers du coût pour le même niveau d'intelligence.

La vitesse est la moitié sous-estimée de l'affaire. 131,1 tokens de sortie par seconde contre 84,8 pour le parent, avec un délai avant le premier token de 1,65 s contre 1,82 s. Sur son Intelligence Index, le petit modèle obtient 40 points et se classe 15e sur 101, contre 41 points et 13e place pour le parent. Même niveau, plus rapide, moins cher. C'est une combinaison inhabituelle et la principale raison de s'intéresser à cette sortie.

Le fine-tuning se fait via la propre plateforme Tinker de Thinking Machines, qui prend en charge le modèle. Les tarifs d'entraînement par token ne sont publiés nulle part où j'ai pu les trouver, et la page de tarification sur tinker-docs.thinkingmachines.ai/pricing renvoie actuellement une erreur 404. Le stockage des checkpoints coûte 0,10 $ par Go et par mois. Si le fine-tuning est le plan, l'arbitrage face à la récupération est exposé dans RAG versus fine-tuning.

L'exécuter soi-même

C'est là que le "gratuit" des poids gratuits est mis à l'épreuve. Les versions quantifiées d'Unsloth donnent des chiffres réels là-dessus, et le chiffre en 2 bits est le plus intéressant : 89 Go, ce qui tient dans une machine à mémoire unifiée de 128 Go.

Il y a un joli détail dans la discussion de lancement. Un commentateur sur Hacker News, andy99, a dit qu'il espérait quelque chose autour de 90 Go avant que la moindre version quantifiée ne soit publiée. Unsloth est arrivé à 89.

Vérification d'adéquation pour l'auto-hébergement
Qu'est-ce qui tient vraiment sur votre matériel ?
Choisissez la machine que vous avez. Les chiffres proviennent des versions quantifiées d'Unsloth et de la fiche de Thinking Machines.
Le 2 bits tient, à 89 Go
Tient : 2 bits (89 Go)
Juste à la limite : 3 bits (128 Go)
Trop gros : 4 bits (132-170 Go), NVFP4 (180 Go+), BF16 (543 Go)
C'est le résultat phare de cette sortie : un modèle d'un quart de billion de paramètres sur une seule machine de bureau. Attendez-vous à une perte de qualité en 2 bits, et testez-le sur vos propres prompts plutôt que de faire confiance aux benchmarks.
Le 3 bits tient, le 4 bits ne passe pas tout à fait
Tient : 2 bits (89 Go), 3 bits (128 Go)
Trop gros : le 4 bits commence à 132 Go, NVFP4 (180 Go+), BF16 (543 Go)
Frustrant, tellement proche. Le bas de la fourchette du 4 bits est à 132 Go contre vos 141 Go de VRAM brute, et le cache KV pour un long contexte mange la différence.
Le NVFP4 tient, et le 4 bits aussi, confortablement
Tient : NVFP4 (180 Go+ requis), 4 bits (132-170 Go), 3 bits, 2 bits
Trop gros : BF16 (543 Go)
C'est le point idéal pour le service. Le NVFP4 est ici un format livré de première classe plutôt qu'une conversion communautaire, c'est donc celui à privilégier.
Les poids BF16 complets tiennent
Tient : BF16 (543 Go), et tout ce qui est en dessous
Suggestion de la fiche : 4x B300 ou 8x H200 pour le BF16
Si vous possédez autant de silicium, vous connaissez déjà la réponse. À noter : le modèle parent nécessite environ 2 To en BF16, donc le petit est le premier des deux à tenir sur un seul nœud.
Utilisez l'API hébergée
Sortie : 1,20 $ par million de tokens
Entrée : 0,30 $ à 0,50 $ par million, selon la source
Fournisseurs : 2 aujourd'hui
À ces tarifs, il faudrait un gros volume avant que posséder du matériel ne soit rentable, et le nombre de deux fournisseurs signifie un basculement limité. Réglages d'échantillonnage : température 1,0, top_p 1,0, min_p 0,0.

Deux remarques pratiques si vous partez en local. L'échantillonnage devrait être à température 1,0, top_p 1,0, min_p 0,0, ce qui est suffisamment inhabituel pour être noté. Et le support llama.cpp est arrivé via la PR #25731, alors vérifiez que votre build l'inclut avant de déboguer des problèmes fantômes.

Où il trouve sa place, et où vraiment pas

Sur son propre tableau comparatif du fabricant, le petit modèle bat son parent de 975B sur la plupart de ce qu'on appellerait l'exécution. SWEBench Verified 80,2 contre 77,6, SWEBench Pro 55,9 contre 54,3, Terminal Bench 2.1 à 64,7 contre 63,8, Toolathlon 54,4 contre 45,5, MCP Atlas 79,6 contre 76,0, GPQA 89,5 contre 87,2, IFBench 82,2 contre 79,8.

Puis il y a l'autre colonne. AIME glisse à 95,5 depuis 97,1. Global-MMLU-Lite chute à 86,7 depuis 88,7, ce qui vaut la peine d'être signalé si vous envisagiez un agent de support multilingue par-dessus. Et Tau 3 Banking tombe à 15,5 depuis 23,7, la régression la plus marquée de la feuille, sur un benchmark spécifiquement consacré à l'usage d'outils multi-tours dans un contexte orienté client.

La paire la plus importante pour quiconque envisage du travail de support est SimpleQA Verified à 20,6 % contre 43,9 % pour le parent, avec un score Omniscience de -9,0 contre +2,1 pour le parent. Un score Omniscience négatif signifie que le modèle a tort avec plus d'assurance qu'il n'a raison. Personne dans les fils de lancement ne l'a mentionné, ce qui est dommage, car c'est le chiffre le plus déterminant pour la décision dans toute cette sortie.

Je veux être juste ici, car c'est un choix de conception plutôt qu'un défaut. Un modèle à 12B actifs a moins de place pour mémoriser le monde qu'un modèle à 41B actifs, et Thinking Machines a clairement dépensé cette place dans le raisonnement et l'usage d'outils à la place. Si votre modèle va chercher l'information de toute façon, les connaissances mémorisées sont un poids mort. C'est le bon pari pour un agent.

C'est le mauvais pari pour un bot qui répond aux questions de mémoire. C'est exactement le type de défaillance que j'ai vu se produire en direct. Une équipe de support technique B2B avec laquelle j'ai travaillé a découvert que son bot confirmait "oui, nous prenons en charge votre modèle de véhicule" pour des véhicules qui n'étaient pas dans sa base de données, parce que le centre d'aide disait que l'entreprise prenait en charge tous les modèles. Le modèle n'était pas défectueux. Il faisait de l'inférence assurée sur une source vague, exactement ce qu'un score Omniscience négatif prédit. J'ai détaillé tout le schéma dans la prévention des hallucinations.

Donc la lecture honnête : utilisez Inkling-Small là où une couche de récupération fournit les faits et le modèle fournit le raisonnement. Ne l'utilisez pas comme source de vérité.

Ce qui signifie que la qualité de vos sources devient le plafond de la précision du modèle, et bien les choisir est un levier plus important que le choix du checkpoint. Mon tour d'horizon des outils de base de connaissances est le point de départ pratique.

Ce que cela signifie si vous mettez de l'IA sur une file de support

Un modèle est un moteur, pas une voiture. Cette distinction est au cœur de agents IA contre chatbots, et c'est pourquoi un tableau de benchmarks vous dit si peu sur une file d'attente.

L'écart entre "ça obtient de bons benchmarks" et "ça répond à mes clients" est le produit dans son entier, et il est fait surtout de composants peu glamours :

  • Ancrage (grounding). Le modèle doit lire votre centre d'aide, vos macros et vos tickets résolus, pas ses données d'entraînement. C'est le rôle d'une couche comme un chatbot de base de connaissances IA.
  • Routage par confiance. Quelque chose doit décider quand le modèle ne devrait pas répondre du tout, ce qui est au cœur de la gestion d'escalade IA.
  • Un essai à blanc. Vous voulez connaître le taux de résolution avant les clients, pas après. La simulation sur votre propre historique de tickets est la seule façon honnête d'obtenir ce chiffre.
  • Transfert (handoff). Quand l'IA s'arrête, un humain reprend la conversation en cours avec le contexte complet, selon les meilleures pratiques de transfert. La version plus douce de cela est un copilote IA, où le modèle rédige et un humain envoie.
  • Mesure. Le taux de déviation (deflection) est le chiffre qui décide si tout cela a fonctionné. Traduisez-le en argent avec le coût par résolution.
  • Couverture. Savoir quels sujets l'IA devrait prendre en charge du tout est un exercice à part, exposé dans ce guide de déviation de tickets.

Une responsable CX de compléments alimentaires DTC à qui j'ai parlé a formulé l'exigence en une phrase : "I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone." Aucun checkpoint de modèle ne vous donne cela. Un seuil de confiance et une règle de routage, oui, intégrés dans le système de tickets IA que vous utilisez déjà.

Le volet métriques de cette décision mérite d'être lu séparément, car "résolu" signifie des choses différentes selon les équipes. Commencez par les métriques de support, puis la résolution au premier contact.

C'est aussi la réponse à la question construire-versus-acheter que soulève naturellement un checkpoint gratuit sous Apache 2.0. Les poids sont la partie la moins chère du projet. Les 0,50 $ par million de tokens d'entrée sont la partie la moins chère du projet. Les parties coûteuses sont le pipeline de récupération, le harnais d'évaluation, la logique d'escalade et la personne qui maintient les trois le trimestre prochain.

Le tableau de bord du helpdesk eesel AI, montrant des réponses rédigées par l'IA et un routage par confiance sur une file de tickets en direct
Le tableau de bord du helpdesk eesel AI, montrant des réponses rédigées par l'IA et un routage par confiance sur une file de tickets en direct

Envie d'utiliser un modèle comme celui-ci sur de vrais tickets ?

Si le prix et la vitesse d'Inkling-Small ont attiré votre attention, ce que vous voulez en réalité, c'est cette économie enveloppée dans des garde-fous. eesel se connecte à Zendesk, Freshdesk et le reste de votre pile, s'entraîne sur vos tickets passés et votre centre d'aide plutôt que sur la mémoire d'un modèle, et vous permet de simuler l'ensemble du processus sur votre historique de tickets avant qu'un seul client ne le voie. Vous fixez le seuil de confiance ; tout ce qui est en dessous part vers un humain avec le contexte attaché. Gratuit à essayer, et vous verrez votre propre taux de résolution avant de vous engager.

Essayer eesel

Comment il se positionne face aux autres options en poids ouverts

La catégorie des poids ouverts est encombrée et les différences sont plus resserrées que ne le suggèrent les articles de lancement.

Inkling-SmallInkling (parent)DeepSeek V4 Flash
Paramètres276B / 12B actifs975B / 41B actifstaille comparable
Entréestexte, image, audiotexte, image, audiotexte uniquement
Sortie par 1M1,20 $4,05 $plus bas
Vitesse131,1 tok/s84,8 tok/strès rapide
AA Intelligence Index40 (#15)41 (#13)voir le test

La lecture de la communauté a été courte et raisonnablement juste. Le fil principal sur Hacker News n'a attiré que 33 points et deux commentaires, dont l'un notait que c'est "About the same size as DeepSeek Flash 4, but also supports audio and image input." C'est le différenciateur en une phrase : entrée multimodale à un prix de petit modèle.

Le voisin le plus proche en prix et en forme est DeepSeek V4 Flash, qui le sous-cote par token mais n'accepte que du texte.

À l'autre bout de l'échelle, Kimi K3 facture des tarifs de pointe pour des poids ouverts, ce qui rend les 1,20 $ d'Inkling-Small généreux en comparaison.

Si vous voulez la version en forme de verdict de cet article plutôt que l'explicatif, c'est le test d'Inkling-Small. Le parent de 975B a aussi son propre article explicatif Inkling.

Deux autres à consulter avant de trancher : mon test d'Inkling traite du problème de tarification du parent, et les alternatives à Inkling cartographient le champ plus large.

Chiffres de sécurité, pour être complet : StrongREJECT 98,4, FORTRESS 71,6 et 96,9, MMMU Pro 74,0, ARC-AGI-1 84,0, ARC-AGI-2 40,1, SciCode 48,7, CritPt 8,3, AA-Briefcase 917, GDPval-AA v2 1269 contre 1238 pour le parent.

Mon avis

Inkling-Small est le plus intéressant des deux sorties Inkling, et je le dis en tant que personne qui n'avait pas été convaincue par la tarification de la première. Il est plus rapide et coûte environ un tiers d'un modèle qu'il surpasse dans l'ensemble, il accepte l'audio et les images, et à 89 Go quantifié, c'est le premier modèle de cette catégorie qu'une petite équipe peut posséder entièrement.

Les réserves sont précises plutôt que vagues. Lisez le plafond de contexte réel de votre fournisseur plutôt que celui de la fiche. Budgétez l'entrée à 0,50 $. Et ne le traitez pas comme une source de connaissance, car un score Omniscience de -9,0 vous dit d'avance qu'il aura tort avec assurance.

Pour tout ce qui touche au client, le modèle est la décision facile. La couche d'automatisation autour de lui est celle qui déterminera si ça fonctionne, et cela reste vrai quel que soit le checkpoint qui l'emportera le mois prochain.

Si cet article vous fait peser un déploiement plutôt qu'un simple téléchargement, commencez par la déviation de niveau 1. Déterminez ensuite où le modèle ne devrait pas répondre du tout, ce qui est le rôle du triage des tickets.

Sources

  • Fiche modèle de Thinking Machines Lab, thinkingmachines/Inkling-Small sur Hugging Face (architecture, tableau de benchmarks, recommandations matérielles, réglages d'échantillonnage)
  • Artificial Analysis (Intelligence Index, débit, TTFT, tarification mixte, Omniscience)
  • Page modèle et API d'OpenRouter (fenêtre de contexte servie, tarification en entrée, nombre de fournisseurs)
  • Tailles des versions quantifiées d'Unsloth
  • Fil de lancement sur Hacker News
  • eesel Customer Voice Dossier (GENERAL BYTES, avec permission ; extraits anonymisés de support technique B2B et de compléments alimentaires DTC)

Questions fréquentes

Qu'est-ce qu'Inkling-Small ?
Inkling-Small est le deuxième modèle en poids ouverts de Thinking Machines Lab, publié le 30 juillet 2026 sous licence Apache 2.0. C'est un modèle Mixture-of-Experts avec 276B de paramètres au total et 12B actifs par token, si bien qu'il coûte à faire tourner à peu près comme un modèle de 12B tout en transportant les connaissances d'un modèle de 276B. Il prend en entrée du texte, des images et de l'audio, et produit du texte en sortie. C'est le petit frère d'Inkling, qui est à 975B au total / 41B actifs.
Inkling-Small est-il gratuit et open source ?
Les poids sont sous licence Apache 2.0, donc vous pouvez les télécharger, les affiner (fine-tuning) et les déployer commercialement sans redevance de licence. Des poids gratuits ne veulent toutefois pas dire une inférence gratuite : la plus petite version quantifiée utilisable pèse environ 89 Go, et les poids complets en BF16 font 543 Go. Si vous préférez ne pas posséder ce matériel, deux fournisseurs hébergés le proposent. D'autres options figurent dans mon tour d'horizon des meilleurs agents IA open source.
Combien coûte Inkling-Small ?
La sortie coûte 1,20 $ par million de tokens, ce sur quoi toutes les sources s'accordent. C'est sur l'entrée que ça devient trouble : Artificial Analysis indique 0,30 $, la page du modèle sur OpenRouter dit 0,45 $, et l'API d'OpenRouter elle-même renvoie 0,50 $. Budgétez sur la base de 0,50 $ et vous n'aurez pas de surprise. Pour ce que cela signifie côté économie du support plutôt que côté économie du développement, voir AI customer service cost.
Quelle est la fenêtre de contexte d'Inkling-Small ?
La fiche du modèle indique 1M de tokens. OpenRouter le sert à 524 288, soit exactement la moitié. Les deux chiffres sont réels, ils décrivent simplement des choses différentes : ce que l'architecture supporte face à ce qu'un fournisseur a choisi d'héberger. Vérifiez le plafond sur le point de terminaison que vous appelez réellement avant de concevoir quoi que ce soit autour. Le même écart piège les gens avec les agents de codage, sujet que j'ai traité dans la fenêtre de contexte de Claude Code.
Puis-je exécuter Inkling-Small localement ?
Oui, si vous avez la mémoire nécessaire. Les versions quantifiées d'Unsloth vont de 543 Go en BF16 à 89 Go en 2 bits, et ce chiffre de 89 Go est ce qui rend viable une station de travail à mémoire unifiée de 128 Go. La fiche de Thinking Machines elle-même demande au moins 600 Go de VRAM pour le BF16 et 180 Go pour le NVFP4. Le support llama.cpp nécessite que la PR #25731 soit fusionnée dans votre build.
Inkling-Small est-il bon pour le support client ?
C'est un excellent exécutant et une mauvaise encyclopédie. SimpleQA Verified tombe à 20,6 % contre 43,9 % pour son modèle parent, et son score Omniscience sur Artificial Analysis est de -9,0, ce qui signifie qu'il donne plus de réponses fausses avec assurance que de réponses justes. Enveloppez-le de récupération (retrieval) et de routage par confiance, et ça devient correct. Pointez-le brut sur une file de tickets et vous obtenez le mode de défaillance décrit dans AI hallucination prevention.
Comment Inkling-Small se compare-t-il à DeepSeek V4 Flash et Kimi K3 ?
Il est dans la même catégorie de poids ouverts, et les compromis diffèrent selon la tâche. DeepSeek V4 Flash est moins cher par token et uniquement textuel ; Kimi K3 est tarifé à des taux de pointe. Le différenciateur d'Inkling-Small est l'entrée audio et image native à un prix de petit modèle. Un commentateur sur Hacker News l'a résumé ainsi : "About the same size as DeepSeek Flash 4, but also supports audio and image input."
De quel matériel Inkling-Small a-t-il besoin ?
Pour les poids complets en BF16, Thinking Machines suggère 4x B300 ou 8x H200. Le NVFP4 nécessite au moins 180 Go. En quantifié, l'échelle est de 132-170 Go en 4 bits, 128 Go en 3 bits et 89 Go en 2 bits. Si rien de tout cela n'est sur votre bureau, l'API hébergée est la solution pratique, et le calcul construire-versus-acheter est expliqué dans custom AI models.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Illustration d'une puce de modèle compacte routant un token vers deux chemins d'experts allumés parmi beaucoup d'éteints, pour un explicatif Inkling-Small
Trending

Inkling-Small expliqué : un modèle de 276B dont 12B font le travail

Ce qu'est vraiment Inkling-Small : un MoE à poids ouverts de 276B/12B signé Thinking Machines, la fenêtre de contexte sur laquelle la documentation et les fournisseurs ne s'accordent pas, ce que coûte réellement un million de tokens, et sa place dans une pile de support.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration d'Inkling, le modèle d'IA à poids ouverts de Thinking Machines Lab
Trending

Inkling expliqué : le modèle d'IA à poids ouverts de Thinking Machines

Ce qu'est vraiment Inkling : le premier modèle à poids ouverts de Thinking Machines Lab, ses vrais benchmarks, ce qu'il coûte à faire tourner, et s'il a sa place près d'une file de support.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Illustration comparant un petit noyau de modèle bien ordonné à un autre, bien plus grand et emmêlé, pour un avis sur Inkling-Small
Trending

Inkling-Small à l'essai : un quart de la taille, presque aussi malin

Un test concret d'Inkling-Small : il surpasse son propre modèle parent de 975B en code, avec un quart de la taille et un quart du prix, avant de s'effondrer sur la factualité. Voici ce que ce compromis coûte réellement.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Illustration d'Inkling, le modèle d'IA à poids ouverts de Thinking Machines Lab passé en revue
Trending

Avis sur Inkling : le modèle ouvert de Thinking Machines vaut-il le coup ?

Un avis honnête sur Inkling : ce dans quoi le premier modèle à poids ouverts de Thinking Machines Lab excelle vraiment, où le prix et les benchmarks déçoivent, et qui devrait vraiment l'utiliser.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustration éditoriale représentant une comparaison de modèles d'IA en tant qu'alternatives à Inkling
Trending

8 meilleures alternatives à Inkling en 2026

Inkling est ouvert et intéressant, mais il est cher pour un modèle à poids ouverts et ce n'est pas le modèle le plus intelligent que vous puissiez utiliser. Voici les 8 alternatives que j'essaierais vraiment, avec de vrais prix et les points forts de chacune.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Illustration de l'espace de travail super-agent Skywork AI
Trending

Qu'est-ce que Skywork AI ? L'espace de travail « super-agent » expliqué

Skywork AI est un super-agent d'IA généraliste qui crée diapositives, documents, feuilles de calcul, sites et vidéos. Voici ce qu'il fait, comment il fonctionne, et son prix.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Illustration d'un modèle de contrôle de robot humanoïde, représentant Gemini Robotics 2
Trending

Gemini Robotics 2 : ce que montrent les chiffres de DeepMind

Gemini Robotics 2 lance trois modèles et un tableau de réussite par tâche où la plupart des scores restent sous 80%. Ce tableau est ce qu'il y a de plus utile dans toute cette sortie.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Un agent IA sortant d'un écran pour manipuler des fenêtres d'applications et des documents pendant que deux collègues observent, dans la couleur de marque bleue de Meta
Trending

Meta Muse Spark 1.1 : ce que c'est, ce que ça coûte, où ça pêche

La première API de modèle payante de Meta lance un modèle agent à 1M de contexte pour $1,25/$4,25. Ce en quoi Muse Spark 1.1 est réellement bon, et les benchmarks que Meta a laissés hors de sa diapositive.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Illustration d'un modèle produisant des panneaux d'image, de vidéo et d'audio, représentant FLUX 3 de Black Forest Labs
Trending

FLUX 3 : ce que Black Forest Labs a réellement livré

FLUX 3 est un seul modèle pour l'image, la vidéo, l'audio et les actions robotiques. Il n'a pourtant ni API, ni prix, ni poids ouverts pour l'instant. Voici ce que vous pouvez obtenir et ce que vous ne pouvez pas.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement