8 meilleures alternatives à Inkling-Small en 2026
Kurnia Kharisma Agung Samiadjie
Katelin Teen
Dernière modification August 4, 2026

Pourquoi les gens regardent déjà au-delà d'Inkling-Small
Thinking Machines Lab a lancé Inkling-Small le 30-07-2026 sous licence Apache 2.0, quinze jours après le modèle parent. La promesse était raisonnable et le modèle la tient effectivement. Un quart de la taille du parent, plus rapide, et moins cher aussi, et selon la fiche du fournisseur lui-même, il dépasse même le parent sur SWE-bench Verified, 80,2 contre 77,6.
L'accueil sur r/LocalLLaMA avait pas mal à dire sur ce mot « small ». Le troisième commentaire le plus voté du fil de lancement ne parle pas du tout de benchmarks :
"Soon after all this 2-3T models they will say small for 500-700B models... crying with 12Gb Vram"
Justifié. Mais ce n'est pas le nom qui pousse qui que ce soit à quitter le modèle. Ce qu'il sait, si.
Artificial Analysis le situe à un Intelligence Index de 40, rang #15 sur 101, ce qui est plutôt honorable. Puis la même page rapporte le test de connaissance AA-Omniscience : un indice de -9,0, une précision de 30,5%, un taux d'hallucination de 56,9%. AA décrit cette évaluation comme mesurant « la fiabilité de connaissance et l'hallucination » sur une échelle de -100 à 100. Un nombre négatif à cet endroit n'est donc pas un artefact d'arrondi. C'est le modèle qui tend la main vers une réponse qu'il n'a pas.
La ventilation AA-Briefcase est la partie vers laquelle je reviens sans cesse. Un Elo global de 917,13, qui ne dit pas grand-chose tant qu'on ne le décompose pas : présentation à 1067,99 contre une qualité analytique de 797,13. Le modèle rédige une meilleure réponse qu'il n'en sait réellement.
Les personnes qui font tourner ces modèles sur leur propre matériel l'ont repéré vite, et sur un axe plus tranchant que celui des tableaux de benchmarks :
"But worse than GPT 5.5 Luna on the Omniscience Index, because it makes up too many answers. 84% Hallucination Rate, that's why I favor other open models, they are better at 'detecting' their incertitude."
Ce chiffre de 84% est plus élevé que les 56,9% actuellement affichés sur la page AA, donc considérez le chiffre exact comme leur lecture, pas la mienne. Dans tous les cas, l'argument tient, et c'est le bon argument à avancer. Ils choisissent un modèle selon s'il sait quand il ne sait pas, plutôt que sur la qualité avec laquelle il écrit du code.

Trois autres choses éloignent les gens de ce modèle. Le prix n'en fait pas partie.
La fenêtre de contexte n'est pas la fenêtre de contexte. AA liste le modèle à 1M tokens. Ce que ses deux fournisseurs servent réellement, c'est 256 000 (Thinking Machines) et 524 288 (DeepInfra). Donc quiconque a lu « 1M » sur la fiche et construit en se basant sur ce chiffre ne l'obtient pas. Même problème sur le modèle parent, où le meilleur chiffre servi est de 524k chez trois fournisseurs, et la ligne la moins chère et la plus rapide de DeepInfra plafonne à 131k.
Deux fournisseurs, c'est peu. Le parent en a trois, et le groupe qui sert DeepSeek ou GLM est encore plus grand. Le jour du lancement, le modèle n'était même pas sur OpenRouter, un manque qu'un commentateur a signalé sur Hacker News en même temps que les décomptes de paramètres. Les deux fournisseurs disponibles se comportent aussi différemment. DeepInfra tourne 1,43x plus vite sur une charge de 10k, puis prend du retard sur le fournisseur d'origine à 100k, 82,36 tokens par seconde contre 113,36. Votre profil de latence change avec la longueur du prompt, et c'est une chose terrible à découvrir en production.
Une couverture réduite laisse aussi moins de marge pour changer quand un fournisseur commence à rogner sur les coûts, ce qui arrive plus souvent que ne le laissent voir les benchmarks publiés :
"In fact we found that many inference providers are quantising the weights or even KV cache, and due to the low prices they serve at massive batches, resulting in unstable throughput."
Le prix n'est pas un seul chiffre. Le fournisseur d'origine est à $0.30 en entrée et $1.20 en sortie. DeepInfra demande $0.58 et $1.44 pour le contexte plus long. En mélange, AA affiche $0.222 avec son ratio par défaut de 7:2:1, tandis que le mélange classique 3:1 atterrit à $0.525. Donc, quel que soit le chiffre unique que vous finissez par citer, c'est en réalité un choix de ratio, et ce choix compte lorsque vous modélisez le coût du service client avec IA à grande échelle.
Pour être juste, rien de tout cela ne fait de ce modèle un mauvais modèle. Le raisonnement représente 95,5% de sa facture de sortie, exactement là d'où vient l'intelligence, et GPQA Diamond à 89,5% plus le raisonnement à contexte long à 63% sont des chiffres réels. La chose est un exécutant. Le problème ne commence que lorsqu'on demande à un exécutant d'être un connaisseur.
Comment j'ai choisi ces huit modèles
J'écris beaucoup de ces tours d'horizon et le piège ne change jamais. Classer par benchmark, publier, passer à autre chose. J'ai donc gardé le filtre ici plus étroit.
Chacun des huit devait être quelque chose vers lequel un utilisateur d'Inkling-Small pouvait basculer cette semaine même, donc une API publique en service avec des prix publiés, sans liste d'attente. Chaque prix provient de la page de facturation du fournisseur lui-même, en date du 05-08-2026, plutôt que d'un site comparateur, car les chiffres de ces sites deviennent obsolètes en quinze jours. Là où un fournisseur publie à la fois le contexte servi et le contexte annoncé, j'ai vérifié l'un contre l'autre. J'ai aussi lu les licences, et c'était important, car deux modèles ici cachent des seuils de revenus dans les leurs.
Ce que je n'ai pas fait, c'est prétendre que six mois de trafic de production sont passés par les huit. J'ai lu la documentation et les pages de facturation, les fiches modèles, les mesures d'AA, puis je n'ai dit que ce que cela permet d'appuyer.
Les meilleures alternatives à Inkling-Small en un coup d'œil
Tous les prix ci-dessous sont par million de tokens en USD, vérifiés le 05-08-2026.
| Model | Best for | Weights | Params | Input | Output | Real context | Modalities in | The catch |
|---|---|---|---|---|---|---|---|---|
| Inkling-Small (baseline) | Cheap agentic execution | Apache 2.0 | 276B / 12B active (266B per AA) | $0.30 | $1.20 | 256K first-party, 524,288 on DeepInfra | Text, image, audio | Knowledge index -9.0 |
| DeepSeek V4 Flash | Same job, a quarter the cost | MIT | 284B / 13B | $0.14 | $0.28 | 1M | Text | A 2x peak surcharge is announced |
| Inkling | Staying in the family, knowing more | Apache 2.0 | 975B / 41B | $1.00 | $4.05 | 524K best, 131K cheapest | Text, image, audio | Two AA pages quote different prices |
| GLM-5.2 | Strongest open weights you can host | MIT | ~753B total | $1.40 | $4.40 | 1M | Text | 128K output cap |
| MiniMax M3 | Video in, at Inkling-Small's price | Custom community licence | 428B / 23B | $0.30 | $1.20 | 1M, 512K guaranteed | Text, image, video | Non-commercial by default |
| Kimi K3 | Long-horizon agent work | Custom (Kimi K3 Licence) | 2.8T | $3.00 | $15.00 | 1,048,576 | Text | No batch tier, 3 RPM on entry tier |
| Qwen3.8-Max | Closed model, generous window | Closed | Undisclosed | $2.00 | $6.00 | 1M | Text | Two prices for one model |
| Gemini 3.6 Flash | Audio in with no premium | Closed | Undisclosed | $1.50 | $7.50 | 1,048,576 | Text, image, video, audio, PDF | 65,536 output ceiling |
| Claude Opus 5 | When wrong answers cost money | Closed | Undisclosed | $5.00 | $25.00 | 1M, no surcharge | Text, image | Newer tokenizer emits ~30% more tokens |
1. DeepSeek V4 Flash
Best for: faire ce que fait Inkling-Small, pour environ un quart du coût de sortie.
C'est la comparaison vers laquelle un vrai utilisateur d'Inkling-Small se tourne en premier, et ce fut aussi le commentaire le plus consistant du fil de lancement de r/LocalLLaMA :
"I wonder how it compares to DSV4 Flash. Comparable on Artificial Analysis intelligence benchmark (both 40). Seems to do slightly better coding / agentic workflows though."
Voilà de quoi il s'agit. DeepSeek V4 Flash tourne avec 284B au total et 13B actifs, à côté des 12B d'Inkling-Small, et AA place les deux à 40. Moteur similaire. Facture pas si similaire.
Il y a une chose que les décomptes de paramètres cachent, et elle compte si l'auto-hébergement est dans vos plans. DeepSeek est distribué nativement dans un mélange de FP4 et FP8 là où Inkling-Small est distribué en bf16, si bien qu'un opérateur local a estimé qu'à précision native, cela donnait environ 160Go contre 540Go. Sur le papier, une taille à peu près similaire. En pratique, trois fois plus de mémoire.
Features. Des poids sous licence MIT sur Hugging Face, plus une fenêtre de contexte de 1M et une sortie maximale de 384K, la plus grande de cette liste et de loin. La limitation de débit fonctionne par concurrence plutôt que par requêtes par minute, avec un plafond publié de 2 500 requêtes simultanées par compte.
Pros. L'économie du cache est la vraie histoire ici. Un hit de cache coûte $0.0028 par million de tokens d'entrée, 50 fois en dessous du taux de cache manqué de $0.14, donc tout ce qui a un prompt système stable devient absurdement bon marché. Et MIT est la licence la plus propre du groupe, pas de seuil de revenus, pas de clause d'attribution.
Cons. Texte uniquement, donc tout audio que vous donniez à Inkling-Small n'a plus nulle part où aller. Il y a aussi une note en bas de la page de tarification annonçant une future surtaxe de 2x aux heures de pointe entre 09h00 et 12h00 et 14h00 et 18h00 heure de Pékin, avec une date d'entrée en vigueur « sous réserve de l'annonce officielle ». Une inconnue connue, logée dans votre modèle de coûts.
Pricing. $0.14 en entrée et $0.28 en sortie par million, hits de cache à $0.0028. Pro se situe à $0.435 et $0.87, soit exactement 3,1x Flash des deux côtés. Les exemples chiffrés sont dans notre analyse des prix de DeepSeek V4 Flash, et nous l'avons comparé à Kimi K3 séparément.
My take: si l'argent est votre raison de partir, arrêtez de lire ici. Si c'est la précision, continuez, parce que devenir moins cher n'a jamais fait qu'un modèle sache davantage.
2. Inkling, the parent
Best for: rester sur les mêmes poids, les mêmes outils et la même licence tout en rachetant la fiabilité factuelle.

Souvent, l'alternative la plus intéressante à un petit modèle est le grand dont il a été distillé, et ici les chiffres le démontrent proprement. Sous la même méthodologie d'AA, Inkling obtient un Intelligence Index de 41 contre 40 pour Small, donc match nul. C'est sur AA-Omniscience qu'ils se séparent : 2,05 avec 39,95% de précision, contre -9,0 et 30,5%. Près d'un tiers de questions supplémentaires reviennent correctes.
Features. 975B au total avec 41B actifs sur 66 couches, Apache 2.0, et texte plus image plus audio en entrée. Trois fournisseurs de service désormais, là où le lancement en avait un, à savoir DeepInfra, Together AI et Thinking Machines.
Pros. Même licence, même famille, donc la migration se résume surtout à changer une chaîne de modèle. La ligne FP8 de DeepInfra est rapide, 201,5 tokens par seconde, et le coût par tâche d'Intelligence Index y ressort à $0.4296, bon marché pour cette catégorie.
Cons. Deux pages AA sont actuellement en désaccord sur le prix, donc mieux vaut savoir laquelle vous citez. La page du modèle indique $1.87 en entrée et $4.68 en sortie. Toutes les lignes fournisseurs indiquent $1.00 et $4.05. Ces chiffres fournisseurs restent cohérents en interne sur les trois, c'est donc la paire sur laquelle je planifierais. Le contexte servi est également désordonné. Au mieux 524k, et la ligne bon marché et rapide de DeepInfra plafonne à 131k, soit 13,1% du million annoncé.
Pricing. Selon les données fournisseurs, $1.00 en entrée et $4.05 en sortie, avec $0.17 pour un hit de cache et $0.724 en mélange. Disons 3,4x le taux de sortie de Small. Si c'est le parent que vous recherchez, l'article sur les alternatives à Inkling couvre la liste plus large.
My take: le choix évident, et celui que la plupart des gens sautent, parce que « passer au grand frère » a l'air d'admettre que le petit était une erreur. Ce n'était pas le cas. C'était juste le mauvais outil pour un travail de connaissance.
3. GLM-5.2
Best for: les poids ouverts les plus solides de cette liste que vous pouvez réalistement héberger vous-même.
GLM-5.2 est la montée en gamme qui vous garde dans un territoire sous licence MIT. Environ 753B de paramètres au total, avec un contexte de 1M que son API sert réellement, et 2,23 millions de téléchargements sur le dépôt zai-org/GLM-5.2. Ce nombre de téléchargements montre que la communauté de l'auto-hébergement l'a déjà mis à rude épreuve.
Features. Poids MIT avec un contexte de 1M et une sortie maximale de 128K, puis entrée en cache à $0.26, le stockage du cache étant listé comme gratuit pour l'instant. Z.ai vend aussi une voie par abonnement. Le Coding Plan démarre à $18 par mois, réduit à $12.60, avec 10 000 crédits par semaine.
Z.ai publie sa propre courbe de niveau d'effort, et la regarder vaut mieux que de prendre le score annoncé pour argent comptant :

Pros. GLM-5.2 coûte ce que GLM-5.1 coûtait, $1.40 et $4.40, et entre-temps la fenêtre de contexte est passée de 200K à 1M. Une mise à niveau gratuite, tout simplement. Une licence MIT sans clause de revenus vaut aussi plus qu'un point ou deux de benchmark une fois que vous expédiez ça dans un produit.
Cons. Ce plafond de sortie de 128K est le plus serré des options à poids ouverts ici, face aux 384K de DeepSeek. Les crédits du Coding Plan se consomment à 3x en heure de pointe et 2x hors pointe, avec la période creuse temporairement à 1x jusqu'à fin septembre, donc les calculs d'abonnement méritent d'être surveillés.
Pricing. $1.40 en entrée, $4.40 en sortie, $0.26 en cache. Des cousins moins chers existent si vous pouvez vivre avec moins. GLM-4.7 et GLM-4.6 sont tous deux à $0.60 et $2.20, tandis que GLM-4.7-FlashX est à $0.07 et $0.40.
My take: le meilleur compromis licence-capacité de la liste. Si votre équipe juridique s'est déjà demandé ce qui se passe le jour où un fournisseur change ses conditions, montrez-lui cette ligne.
4. MiniMax M3
Best for: égaler exactement le prix d'Inkling-Small tout en ajoutant l'entrée vidéo.
Celui-là est un alignement de prix direct, ce qui rend la comparaison inhabituellement nette. En dessous de 512K d'entrée, MiniMax M3 facture $0.30 en entrée et $1.20 en sortie, identique au tarif fournisseur d'origine d'Inkling-Small, pour un modèle de 428B avec 23B actifs. Ce qui vous laisse choisir sur tout sauf le coût.
Features. Un contexte de 1M avec 512K garantis comme minimum, des lectures de cache à $0.06, et texte plus image plus vidéo en entrée via des parties de contenu image_url et video_url. Le mode de réflexion coûte pareil activé ou non. Les poids sont disponibles sur Hugging Face sous MiniMaxAI/MiniMax-M3, avec 170 353 téléchargements à ce jour.
Pros. Près du double des paramètres actifs d'Inkling-Small pour le même prix, plus la vidéo en entrée par-dessus, ce que rien d'autre à ce tarif dans cette liste n'offre. La page de tarification qualifie le tarif actuel de « Permanent 50% off », et aucune date d'expiration n'est indiquée nulle part.
Cons. La licence est le vrai piège ici. La MINIMAX COMMUNITY LICENSE est non commerciale par défaut, l'usage commercial demande un crédit visible « Built with MiniMax M3 », et au-delà de $20M de revenus annuels il faut une autorisation écrite. Passé 512K d'entrée, les deux tarifs doublent, donc $0.60 et $2.40. Un palier Priority existe aussi, à 1,5x, si une file plus rapide en vaut la peine.
Pricing. $0.30 et $1.20 jusqu'à 512K d'entrée, puis $0.60 et $2.40 au-delà, lectures de cache à $0.06. Priority va à $0.45 et $1.80, ou $0.90 et $3.60 une fois le seuil dépassé.
My take: bon moteur, licence qu'il faut prendre le temps de lire. Une startup en dessous de la ligne de revenus, prête à afficher le crédit, obtient ici plus de modèle par dollar que ce qu'elle quitte.
5. Kimi K3
Best for: le travail d'agent de longue haleine où l'exécution compte plus que le prix du token.
Kimi K3 est un saut bien plus grand que tout ce qui précède, et dans sa propre documentation tarifaire, Moonshot l'appelle le vaisseau amiral pour « le codage de longue haleine et le travail de connaissance de bout en bout ». Avec 2,8 billions de paramètres servis en 4 bits mxfp4, c'est aussi le plus grand modèle ici dont vous pouvez télécharger les poids.
Features. Un contexte de 1 048 576 tokens, un raisonnement toujours actif derrière un réglage reasoning_effort de low, high ou max (max étant la valeur par défaut), et un dépôt moonshotai/Kimi-K3 sans restriction d'accès. La recherche web est facturée séparément, $0.005 par appel réussi.
Pros. Des poids ouverts à cette échelle sont inhabituels. Le taux de hit de cache de $0.30 face à un input de $3.00 en cas de cache manqué représente aussi une économie de 10x chaque fois que le contexte se répète. Et le milieu de gamme est couvert par un cousin moins cher, kimi-k2.7-code, à $0.95 et $4.00.
Cons. Il y a ici deux pièges opérationnels, et les deux mordent. K3 n'est pas pris en charge sur le palier batch, donc la remise de 60% dont bénéficient les autres modèles Kimi ne l'atteint pas. Le système de paliers est également conditionné par la dépense : le Tier 0, à partir de $1 de recharge cumulée, autorise 1 requête simultanée et 3 requêtes par minute, montant jusqu'à 1 000 simultanées et 10 000 RPM une fois le Tier 5 atteint à $3 000. La licence a l'air d'être de type MIT, mais ajoute une clause exigeant un accord séparé pour les activités de modèle-en-tant-que-service au-delà de $20M de revenus sur douze mois consécutifs quelconques.
Pricing. $3.00 en entrée et $15.00 en sortie, avec $0.30 sur un hit de cache. À 12,5x le taux de sortie d'Inkling-Small, personne ne devrait confondre cela avec un mouvement latéral. Les tableaux de paliers complets sont dans les prix de Kimi K3.
My take: le choix quand la charge de travail est une longue exécution d'agent plutôt que des milliers de réponses courtes. Pour un trafic en forme de tickets, le justifier face à GLM-5.2 à un tiers du prix devient difficile.
6. Qwen3.8-Max
Best for: un modèle fermé avec une fenêtre vraiment généreuse et une allocation d'essai gratuite.
Qwen3.8-Max est l'endroit où l'on atterrit une fois qu'on a décidé que les poids ouverts ne sont pas le sujet et que le niveau commercial haut de gamme d'Alibaba l'est. La bonne surprise sur la page de facturation est que Max a enfin abandonné les paliers par longueur d'entrée. Une seule bande, couvrant toute la fenêtre d'un million de tokens.
Features. Un contexte de 1M, une sortie maximale de 131K et un raisonnement maximal de 262K, avec un TPM de 2 millions contre un RPM de 15 000. La mise en cache implicite coûte $0.25. Il existe aussi un quota gratuit d'1 million de tokens, valable 90 jours.
Pros. L'absence de paliers par longueur d'entrée est une affaire plus importante qu'il n'y paraît. Sur l'ancien qwen3-max, la règle de palier d'Alibaba fonctionnait en tout ou rien, si bien que franchir une limite refacturait toute la requête et un prompt de 33K tokens passait de $1.20 à $2.40 en entrée. Ici, ce piège a disparu. Le million de tokens gratuit donne aussi une vraie marge pour évaluer correctement.
Cons. Un seul identifiant de modèle, deux prix, selon la portée du déploiement : $2.00 et $6.00 sur les tableaux International et Singapore, $1.65 et $4.951 sur les tableaux Global. Un écart de 18% sans aucune différence de comportement derrière est déroutant à budgétiser. Le quota gratuit est réservé à Singapore, son compteur ne s'arrête pas en cas d'inactivité, et ce qui reste est annulé à l'expiration. Le batch retire 50% mais ne se cumule pas avec les remises de cache. Max est également fermé, et les poids Qwen publiés ont deux générations de retard, le plus récent datant du 24-04-2026.
Pricing. $2.00 en entrée et $6.00 en sortie sur International et Singapore, puis $1.65 et $4.951 sur Global. La création de cache explicite coûte $2.50, soit 125% de l'entrée. Le détail complet est dans notre article sur les prix de Qwen3.8-Max, et il y a le tour d'horizon des alternatives à Qwen3.8-Max si vous cherchez dans l'autre sens.
My take: solide, et légèrement surévalué face à GLM-5.2, qui demande moins et vous donne les poids. Le quota gratuit reste une raison d'essayer.
7. Gemini 3.6 Flash
Best for: l'entrée audio et multimédia mixte sans payer de surprime pour le média.
Étiez-vous sur Inkling-Small spécifiquement pour l'entrée audio ? Alors voici le remplacement le plus proche avec un vrai niveau de service derrière. Gemini 3.6 Flash facture un tarif d'entrée plat unique de $1.50 couvrant texte, image, vidéo, audio et PDF, ce qui rompt un schéma que Google lui-même avait établi. Sur Gemini 2.5 Flash, l'entrée audio coûtait $1.00 contre $0.30 pour le texte, et sur 2.0 Flash le multiple atteignait 7x.
Features. 1 048 576 tokens d'entrée contre 65 536 en sortie, mise en cache à $0.15 par million plus $1.00 par million par heure de stockage, avec les paliers Batch et Flex tous deux à moitié prix, $0.75 et $3.75.
Pros. Le tarif média plat est l'atout ici, et un palier Batch à $0.75 et $3.75 rend le travail en volume abordable. La page de tarification de Google le liste comme stable plutôt qu'en aperçu, ce qui compte si ça se rapproche des clients.
Cons. Ce plafond de sortie de 65 536 est le plus serré ici, donc les générations longues doivent être découpées. La facturation du cache basée sur le stockage fonctionne comme un compteur plutôt qu'un coût unique, contrairement aux tarifs plats de lecture de cache ailleurs. Les poids sont fermés, donc pas d'auto-hébergement. L'ancrage sur Gemini 3.x n'est pas non plus disponible au palier gratuit, ce qui signifie qu'évaluer coûte de l'argent.
Pricing. Le standard est de $1.50 en entrée et $7.50 en sortie, Batch ou Flex à $0.75 et $3.75, Priority à $2.70 et $13.50. Là où le budget est la contrainte, Gemini 3.5 Flash-Lite arrive à $0.30 et $2.50, et n'a pas non plus de séparation audio. L'échelle complète est dans les prix de Gemini 3.6 Flash.
My take: le choix pour l'audio. Aussi le seul modèle ici auquel j'enverrais du multimédia mixte en volume sans hésiter.
8. Claude Opus 5
Best for: les cas où une réponse fausse mais sûre d'elle coûte réellement de l'argent.
C'est le bout extrême de l'échelle, et une raison l'a placé sur la liste. Il répond au problème spécifique qu'a Inkling-Small. Claude Opus 5 coûte $5.00 en entrée et $25.00 en sortie, environ 21x le taux de sortie d'Inkling-Small, et on l'achète quand l'inconvénient d'une réponse fausse dépasse la facture de tokens.
Features. Le plein contexte de 1M au tarif standard, avec aucun palier de surtaxe pour contexte long, ce qui est inhabituel. Les documents de tarification d'Anthropic le précisent : une requête de 900k tokens est facturée au même tarif par token qu'une requête de 9k. Les lectures de cache coûtent $0.50. L'API Batch retire un forfait de 50% sur les deux côtés, $2.50 et $12.50, et se cumule avec la mise en cache.
Pros. Sans falaise de longueur de contexte, toute une catégorie de mauvaise surprise de facturation disparaît. La réflexion étendue ne porte pas de prix séparé et est facturée comme une sortie standard. Batch combiné à la mise en cache fait aussi baisser considérablement les charges de travail lourdes et répétées par rapport au prix affiché.
Cons. Dans toute comparaison de coûts, le tokenizer est le piège. Anthropic note que Claude 4.7 et les versions suivantes « produisent environ 30% de tokens en plus pour le même texte » que l'ancien tokenizer, donc ce prix affiché de $25.00 sous-estime le véritable écart par tâche face à un concurrent qui utilise encore un tokenizer plus ancien. Le mode Fast double les deux côtés à $10.00 et $50.00, ne fonctionne que sur l'API du fournisseur d'origine, et ne se cumule pas avec Batch. Les poids sont fermés.
Pricing. Standard $5.00 et $25.00, Batch $2.50 et $12.50, mode Fast $10.00 et $50.00, lecture de cache $0.50. L'étape moins chère est Sonnet 5 à $2.00 et $10.00 jusqu'au 31 août 2026, qui passe à $3.00 et $15.00 le 1er septembre. Le moment où cet écart vaut la peine d'être payé est couvert dans notre comparaison Opus 5 contre Sonnet 5.
My take: excessif pour la plupart des trafics de tickets, exactement adapté pour les 5% qui touchent à l'argent, à une politique ou à un contrat. Routez selon le type de question plutôt que de choisir un seul modèle pour tout.
The price ladder, in one picture
Alignez les huit côte à côte sur le prix de sortie, et la forme de la décision devient évidente.

Inkling-Small est déjà proche du plancher. Il existe exactement une marche significative en dessous, DeepSeek V4 Flash à $0.28, plus un déplacement latéral au même prix chez MiniMax M3. Tout le reste ici est une marche vers le haut, et ce qu'une marche vers le haut achète n'est jamais la vitesse.
Cela vaut la peine de faire le calcul de ce que tout cela coûte à l'échelle des tickets. Prenez mille tickets sur un mois, puis comptez 2 000 tokens de sortie par réponse, ce qui est généreux pour une réponse de support. Soit 2 millions de tokens de sortie.
| Model | Output cost, 2M tokens | Against Inkling-Small |
|---|---|---|
| DeepSeek V4 Flash | $0.56 | $1.84 cheaper |
| Inkling-Small | $2.40 | baseline |
| MiniMax M3 | $2.40 | identical |
| GLM-5.2 | $8.80 | $6.40 more |
| Inkling | $8.10 | $5.70 more |
| Gemini 3.6 Flash | $15.00 | $12.60 more |
| Kimi K3 | $30.00 | $27.60 more |
| Claude Opus 5 | $50.00 | $47.60 more |
À ce volume, l'écart total du moins cher au plus cher est d'environ $50 par mois. Une escalade mal gérée vous coûte plus que ça. Ce qui constitue l'argument réel pour monter dans l'échelle, et aussi pourquoi le choix du modèle n'est pas là où se trouve le plus gros levier.
Ce qu'aucun de ces modèles ne règle sur une file de support
Aucune des huit lignes ci-dessus ne résout la partie suivante, et c'est pourquoi je continue à pousser quand quelqu'un me dit avoir trouvé un modèle moins cher.
J'ai vu cet échec précis se produire sur des comptes payants. Un modèle ne s'arrête pas quand la récupération revient vide. Il comble le vide avec ce qu'il a appris à l'entraînement. Un client, un fournisseur danois d'énergie solaire, a eu son bot fabriquer de fausses affirmations sur des abonnements et les envoyer à de vrais clients. Un autre a posé une question à son bot et a reçu « Oxygen (periodic table) » en retour. Aucun de ces cas n'était un mauvais modèle. Les deux étaient un modèle sans rien contre quoi s'ancrer, et sans rien pour l'empêcher de deviner.
Un responsable support sur nos comptes a formulé la même inquiétude en des termes plus directs, en disant à l'IA ce qu'elle ne devait pas faire :
"stop telling customers that we will get them sorted. You dont know that"
Un responsable support e-commerce, inquiet qu'un bot promette trop sur les délais de livraison. Même forme de problème. Le modèle a l'air sûr, et cet air sûr est précisément la partie dangereuse. La ventilation AA-Briefcase propre à Inkling-Small le dit elle-même, présentant 270,86 points Elo de mieux qu'il n'analyse.

Un modèle plus gros n'est pas la solution. Deux choses qu'un modèle n'apporte pas de série le sont. D'abord l'ancrage, pour que la réponse sorte de votre centre d'aide et de vos anciens tickets plutôt que de la mémoire paramétrique. Ensuite une porte de confiance, pour que tout ce qui est sous la barre aille vers une personne au lieu de sortir. Ces deux éléments transforment un moteur brut en quelque chose que vous pouvez pointer vers une file en production, et c'est tout le sujet de la prévention des hallucinations d'IA.
L'autre raison pour laquelle les gens arrêtent de comparer des modèles est plus prosaïque que cela. Un développeur avec qui nous avons parlé, en train de monter une base de connaissances sur les incidents informatiques, avait déjà fait le tour. Il a essayé l'API d'un fournisseur et l'a trouvée trop coûteuse, en a essayé une autre et l'a trouvée peu fiable, et au final voulait juste quelque chose qui fonctionne. Comparer des modèles, c'est amusant. Maintenir une couche modèle, ça ne l'est pas.
Try eesel
Si le modèle que vous choisissez va répondre à des questions de clients, le conseil honnête vient en deux parties. Prenez celui des huit ci-dessus qui correspond à votre budget et à votre licence. Puis ne construisez pas vous-même la couche au-dessus.
Cette couche, c'est ce qu'est eesel. Il se branche sur Zendesk, Freshdesk ou tout ce que vous utilisez déjà, apprend à partir de vos tickets résolus et de votre centre d'aide plutôt que des données d'entraînement d'un modèle, et ne répond qu'une fois qu'il franchit un seuil de confiance que vous définissez vous-même. Tout ce qui est en dessous est escaladé. Et avant de toucher au trafic réel, vous pouvez le simuler contre votre propre historique de tickets, ce qui permet d'apprendre ce qu'il aurait mal fait avant qu'un client ne le découvre.

J'ai mis notre propre taux d'erreur factuelle mesuré de 7% en avant plutôt que de l'enterrer, parce que c'est le chiffre qui compte pendant que vous choisissez un modèle. Il provient du trafic Zendesk réel d'un détaillant allemand de bijouterie, environ mille tickets par mois, validé de façon croisée sur 284 chats et 100 tickets, avec de la récupération sur leur véritable centre d'aide. L'ancrage ne vous amènera pas à zéro. Il donne un chiffre que vous pouvez mesurer, encadrer, puis améliorer, et c'est une catégorie différente d'un modèle qui devine avec assurance.
L'approche commerciale n'est délibérément pas non plus au poste. La facturation se fait au ticket résolu, donc le tarif suit le travail réalisé et non l'effectif. Gratuit à l'essai. Si vous préférez d'abord vérifier les chiffres, le guide de déviation de tickets est un bon point de départ.
My take
Inkling-Small est un bon petit modèle à qui l'on demande sans cesse un travail pour lequel il n'a pas été conçu. Il exécute bien et à un prix déjà proche du plancher, et sa fiabilité de connaissance mesure -9,0. Ces deux faits ne sont pas en tension. Ensemble, ils décrivent un outil.
Vous partez pour le coût ? Prenez DeepSeek V4 Flash et c'est réglé. Si ce sont les réponses fausses qui vous poussent dehors, montez vers le parent Inkling pour la solution bon marché, ou vers Claude Opus 5 pour la solution coûteuse, en sachant qu'aucune des deux ne vous amène à zéro.
Et si la raison est que la fenêtre de contexte ne correspond pas à la fiche, GLM-5.2 sert ce qu'il annonce, sous MIT. C'est la ligne que je prendrais si je devais m'en tenir à une seule.
Le verdict honnête sur les huit reste néanmoins le même. Changer de moteur déplace votre facture et vos scores de benchmark. Cela ne touche pas ce qui se passe quand un client pose une question à laquelle votre documentation n'a jamais répondu. Combler cet écart demande de la récupération, un seuil de confiance, une transmission. Aucune montée en gamme de modèle ne le fait à votre place, et cela vaut la peine d'être résolu avant de passer un autre après-midi à lire des benchmarks de classification de tickets par IA.
Questions fréquentes
Quelles sont les meilleures alternatives à Inkling-Small ?
Existe-t-il une alternative moins chère à Inkling-Small ?
Pourquoi changer d'Inkling-Small ?
Inkling-Small a-t-il vraiment une fenêtre de contexte de 1M ?
Quelle alternative à Inkling-Small a la meilleure licence ouverte ?
Combien coûte l'exploitation d'une alternative à Inkling-Small sur des tickets de support ?
Puis-je auto-héberger une alternative à Inkling-Small au lieu de payer par token ?
Inkling-Small suffit-il seul pour le support client ?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








