8 meilleures alternatives à Inkling-Small en 2026

Kurnia Kharisma Agung Samiadjie
Écrit par

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 4, 2026

Vérifié par un expert
Un petit modèle mis de côté tandis que cinq modèles alternatifs captent la lumière

Pourquoi les gens regardent déjà au-delà d'Inkling-Small

Thinking Machines Lab a lancé Inkling-Small le 30-07-2026 sous licence Apache 2.0, quinze jours après le modèle parent. La promesse était raisonnable et le modèle la tient effectivement. Un quart de la taille du parent, plus rapide, et moins cher aussi, et selon la fiche du fournisseur lui-même, il dépasse même le parent sur SWE-bench Verified, 80,2 contre 77,6.

L'accueil sur r/LocalLLaMA avait pas mal à dire sur ce mot « small ». Le troisième commentaire le plus voté du fil de lancement ne parle pas du tout de benchmarks :

Reddit

"Soon after all this 2-3T models they will say small for 500-700B models... crying with 12Gb Vram"

Justifié. Mais ce n'est pas le nom qui pousse qui que ce soit à quitter le modèle. Ce qu'il sait, si.

Artificial Analysis le situe à un Intelligence Index de 40, rang #15 sur 101, ce qui est plutôt honorable. Puis la même page rapporte le test de connaissance AA-Omniscience : un indice de -9,0, une précision de 30,5%, un taux d'hallucination de 56,9%. AA décrit cette évaluation comme mesurant « la fiabilité de connaissance et l'hallucination » sur une échelle de -100 à 100. Un nombre négatif à cet endroit n'est donc pas un artefact d'arrondi. C'est le modèle qui tend la main vers une réponse qu'il n'a pas.

La ventilation AA-Briefcase est la partie vers laquelle je reviens sans cesse. Un Elo global de 917,13, qui ne dit pas grand-chose tant qu'on ne le décompose pas : présentation à 1067,99 contre une qualité analytique de 797,13. Le modèle rédige une meilleure réponse qu'il n'en sait réellement.

Les personnes qui font tourner ces modèles sur leur propre matériel l'ont repéré vite, et sur un axe plus tranchant que celui des tableaux de benchmarks :

Reddit

"But worse than GPT 5.5 Luna on the Omniscience Index, because it makes up too many answers. 84% Hallucination Rate, that's why I favor other open models, they are better at 'detecting' their incertitude."

Ce chiffre de 84% est plus élevé que les 56,9% actuellement affichés sur la page AA, donc considérez le chiffre exact comme leur lecture, pas la mienne. Dans tous les cas, l'argument tient, et c'est le bon argument à avancer. Ils choisissent un modèle selon s'il sait quand il ne sait pas, plutôt que sur la qualité avec laquelle il écrit du code.

Three reasons teams leave Inkling-Small, each pointing at a different replacement model
Three reasons teams leave Inkling-Small, each pointing at a different replacement model

Trois autres choses éloignent les gens de ce modèle. Le prix n'en fait pas partie.

La fenêtre de contexte n'est pas la fenêtre de contexte. AA liste le modèle à 1M tokens. Ce que ses deux fournisseurs servent réellement, c'est 256 000 (Thinking Machines) et 524 288 (DeepInfra). Donc quiconque a lu « 1M » sur la fiche et construit en se basant sur ce chiffre ne l'obtient pas. Même problème sur le modèle parent, où le meilleur chiffre servi est de 524k chez trois fournisseurs, et la ligne la moins chère et la plus rapide de DeepInfra plafonne à 131k.

Deux fournisseurs, c'est peu. Le parent en a trois, et le groupe qui sert DeepSeek ou GLM est encore plus grand. Le jour du lancement, le modèle n'était même pas sur OpenRouter, un manque qu'un commentateur a signalé sur Hacker News en même temps que les décomptes de paramètres. Les deux fournisseurs disponibles se comportent aussi différemment. DeepInfra tourne 1,43x plus vite sur une charge de 10k, puis prend du retard sur le fournisseur d'origine à 100k, 82,36 tokens par seconde contre 113,36. Votre profil de latence change avec la longueur du prompt, et c'est une chose terrible à découvrir en production.

Une couverture réduite laisse aussi moins de marge pour changer quand un fournisseur commence à rogner sur les coûts, ce qui arrive plus souvent que ne le laissent voir les benchmarks publiés :

Hacker News

"In fact we found that many inference providers are quantising the weights or even KV cache, and due to the low prices they serve at massive batches, resulting in unstable throughput."

Le prix n'est pas un seul chiffre. Le fournisseur d'origine est à $0.30 en entrée et $1.20 en sortie. DeepInfra demande $0.58 et $1.44 pour le contexte plus long. En mélange, AA affiche $0.222 avec son ratio par défaut de 7:2:1, tandis que le mélange classique 3:1 atterrit à $0.525. Donc, quel que soit le chiffre unique que vous finissez par citer, c'est en réalité un choix de ratio, et ce choix compte lorsque vous modélisez le coût du service client avec IA à grande échelle.

Pour être juste, rien de tout cela ne fait de ce modèle un mauvais modèle. Le raisonnement représente 95,5% de sa facture de sortie, exactement là d'où vient l'intelligence, et GPQA Diamond à 89,5% plus le raisonnement à contexte long à 63% sont des chiffres réels. La chose est un exécutant. Le problème ne commence que lorsqu'on demande à un exécutant d'être un connaisseur.

Comment j'ai choisi ces huit modèles

J'écris beaucoup de ces tours d'horizon et le piège ne change jamais. Classer par benchmark, publier, passer à autre chose. J'ai donc gardé le filtre ici plus étroit.

Chacun des huit devait être quelque chose vers lequel un utilisateur d'Inkling-Small pouvait basculer cette semaine même, donc une API publique en service avec des prix publiés, sans liste d'attente. Chaque prix provient de la page de facturation du fournisseur lui-même, en date du 05-08-2026, plutôt que d'un site comparateur, car les chiffres de ces sites deviennent obsolètes en quinze jours. Là où un fournisseur publie à la fois le contexte servi et le contexte annoncé, j'ai vérifié l'un contre l'autre. J'ai aussi lu les licences, et c'était important, car deux modèles ici cachent des seuils de revenus dans les leurs.

Ce que je n'ai pas fait, c'est prétendre que six mois de trafic de production sont passés par les huit. J'ai lu la documentation et les pages de facturation, les fiches modèles, les mesures d'AA, puis je n'ai dit que ce que cela permet d'appuyer.

Les meilleures alternatives à Inkling-Small en un coup d'œil

Tous les prix ci-dessous sont par million de tokens en USD, vérifiés le 05-08-2026.

ModelBest forWeightsParamsInputOutputReal contextModalities inThe catch
Inkling-Small (baseline)Cheap agentic executionApache 2.0276B / 12B active (266B per AA)$0.30$1.20256K first-party, 524,288 on DeepInfraText, image, audioKnowledge index -9.0
DeepSeek V4 FlashSame job, a quarter the costMIT284B / 13B$0.14$0.281MTextA 2x peak surcharge is announced
InklingStaying in the family, knowing moreApache 2.0975B / 41B$1.00$4.05524K best, 131K cheapestText, image, audioTwo AA pages quote different prices
GLM-5.2Strongest open weights you can hostMIT~753B total$1.40$4.401MText128K output cap
MiniMax M3Video in, at Inkling-Small's priceCustom community licence428B / 23B$0.30$1.201M, 512K guaranteedText, image, videoNon-commercial by default
Kimi K3Long-horizon agent workCustom (Kimi K3 Licence)2.8T$3.00$15.001,048,576TextNo batch tier, 3 RPM on entry tier
Qwen3.8-MaxClosed model, generous windowClosedUndisclosed$2.00$6.001MTextTwo prices for one model
Gemini 3.6 FlashAudio in with no premiumClosedUndisclosed$1.50$7.501,048,576Text, image, video, audio, PDF65,536 output ceiling
Claude Opus 5When wrong answers cost moneyClosedUndisclosed$5.00$25.001M, no surchargeText, imageNewer tokenizer emits ~30% more tokens

Quelle alternative à Inkling-Small correspond à votre raison de partir ?

Choisissez la phrase qui ressemble le plus à votre semaine.

Optez pour Claude Opus 5, ou pour l'Inkling parent si le budget est serré

$5.00 / $25.00Opus 5, par 1M de tokens $1.00 / $4.05Inkling, par 1M de tokens 2.05 vs -9.0Inkling vs Small, AA-Omniscience

L'indice de connaissance d'Inkling-Small est négatif et celui de son parent est positif, donc la solution réelle la moins chère est un cran au-dessus dans la même famille : même licence, mêmes outils, environ 3,4x le prix de sortie. Opus 5 coûte bien plus cher et c'est celui vers lequel se tourner quand une réponse fausse signifie un remboursement, un problème de conformité ou un client perdu.

Aucun modèle de cette liste n'atteint zéro. Ancrer dans vos propres documents plus une porte de confiance fait plus pour la précision que n'importe quelle montée en gamme ici.

Optez pour DeepSeek V4 Flash

$0.14 / $0.28par 1M de tokens 4,3xmoins cher en sortie qu'Inkling-Small MITlicence sur les poids

Les hits de cache atterrissent à $0.0028 par million, soit 50 fois en dessous de son propre taux de cache manqué, donc une charge de travail répétitive devient très vite très bon marché. Poids MIT, contexte 1M, 2 500 requêtes simultanées selon les limites publiées. MiniMax M3 est le dauphin, exactement au tarif d'Inkling-Small, avec l'entrée vidéo en prime.

DeepSeek a annoncé une surtaxe de 2x aux heures de pointe entre 09h00 et 12h00 et entre 14h00 et 18h00 heure de Pékin. Pas encore de date de début, donc modélisez votre pointe avec le tarif doublé.

Optez pour DeepSeek V4 Flash ou GLM-5.2

1Mservi, les deux modèles 256KInkling-Small, fournisseur d'origine 384K / 128Ksortie maximale, DeepSeek / GLM

Les deux annoncent une fenêtre de 1M et les deux la servent réellement, ce qui est la différence qui compte. GLM-5.2 coûte le même prix que GLM-5.1 le faisait à 200K, donc la fenêtre est arrivée gratuitement. Attention tout de même aux plafonds de sortie : DeepSeek autorise 384K en sortie, GLM plafonne à 128K.

Contexte long et raisonnement à contexte long sont deux choses différentes. Inkling-Small ne marque que 63% au test de raisonnement à contexte long d'AA, donc une fenêtre plus grande seule ne réglera pas un problème de mémoire.

Optez pour Kimi K3, ou Gemini 3.6 Flash si l'audio est nécessaire

$3.00 / $15.00Kimi K3, par 1M $1.50 / $7.50Gemini 3.6 Flash, par 1M 2,8Tparamètres de Kimi K3

Kimi K3 est construit pour des exécutions d'agent de longue haleine et ses poids sont publics, à 2,8 billions de paramètres en 4 bits. Gemini 3.6 Flash applique un tarif d'entrée unique et plat pour le texte, l'image, la vidéo, l'audio et le PDF, ce qui est inhabituel et utile si vos entrées sont hétérogènes.

Kimi K3 n'a pas de palier batch et le palier de dépense d'entrée n'autorise que 3 requêtes par minute. Vérifiez les limites de débit face à votre trafic avant de vous engager.

1. DeepSeek V4 Flash

Best for: faire ce que fait Inkling-Small, pour environ un quart du coût de sortie.

DeepSeek's free web chat interface, as taken from DeepSeek

C'est la comparaison vers laquelle un vrai utilisateur d'Inkling-Small se tourne en premier, et ce fut aussi le commentaire le plus consistant du fil de lancement de r/LocalLLaMA :

Reddit

"I wonder how it compares to DSV4 Flash. Comparable on Artificial Analysis intelligence benchmark (both 40). Seems to do slightly better coding / agentic workflows though."

Voilà de quoi il s'agit. DeepSeek V4 Flash tourne avec 284B au total et 13B actifs, à côté des 12B d'Inkling-Small, et AA place les deux à 40. Moteur similaire. Facture pas si similaire.

Il y a une chose que les décomptes de paramètres cachent, et elle compte si l'auto-hébergement est dans vos plans. DeepSeek est distribué nativement dans un mélange de FP4 et FP8 là où Inkling-Small est distribué en bf16, si bien qu'un opérateur local a estimé qu'à précision native, cela donnait environ 160Go contre 540Go. Sur le papier, une taille à peu près similaire. En pratique, trois fois plus de mémoire.

Features. Des poids sous licence MIT sur Hugging Face, plus une fenêtre de contexte de 1M et une sortie maximale de 384K, la plus grande de cette liste et de loin. La limitation de débit fonctionne par concurrence plutôt que par requêtes par minute, avec un plafond publié de 2 500 requêtes simultanées par compte.

Pros. L'économie du cache est la vraie histoire ici. Un hit de cache coûte $0.0028 par million de tokens d'entrée, 50 fois en dessous du taux de cache manqué de $0.14, donc tout ce qui a un prompt système stable devient absurdement bon marché. Et MIT est la licence la plus propre du groupe, pas de seuil de revenus, pas de clause d'attribution.

Cons. Texte uniquement, donc tout audio que vous donniez à Inkling-Small n'a plus nulle part où aller. Il y a aussi une note en bas de la page de tarification annonçant une future surtaxe de 2x aux heures de pointe entre 09h00 et 12h00 et 14h00 et 18h00 heure de Pékin, avec une date d'entrée en vigueur « sous réserve de l'annonce officielle ». Une inconnue connue, logée dans votre modèle de coûts.

Pricing. $0.14 en entrée et $0.28 en sortie par million, hits de cache à $0.0028. Pro se situe à $0.435 et $0.87, soit exactement 3,1x Flash des deux côtés. Les exemples chiffrés sont dans notre analyse des prix de DeepSeek V4 Flash, et nous l'avons comparé à Kimi K3 séparément.

My take: si l'argent est votre raison de partir, arrêtez de lire ici. Si c'est la précision, continuez, parce que devenir moins cher n'a jamais fait qu'un modèle sache davantage.

2. Inkling, the parent

Best for: rester sur les mêmes poids, les mêmes outils et la même licence tout en rachetant la fiabilité factuelle.

Inkling running locally in Unsloth Studio with a 1,048.6k context counter, as taken from Unsloth
Inkling running locally in Unsloth Studio with a 1,048.6k context counter, as taken from Unsloth

Souvent, l'alternative la plus intéressante à un petit modèle est le grand dont il a été distillé, et ici les chiffres le démontrent proprement. Sous la même méthodologie d'AA, Inkling obtient un Intelligence Index de 41 contre 40 pour Small, donc match nul. C'est sur AA-Omniscience qu'ils se séparent : 2,05 avec 39,95% de précision, contre -9,0 et 30,5%. Près d'un tiers de questions supplémentaires reviennent correctes.

Features. 975B au total avec 41B actifs sur 66 couches, Apache 2.0, et texte plus image plus audio en entrée. Trois fournisseurs de service désormais, là où le lancement en avait un, à savoir DeepInfra, Together AI et Thinking Machines.

Pros. Même licence, même famille, donc la migration se résume surtout à changer une chaîne de modèle. La ligne FP8 de DeepInfra est rapide, 201,5 tokens par seconde, et le coût par tâche d'Intelligence Index y ressort à $0.4296, bon marché pour cette catégorie.

Cons. Deux pages AA sont actuellement en désaccord sur le prix, donc mieux vaut savoir laquelle vous citez. La page du modèle indique $1.87 en entrée et $4.68 en sortie. Toutes les lignes fournisseurs indiquent $1.00 et $4.05. Ces chiffres fournisseurs restent cohérents en interne sur les trois, c'est donc la paire sur laquelle je planifierais. Le contexte servi est également désordonné. Au mieux 524k, et la ligne bon marché et rapide de DeepInfra plafonne à 131k, soit 13,1% du million annoncé.

Pricing. Selon les données fournisseurs, $1.00 en entrée et $4.05 en sortie, avec $0.17 pour un hit de cache et $0.724 en mélange. Disons 3,4x le taux de sortie de Small. Si c'est le parent que vous recherchez, l'article sur les alternatives à Inkling couvre la liste plus large.

My take: le choix évident, et celui que la plupart des gens sautent, parce que « passer au grand frère » a l'air d'admettre que le petit était une erreur. Ce n'était pas le cas. C'était juste le mauvais outil pour un travail de connaissance.

3. GLM-5.2

Best for: les poids ouverts les plus solides de cette liste que vous pouvez réalistement héberger vous-même.

GLM-5.2's launch material from Z.ai, as taken from Z.ai

GLM-5.2 est la montée en gamme qui vous garde dans un territoire sous licence MIT. Environ 753B de paramètres au total, avec un contexte de 1M que son API sert réellement, et 2,23 millions de téléchargements sur le dépôt zai-org/GLM-5.2. Ce nombre de téléchargements montre que la communauté de l'auto-hébergement l'a déjà mis à rude épreuve.

Features. Poids MIT avec un contexte de 1M et une sortie maximale de 128K, puis entrée en cache à $0.26, le stockage du cache étant listé comme gratuit pour l'instant. Z.ai vend aussi une voie par abonnement. Le Coding Plan démarre à $18 par mois, réduit à $12.60, avec 10 000 crédits par semaine.

Z.ai publie sa propre courbe de niveau d'effort, et la regarder vaut mieux que de prendre le score annoncé pour argent comptant :

Z.ai's chart of agentic coding score against average output tokens per task, comparing GLM-5.2 and GLM-5.1 with two Claude Opus versions, as taken from Z.ai
Z.ai's chart of agentic coding score against average output tokens per task, comparing GLM-5.2 and GLM-5.1 with two Claude Opus versions, as taken from Z.ai

Pros. GLM-5.2 coûte ce que GLM-5.1 coûtait, $1.40 et $4.40, et entre-temps la fenêtre de contexte est passée de 200K à 1M. Une mise à niveau gratuite, tout simplement. Une licence MIT sans clause de revenus vaut aussi plus qu'un point ou deux de benchmark une fois que vous expédiez ça dans un produit.

Cons. Ce plafond de sortie de 128K est le plus serré des options à poids ouverts ici, face aux 384K de DeepSeek. Les crédits du Coding Plan se consomment à 3x en heure de pointe et 2x hors pointe, avec la période creuse temporairement à 1x jusqu'à fin septembre, donc les calculs d'abonnement méritent d'être surveillés.

Pricing. $1.40 en entrée, $4.40 en sortie, $0.26 en cache. Des cousins moins chers existent si vous pouvez vivre avec moins. GLM-4.7 et GLM-4.6 sont tous deux à $0.60 et $2.20, tandis que GLM-4.7-FlashX est à $0.07 et $0.40.

My take: le meilleur compromis licence-capacité de la liste. Si votre équipe juridique s'est déjà demandé ce qui se passe le jour où un fournisseur change ses conditions, montrez-lui cette ligne.

4. MiniMax M3

Best for: égaler exactement le prix d'Inkling-Small tout en ajoutant l'entrée vidéo.

The MiniMax M3 model page, as taken from MiniMax

Celui-là est un alignement de prix direct, ce qui rend la comparaison inhabituellement nette. En dessous de 512K d'entrée, MiniMax M3 facture $0.30 en entrée et $1.20 en sortie, identique au tarif fournisseur d'origine d'Inkling-Small, pour un modèle de 428B avec 23B actifs. Ce qui vous laisse choisir sur tout sauf le coût.

Features. Un contexte de 1M avec 512K garantis comme minimum, des lectures de cache à $0.06, et texte plus image plus vidéo en entrée via des parties de contenu image_url et video_url. Le mode de réflexion coûte pareil activé ou non. Les poids sont disponibles sur Hugging Face sous MiniMaxAI/MiniMax-M3, avec 170 353 téléchargements à ce jour.

Pros. Près du double des paramètres actifs d'Inkling-Small pour le même prix, plus la vidéo en entrée par-dessus, ce que rien d'autre à ce tarif dans cette liste n'offre. La page de tarification qualifie le tarif actuel de « Permanent 50% off », et aucune date d'expiration n'est indiquée nulle part.

Cons. La licence est le vrai piège ici. La MINIMAX COMMUNITY LICENSE est non commerciale par défaut, l'usage commercial demande un crédit visible « Built with MiniMax M3 », et au-delà de $20M de revenus annuels il faut une autorisation écrite. Passé 512K d'entrée, les deux tarifs doublent, donc $0.60 et $2.40. Un palier Priority existe aussi, à 1,5x, si une file plus rapide en vaut la peine.

Pricing. $0.30 et $1.20 jusqu'à 512K d'entrée, puis $0.60 et $2.40 au-delà, lectures de cache à $0.06. Priority va à $0.45 et $1.80, ou $0.90 et $3.60 une fois le seuil dépassé.

My take: bon moteur, licence qu'il faut prendre le temps de lire. Une startup en dessous de la ligne de revenus, prête à afficher le crédit, obtient ici plus de modèle par dollar que ce qu'elle quitte.

5. Kimi K3

Best for: le travail d'agent de longue haleine où l'exécution compte plus que le prix du token.

Kimi's chat interface, Moonshot AI's assistant and agent front end, as taken from Moonshot AI

Kimi K3 est un saut bien plus grand que tout ce qui précède, et dans sa propre documentation tarifaire, Moonshot l'appelle le vaisseau amiral pour « le codage de longue haleine et le travail de connaissance de bout en bout ». Avec 2,8 billions de paramètres servis en 4 bits mxfp4, c'est aussi le plus grand modèle ici dont vous pouvez télécharger les poids.

Features. Un contexte de 1 048 576 tokens, un raisonnement toujours actif derrière un réglage reasoning_effort de low, high ou max (max étant la valeur par défaut), et un dépôt moonshotai/Kimi-K3 sans restriction d'accès. La recherche web est facturée séparément, $0.005 par appel réussi.

Pros. Des poids ouverts à cette échelle sont inhabituels. Le taux de hit de cache de $0.30 face à un input de $3.00 en cas de cache manqué représente aussi une économie de 10x chaque fois que le contexte se répète. Et le milieu de gamme est couvert par un cousin moins cher, kimi-k2.7-code, à $0.95 et $4.00.

Cons. Il y a ici deux pièges opérationnels, et les deux mordent. K3 n'est pas pris en charge sur le palier batch, donc la remise de 60% dont bénéficient les autres modèles Kimi ne l'atteint pas. Le système de paliers est également conditionné par la dépense : le Tier 0, à partir de $1 de recharge cumulée, autorise 1 requête simultanée et 3 requêtes par minute, montant jusqu'à 1 000 simultanées et 10 000 RPM une fois le Tier 5 atteint à $3 000. La licence a l'air d'être de type MIT, mais ajoute une clause exigeant un accord séparé pour les activités de modèle-en-tant-que-service au-delà de $20M de revenus sur douze mois consécutifs quelconques.

Pricing. $3.00 en entrée et $15.00 en sortie, avec $0.30 sur un hit de cache. À 12,5x le taux de sortie d'Inkling-Small, personne ne devrait confondre cela avec un mouvement latéral. Les tableaux de paliers complets sont dans les prix de Kimi K3.

My take: le choix quand la charge de travail est une longue exécution d'agent plutôt que des milliers de réponses courtes. Pour un trafic en forme de tickets, le justifier face à GLM-5.2 à un tiers du prix devient difficile.

6. Qwen3.8-Max

Best for: un modèle fermé avec une fenêtre vraiment généreuse et une allocation d'essai gratuite.

Qwen's chat interface, Alibaba Cloud's assistant and API front end, as taken from Alibaba Cloud

Qwen3.8-Max est l'endroit où l'on atterrit une fois qu'on a décidé que les poids ouverts ne sont pas le sujet et que le niveau commercial haut de gamme d'Alibaba l'est. La bonne surprise sur la page de facturation est que Max a enfin abandonné les paliers par longueur d'entrée. Une seule bande, couvrant toute la fenêtre d'un million de tokens.

Features. Un contexte de 1M, une sortie maximale de 131K et un raisonnement maximal de 262K, avec un TPM de 2 millions contre un RPM de 15 000. La mise en cache implicite coûte $0.25. Il existe aussi un quota gratuit d'1 million de tokens, valable 90 jours.

Pros. L'absence de paliers par longueur d'entrée est une affaire plus importante qu'il n'y paraît. Sur l'ancien qwen3-max, la règle de palier d'Alibaba fonctionnait en tout ou rien, si bien que franchir une limite refacturait toute la requête et un prompt de 33K tokens passait de $1.20 à $2.40 en entrée. Ici, ce piège a disparu. Le million de tokens gratuit donne aussi une vraie marge pour évaluer correctement.

Cons. Un seul identifiant de modèle, deux prix, selon la portée du déploiement : $2.00 et $6.00 sur les tableaux International et Singapore, $1.65 et $4.951 sur les tableaux Global. Un écart de 18% sans aucune différence de comportement derrière est déroutant à budgétiser. Le quota gratuit est réservé à Singapore, son compteur ne s'arrête pas en cas d'inactivité, et ce qui reste est annulé à l'expiration. Le batch retire 50% mais ne se cumule pas avec les remises de cache. Max est également fermé, et les poids Qwen publiés ont deux générations de retard, le plus récent datant du 24-04-2026.

Pricing. $2.00 en entrée et $6.00 en sortie sur International et Singapore, puis $1.65 et $4.951 sur Global. La création de cache explicite coûte $2.50, soit 125% de l'entrée. Le détail complet est dans notre article sur les prix de Qwen3.8-Max, et il y a le tour d'horizon des alternatives à Qwen3.8-Max si vous cherchez dans l'autre sens.

My take: solide, et légèrement surévalué face à GLM-5.2, qui demande moins et vous donne les poids. Le quota gratuit reste une raison d'essayer.

7. Gemini 3.6 Flash

Best for: l'entrée audio et multimédia mixte sans payer de surprime pour le média.

Google's Gemini web app, as taken from Google

Étiez-vous sur Inkling-Small spécifiquement pour l'entrée audio ? Alors voici le remplacement le plus proche avec un vrai niveau de service derrière. Gemini 3.6 Flash facture un tarif d'entrée plat unique de $1.50 couvrant texte, image, vidéo, audio et PDF, ce qui rompt un schéma que Google lui-même avait établi. Sur Gemini 2.5 Flash, l'entrée audio coûtait $1.00 contre $0.30 pour le texte, et sur 2.0 Flash le multiple atteignait 7x.

Features. 1 048 576 tokens d'entrée contre 65 536 en sortie, mise en cache à $0.15 par million plus $1.00 par million par heure de stockage, avec les paliers Batch et Flex tous deux à moitié prix, $0.75 et $3.75.

Pros. Le tarif média plat est l'atout ici, et un palier Batch à $0.75 et $3.75 rend le travail en volume abordable. La page de tarification de Google le liste comme stable plutôt qu'en aperçu, ce qui compte si ça se rapproche des clients.

Cons. Ce plafond de sortie de 65 536 est le plus serré ici, donc les générations longues doivent être découpées. La facturation du cache basée sur le stockage fonctionne comme un compteur plutôt qu'un coût unique, contrairement aux tarifs plats de lecture de cache ailleurs. Les poids sont fermés, donc pas d'auto-hébergement. L'ancrage sur Gemini 3.x n'est pas non plus disponible au palier gratuit, ce qui signifie qu'évaluer coûte de l'argent.

Pricing. Le standard est de $1.50 en entrée et $7.50 en sortie, Batch ou Flex à $0.75 et $3.75, Priority à $2.70 et $13.50. Là où le budget est la contrainte, Gemini 3.5 Flash-Lite arrive à $0.30 et $2.50, et n'a pas non plus de séparation audio. L'échelle complète est dans les prix de Gemini 3.6 Flash.

My take: le choix pour l'audio. Aussi le seul modèle ici auquel j'enverrais du multimédia mixte en volume sans hésiter.

8. Claude Opus 5

Best for: les cas où une réponse fausse mais sûre d'elle coûte réellement de l'argent.

Claude's web app, as taken from Anthropic

C'est le bout extrême de l'échelle, et une raison l'a placé sur la liste. Il répond au problème spécifique qu'a Inkling-Small. Claude Opus 5 coûte $5.00 en entrée et $25.00 en sortie, environ 21x le taux de sortie d'Inkling-Small, et on l'achète quand l'inconvénient d'une réponse fausse dépasse la facture de tokens.

Features. Le plein contexte de 1M au tarif standard, avec aucun palier de surtaxe pour contexte long, ce qui est inhabituel. Les documents de tarification d'Anthropic le précisent : une requête de 900k tokens est facturée au même tarif par token qu'une requête de 9k. Les lectures de cache coûtent $0.50. L'API Batch retire un forfait de 50% sur les deux côtés, $2.50 et $12.50, et se cumule avec la mise en cache.

Pros. Sans falaise de longueur de contexte, toute une catégorie de mauvaise surprise de facturation disparaît. La réflexion étendue ne porte pas de prix séparé et est facturée comme une sortie standard. Batch combiné à la mise en cache fait aussi baisser considérablement les charges de travail lourdes et répétées par rapport au prix affiché.

Cons. Dans toute comparaison de coûts, le tokenizer est le piège. Anthropic note que Claude 4.7 et les versions suivantes « produisent environ 30% de tokens en plus pour le même texte » que l'ancien tokenizer, donc ce prix affiché de $25.00 sous-estime le véritable écart par tâche face à un concurrent qui utilise encore un tokenizer plus ancien. Le mode Fast double les deux côtés à $10.00 et $50.00, ne fonctionne que sur l'API du fournisseur d'origine, et ne se cumule pas avec Batch. Les poids sont fermés.

Pricing. Standard $5.00 et $25.00, Batch $2.50 et $12.50, mode Fast $10.00 et $50.00, lecture de cache $0.50. L'étape moins chère est Sonnet 5 à $2.00 et $10.00 jusqu'au 31 août 2026, qui passe à $3.00 et $15.00 le 1er septembre. Le moment où cet écart vaut la peine d'être payé est couvert dans notre comparaison Opus 5 contre Sonnet 5.

My take: excessif pour la plupart des trafics de tickets, exactement adapté pour les 5% qui touchent à l'argent, à une politique ou à un contrat. Routez selon le type de question plutôt que de choisir un seul modèle pour tout.

The price ladder, in one picture

Alignez les huit côte à côte sur le prix de sortie, et la forme de la décision devient évidente.

Bar chart of output price per million tokens across seven models, with Inkling-Small highlighted near the bottom of the range
Bar chart of output price per million tokens across seven models, with Inkling-Small highlighted near the bottom of the range

Inkling-Small est déjà proche du plancher. Il existe exactement une marche significative en dessous, DeepSeek V4 Flash à $0.28, plus un déplacement latéral au même prix chez MiniMax M3. Tout le reste ici est une marche vers le haut, et ce qu'une marche vers le haut achète n'est jamais la vitesse.

Cela vaut la peine de faire le calcul de ce que tout cela coûte à l'échelle des tickets. Prenez mille tickets sur un mois, puis comptez 2 000 tokens de sortie par réponse, ce qui est généreux pour une réponse de support. Soit 2 millions de tokens de sortie.

ModelOutput cost, 2M tokensAgainst Inkling-Small
DeepSeek V4 Flash$0.56$1.84 cheaper
Inkling-Small$2.40baseline
MiniMax M3$2.40identical
GLM-5.2$8.80$6.40 more
Inkling$8.10$5.70 more
Gemini 3.6 Flash$15.00$12.60 more
Kimi K3$30.00$27.60 more
Claude Opus 5$50.00$47.60 more

À ce volume, l'écart total du moins cher au plus cher est d'environ $50 par mois. Une escalade mal gérée vous coûte plus que ça. Ce qui constitue l'argument réel pour monter dans l'échelle, et aussi pourquoi le choix du modèle n'est pas là où se trouve le plus gros levier.

Ce qu'aucun de ces modèles ne règle sur une file de support

Aucune des huit lignes ci-dessus ne résout la partie suivante, et c'est pourquoi je continue à pousser quand quelqu'un me dit avoir trouvé un modèle moins cher.

J'ai vu cet échec précis se produire sur des comptes payants. Un modèle ne s'arrête pas quand la récupération revient vide. Il comble le vide avec ce qu'il a appris à l'entraînement. Un client, un fournisseur danois d'énergie solaire, a eu son bot fabriquer de fausses affirmations sur des abonnements et les envoyer à de vrais clients. Un autre a posé une question à son bot et a reçu « Oxygen (periodic table) » en retour. Aucun de ces cas n'était un mauvais modèle. Les deux étaient un modèle sans rien contre quoi s'ancrer, et sans rien pour l'empêcher de deviner.

Un responsable support sur nos comptes a formulé la même inquiétude en des termes plus directs, en disant à l'IA ce qu'elle ne devait pas faire :

"stop telling customers that we will get them sorted. You dont know that"

Un responsable support e-commerce, inquiet qu'un bot promette trop sur les délais de livraison. Même forme de problème. Le modèle a l'air sûr, et cet air sûr est précisément la partie dangereuse. La ventilation AA-Briefcase propre à Inkling-Small le dit elle-même, présentant 270,86 points Elo de mieux qu'il n'analyse.

Two paths for one customer question: a raw model answering from memory versus a grounded model that scores its confidence and escalates
Two paths for one customer question: a raw model answering from memory versus a grounded model that scores its confidence and escalates

Un modèle plus gros n'est pas la solution. Deux choses qu'un modèle n'apporte pas de série le sont. D'abord l'ancrage, pour que la réponse sorte de votre centre d'aide et de vos anciens tickets plutôt que de la mémoire paramétrique. Ensuite une porte de confiance, pour que tout ce qui est sous la barre aille vers une personne au lieu de sortir. Ces deux éléments transforment un moteur brut en quelque chose que vous pouvez pointer vers une file en production, et c'est tout le sujet de la prévention des hallucinations d'IA.

L'autre raison pour laquelle les gens arrêtent de comparer des modèles est plus prosaïque que cela. Un développeur avec qui nous avons parlé, en train de monter une base de connaissances sur les incidents informatiques, avait déjà fait le tour. Il a essayé l'API d'un fournisseur et l'a trouvée trop coûteuse, en a essayé une autre et l'a trouvée peu fiable, et au final voulait juste quelque chose qui fonctionne. Comparer des modèles, c'est amusant. Maintenir une couche modèle, ça ne l'est pas.

Try eesel

Si le modèle que vous choisissez va répondre à des questions de clients, le conseil honnête vient en deux parties. Prenez celui des huit ci-dessus qui correspond à votre budget et à votre licence. Puis ne construisez pas vous-même la couche au-dessus.

Cette couche, c'est ce qu'est eesel. Il se branche sur Zendesk, Freshdesk ou tout ce que vous utilisez déjà, apprend à partir de vos tickets résolus et de votre centre d'aide plutôt que des données d'entraînement d'un modèle, et ne répond qu'une fois qu'il franchit un seuil de confiance que vous définissez vous-même. Tout ce qui est en dessous est escaladé. Et avant de toucher au trafic réel, vous pouvez le simuler contre votre propre historique de tickets, ce qui permet d'apprendre ce qu'il aurait mal fait avant qu'un client ne le découvre.

The eesel AI helpdesk dashboard, where an AI teammate resolves and drafts support tickets
The eesel AI helpdesk dashboard, where an AI teammate resolves and drafts support tickets

J'ai mis notre propre taux d'erreur factuelle mesuré de 7% en avant plutôt que de l'enterrer, parce que c'est le chiffre qui compte pendant que vous choisissez un modèle. Il provient du trafic Zendesk réel d'un détaillant allemand de bijouterie, environ mille tickets par mois, validé de façon croisée sur 284 chats et 100 tickets, avec de la récupération sur leur véritable centre d'aide. L'ancrage ne vous amènera pas à zéro. Il donne un chiffre que vous pouvez mesurer, encadrer, puis améliorer, et c'est une catégorie différente d'un modèle qui devine avec assurance.

L'approche commerciale n'est délibérément pas non plus au poste. La facturation se fait au ticket résolu, donc le tarif suit le travail réalisé et non l'effectif. Gratuit à l'essai. Si vous préférez d'abord vérifier les chiffres, le guide de déviation de tickets est un bon point de départ.

My take

Inkling-Small est un bon petit modèle à qui l'on demande sans cesse un travail pour lequel il n'a pas été conçu. Il exécute bien et à un prix déjà proche du plancher, et sa fiabilité de connaissance mesure -9,0. Ces deux faits ne sont pas en tension. Ensemble, ils décrivent un outil.

Vous partez pour le coût ? Prenez DeepSeek V4 Flash et c'est réglé. Si ce sont les réponses fausses qui vous poussent dehors, montez vers le parent Inkling pour la solution bon marché, ou vers Claude Opus 5 pour la solution coûteuse, en sachant qu'aucune des deux ne vous amène à zéro.

Et si la raison est que la fenêtre de contexte ne correspond pas à la fiche, GLM-5.2 sert ce qu'il annonce, sous MIT. C'est la ligne que je prendrais si je devais m'en tenir à une seule.

Le verdict honnête sur les huit reste néanmoins le même. Changer de moteur déplace votre facture et vos scores de benchmark. Cela ne touche pas ce qui se passe quand un client pose une question à laquelle votre documentation n'a jamais répondu. Combler cet écart demande de la récupération, un seuil de confiance, une transmission. Aucune montée en gamme de modèle ne le fait à votre place, et cela vaut la peine d'être résolu avant de passer un autre après-midi à lire des benchmarks de classification de tickets par IA.

Questions fréquentes

Quelles sont les meilleures alternatives à Inkling-Small ?
Pour la plupart des équipes, tout se ramène à trois options : DeepSeek V4 Flash si vous voulez faire le même travail moins cher, Inkling lui-même si vous voulez la même famille avec une meilleure fiabilité factuelle, et Claude Opus 5 si une réponse fausse coûte réellement de l'argent. La liste complète de cet article couvre aussi GLM-5.2, MiniMax M3, Kimi K3, Qwen3.8-Max et Gemini 3.6 Flash.
Existe-t-il une alternative moins chère à Inkling-Small ?
Oui. Le prix de DeepSeek V4 Flash est de $0.14 en entrée et $0.28 en sortie par million de tokens, contre $0.30 et $1.20 pour Inkling-Small, donc la sortie est environ quatre fois moins chère. MiniMax M3 égale exactement Inkling-Small à $0.30 et $1.20 en dessous de 512K d'entrée. Si vous essayez de réduire votre coût par résolution, le poste modèle est rarement le plus gros.
Pourquoi changer d'Inkling-Small ?
À cause de sa fiabilité de connaissance. Artificial Analysis note Inkling-Small à -9.0 sur l'AA-Omniscience Index avec 30,5% de précision, tandis que son modèle parent se situe à 2,05 avec 39,95%. Cet écart est ce qui se traduit par des hallucinations d'IA dans le support lorsque le modèle reçoit une question que votre base de connaissances ne couvre pas.
Inkling-Small a-t-il vraiment une fenêtre de contexte de 1M ?
La fiche du modèle indique 1M et aucun de ses deux fournisseurs ne le sert réellement. Thinking Machines sert 256 000 tokens et DeepInfra 524 288, selon Artificial Analysis. Le même écart existe sur le modèle parent. Si le contexte long est la raison de votre choix, consultez l'article explicatif sur Inkling-Small avant de construire en vous basant sur 1M.
Quelle alternative à Inkling-Small a la meilleure licence ouverte ?
DeepSeek V4 Flash et GLM-5.2 sont tous deux distribués sous MIT, ce qui constitue la position commerciale la plus propre du groupe. Inkling-Small et son modèle parent sont en Apache 2.0. Kimi K3 et MiniMax M3 portent tous deux des licences personnalisées avec des seuils de revenus, et celle de MiniMax est non commerciale par défaut. Pour un panorama plus large, voir notre tour d'horizon des agents IA open source.
Combien coûte l'exploitation d'une alternative à Inkling-Small sur des tickets de support ?
Les tokens représentent le petit chiffre. À $1.20 par million de tokens de sortie, un mois de mille tickets coûte quelques dollars en inférence. Ce qui coûte réellement de l'argent, c'est la couche de récupération (retrieval), la logique d'escalade et le contrôle qualité, ce pour quoi la plupart des équipes achètent cette couche plutôt que de la construire. Notre page tarifaire facture au ticket résolu plutôt qu'au poste, et le coût du service client avec IA détaille le calcul.
Puis-je auto-héberger une alternative à Inkling-Small au lieu de payer par token ?
Oui, et les poids de DeepSeek V4 Flash, GLM-5.2, Kimi K3 et MiniMax M3 sont tous publiés. La facture se déplace vers le matériel au lieu de disparaître, et vous héritez aussi du service, des évaluations et des mises à jour. Les équipes qui prennent cette voie pour le service client avec IA découvrent souvent que le modèle n'était jamais la partie difficile.
Inkling-Small suffit-il seul pour le support client ?
Pas seul, et rien d'autre dans cette liste non plus. Un modèle brut répond à partir des données d'entraînement quand la récupération revient vide, ce qui est exactement comment une réponse fausse mais sûre d'elle arrive jusqu'au client. La solution passe par l'ancrage (grounding) plus une porte de confiance qui bascule le cas, ce dont traitent la gestion des escalades avec IA et la transmission à un agent.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Un développeur choisissant entre des fiches de modèles, avec la fiche de la baleine DeepSeek au centre entourée de modèles concurrents
Alternatives

Les 8 meilleures alternatives à DeepSeek V4 Flash en 2026

Huit vraies alternatives à DeepSeek V4 Flash, comparées sur les chiffres. Personne ne change pour le prix ou la vitesse, alors je les classe selon les quatre lacunes réelles de Flash.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 4, 2026
Illustration d'une personne comparant plusieurs super-agents d'IA comme alternatives à Skywork AI
Alternatives

7 meilleures alternatives à Skywork AI en 2026

Les meilleures alternatives à Skywork AI en 2026, des super-agents généralistes comme Manus aux outils de recherche, créateurs de présentations et une option spécialisée dans le support, avec de vrais prix.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Une personne au téléphone face à trois options d'agent vocal différentes, avec le logo Grok à gauche
Alternatives

Les 10 meilleures alternatives à Grok Voice Think Fast 2 en 2026

Grok Voice Think Fast 2.0 vient de devenir 60% plus cher sur l'alias par défaut. Dix vraies alternatives, avec coût horaire mesuré et chiffres de benchmark honnêtes.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Illustration éditoriale pour un comparatif des alternatives à Google Gemini 3.5 Pro
Alternatives

8 meilleures alternatives à Gemini 3.5 Pro en 2026

Vous cherchez des alternatives à Gemini 3.5 Pro ? Le hic : 3.5 Pro n'est pas encore disponible. Voici 8 modèles que vous pouvez réellement utiliser dès aujourd'hui, avec de vrais tarifs et nos recommandations.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustration éditoriale représentant une comparaison de modèles d'IA phares comme alternatives à GPT-5.6 Sol
Alternatives

9 meilleures alternatives à GPT-5.6 Sol en 2026

GPT-5.6 Sol est le modèle phare d'OpenAI, au prix d'un modèle phare : 5$/30$ par million de tokens, le même tarif que GPT-5.5. Voici 9 vraies alternatives à Sol, et à qui chacune convient.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026
Les meilleures alternatives à GPT-Live en 2026, un panorama des outils d'IA vocale en temps réel
Alternatives

Les 8 meilleures alternatives à GPT-Live en 2026

GPT-Live est impressionnant, mais ce n'est pas la seule IA vocale en temps réel qui mérite votre attention. Voici 8 alternatives à GPT-Live en 2026, de Gemini Live aux plateformes de création d'agents vocaux.

Rama Adi NugrahaRama Adi NugrahaJul 13, 2026
Illustration éditoriale représentant une comparaison de modèles de chat IA en tant qu'alternatives à GPT-5.6
Alternatives

Les 9 meilleures alternatives à GPT-5.6 en 2026

GPT-5.6 est passé aujourd'hui d'un accès anticipé restreint par le gouvernement à un déploiement mondial, exactement au même prix que GPT-5.5. Voici 9 alternatives réelles, et à qui chacune convient.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 9, 2026
Illustration éditoriale représentant une comparaison de modèles de chat IA en tant qu'alternatives à Grok 4.5
Alternatives

9 meilleures alternatives à Grok 4.5 en 2026

Grok 4.5 est rapide et bon marché, mais il est n° 4 sur l'Intelligence Index et traîne de vrais soucis de confiance. Voici 9 alternatives réelles, et à qui chacune convient exactement.

Alicia Kirana UtomoAlicia Kirana UtomoJul 9, 2026
Grille de vignettes visuelles générées par IA dans des tons bleus représentant des alternatives à Meta Muse Image
Alternatives

Les 8 meilleures alternatives à Meta Muse Image en 2026

Meta Muse Image vient tout juste d'être lancé, mais Nano Banana Pro, GPT Image 2, Midjourney et cinq autres générateurs d'images IA le surpassent déjà en qualité, prix ou contrôle.

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement