Les 8 meilleures alternatives à Inkling-Small en 2026

Kurnia Kharisma Agung Samiadjie
Écrit par

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 4, 2026

Vérifié par un expert
Un petit modèle mis de côté tandis que cinq modèles alternatifs captent la lumière

Pourquoi on regarde déjà au-delà d'Inkling-Small

Thinking Machines Lab a lancé Inkling-Small le 30/07/2026 sous licence Apache 2.0, quinze jours après le modèle parent. Le pari était raisonnable et le modèle le tient effectivement. Un quart de la taille du parent, plus rapide et moins cher aussi, et sur la propre fiche du fournisseur, il bat même le parent sur SWE-bench Verified, 80,2 contre 77,6.

L'accueil sur r/LocalLLaMA avait beaucoup à dire sur ce mot « small ». Le troisième commentaire le plus voté du fil de lancement ne parle pas de benchmarks du tout :

Reddit

« Bientôt, avec tous ces modèles de 2-3T, ils vont appeler « small » des modèles de 500-700B... en pleurs avec 12 Go de VRAM »

C'est vrai. Mais ce n'est pas le nom qui pousse les gens à quitter le modèle. C'est ce qu'il sait.

Artificial Analysis le classe à un Intelligence Index de 40, rang #15 sur 101, ce qui est assez respectable. Puis la même page rapporte le test de connaissance AA-Omniscience : un indice de -9,0, une précision de 30,5 %, un taux d'hallucination de 56,9 %. AA décrit cette évaluation comme mesurant la « fiabilité des connaissances et l'hallucination » sur une plage de -100 à 100. Un chiffre négatif là-dedans n'est donc pas un artefact d'arrondi. C'est le modèle qui cherche une réponse qu'il n'a pas.

L'analyse AA-Briefcase est la partie à laquelle je reviens sans cesse. Un Elo global de 917,13, qui ne dit pas grand-chose jusqu'à ce qu'on le décompose : présentation 1067,99 contre qualité analytique de 797,13. Le modèle écrit une meilleure réponse qu'il n'en sait réellement.

Les personnes qui font tourner ces modèles sur leur propre matériel l'ont remarqué rapidement, et sur un axe plus tranchant que celui des tableaux de benchmarks :

Reddit

« Mais moins bon que GPT 5.5 Luna sur l'indice Omniscience, car il invente trop de réponses. 84 % de taux d'hallucination, c'est pourquoi je préfère d'autres modèles ouverts, ils sont meilleurs pour « détecter » leur propre incertitude. »

Ce chiffre de 84 % est plus élevé que les 56,9 % affichés aujourd'hui sur la page AA, donc prenez le chiffre exact comme sa lecture et non la mienne. Dans les deux cas, le point tient toujours, et c'est le bon point à faire valoir. Ils choisissent un modèle selon s'il sait quand il ne sait pas, plutôt que selon sa qualité en code.

Trois raisons pour lesquelles les équipes quittent Inkling-Small, chacune pointant vers un modèle de remplacement différent
Trois raisons pour lesquelles les équipes quittent Inkling-Small, chacune pointant vers un modèle de remplacement différent

Trois autres choses poussent les gens à le quitter. Le prix n'en fait pas partie.

La fenêtre de contexte n'est pas la fenêtre de contexte. AA liste le modèle à 1M de tokens. Ce que ses deux fournisseurs servent réellement est 256 000 (Thinking Machines) et 524 288 (DeepInfra). Donc quiconque a lu « 1M » sur la fiche et a construit en s'appuyant sur ce chiffre ne l'obtient pas. Même problème sur le modèle parent, où le meilleur chiffre servi est de 524k chez trois fournisseurs, et la ligne la moins chère et la plus rapide de DeepInfra plafonne à 131k.

Deux fournisseurs, c'est mince. Le parent en a trois, et le groupe qui sert DeepSeek ou GLM est encore plus grand. Le jour du lancement, le modèle n'était même pas sur OpenRouter, une lacune qu'un commentateur a signalée sur Hacker News en même temps que les décomptes de paramètres. Les deux fournisseurs dont vous disposez se comportent aussi différemment. DeepInfra tourne 1,43 fois plus vite sur une charge de 10k, puis se retrouve derrière le fournisseur natif à 100k, 82,36 tokens par seconde contre 113,36. Votre profil de latence change selon la longueur du prompt, et c'est une chose terrible à découvrir en production.

Une couverture mince laisse aussi moins de marge pour comparer les options quand un fournisseur commence à faire des économies, ce qui arrive plus souvent que ne le laissent voir les benchmarks publiés :

Hacker News

« En fait, nous avons constaté que beaucoup de fournisseurs d'inférence quantifient les poids ou même le cache KV, et à cause des prix bas auxquels ils servent en lots massifs, cela entraîne un débit instable. »

Le prix n'est pas un seul chiffre. Le fournisseur natif est à 0,30 $ en entrée et 1,20 $ en sortie. DeepInfra demande 0,58 $ et 1,44 $ pour le contexte plus long. En mélangé, AA affiche 0,222 $ sur son ratio par défaut de 7:2:1, tandis que le mélange classique de 3:1 arrive à 0,525 $. Donc quel que soit le chiffre unique que vous finissez par citer, c'est en réalité un choix de ratios, et ce choix compte dès que vous modélisez le coût du service client IA à grand volume.

Pour être honnête, tout cela ne fait pas d'Inkling-Small un mauvais modèle. Le raisonnement représente 95,5 % de sa facture de sortie, ce qui est exactement d'où vient l'intelligence, et GPQA Diamond à 89,5 % plus le raisonnement à contexte long à 63 % sont de vrais chiffres. C'est un exécutant. Les ennuis ne commencent que lorsqu'on demande à un exécutant d'être un sachant.

Comment j'ai choisi ces huit

J'écris beaucoup de ces récapitulatifs et le piège ne change jamais. Classer par benchmark, publier, passer à autre chose. Alors j'ai gardé le filtre plus étroit ici.

Chacune des huit devait être quelque chose vers lequel un utilisateur d'Inkling-Small pourrait basculer cette semaine, donc une API publique en production avec des tarifs publiés, sans liste d'attente. Chaque prix vient de la page de facturation propre du fournisseur au 05/08/2026 plutôt que d'un site comparateur, car les chiffres de ces sites deviennent obsolètes en moins de deux semaines. Là où un fournisseur publie à la fois le contexte servi et le contexte annoncé, j'ai vérifié l'un contre l'autre. J'ai aussi lu les licences, et cela a compté, car deux modèles ici ont des seuils de revenus cachés dans les leurs.

Ce que je n'ai pas fait, c'est prétendre que six mois de trafic de production sont passés par les huit. J'ai lu la documentation et les pages de facturation, les fiches des modèles, les mesures AA, puis je n'ai dit que ce que cela permettait d'étayer.

Les meilleures alternatives à Inkling-Small en un coup d'œil

Tous les prix ci-dessous sont par million de tokens en USD, vérifiés le 05/08/2026.

ModèleIdéal pourPoidsParamètresEntréeSortieContexte réelModalités en entréeLe hic
Inkling-Small (référence)Exécution agentique bon marchéApache 2.0276B / 12B actifs (266B selon AA)0,30 $1,20 $256K natif, 524 288 chez DeepInfraTexte, image, audioIndice de connaissance -9,0
DeepSeek V4 FlashMême travail, un quart du coûtMIT284B / 13B0,14 $0,28 $1MTexteUne surtaxe 2x aux heures de pointe est annoncée
Inkling, le parentRester dans la famille, en sachant plusApache 2.0975B / 41B1,00 $4,05 $524K au mieux, 131K au moins cherTexte, image, audioDeux pages AA citent des prix différents
GLM-5.2Les poids ouverts les plus solides que vous puissiez hébergerMIT~753B au total1,40 $4,40 $1MTextePlafond de sortie de 128K
MiniMax M3Entrée vidéo, au prix d'Inkling-SmallLicence communautaire propre428B / 23B0,30 $1,20 $1M, 512K garantiTexte, image, vidéoNon commercial par défaut
Kimi K3Travail d'agent longue duréeLicence propre (Kimi K3 Licence)2,8T3,00 $15,00 $1 048 576TextePas de palier batch, 3 RPM au palier d'entrée
Qwen3.8-MaxModèle fermé, fenêtre généreuseFerméNon divulgué2,00 $6,00 $1MTexteDeux prix pour un seul modèle
Gemini 3.6 FlashEntrée audio sans surcoûtFerméNon divulgué1,50 $7,50 $1 048 576Texte, image, vidéo, audio, PDFPlafond de sortie de 65 536
Claude Opus 5Quand les mauvaises réponses coûtent de l'argentFerméNon divulgué5,00 $25,00 $1M, sans surtaxeTexte, imageLe tokenizer plus récent émet ~30 % de tokens en plus

Quelle alternative à Inkling-Small correspond à votre raison de partir ?

Choisissez la phrase qui ressemble le plus à votre semaine.

Optez pour Claude Opus 5, ou pour l'Inkling parent si le budget est serré

5,00 $ / 25,00 $Opus 5, par 1M de tokens 1,00 $ / 4,05 $Inkling, par 1M de tokens 2,05 vs -9,0Inkling vs Small, AA-Omniscience

L'indice de connaissance d'Inkling-Small est négatif et celui de son parent est positif, donc la vraie solution la moins chère est de monter d'un cran dans la même famille : même licence, même outillage, environ 3,4 fois le prix de sortie. Opus 5 coûte beaucoup plus, et c'est le choix à faire lorsqu'une mauvaise réponse signifie un remboursement, un problème de conformité ou un client perdu.

Aucun modèle de cette liste n'atteint zéro. L'ancrage dans vos propres documents plus un seuil de confiance font plus pour la précision que n'importe quelle mise à niveau ici.

Optez pour DeepSeek V4 Flash

0,14 $ / 0,28 $par 1M de tokens 4,3xsortie moins chère qu'Inkling-Small MITlicence sur les poids

Les hits de cache tombent à 0,0028 $ par million, soit 50 fois moins que son propre taux de cache manqué, donc une charge répétitive devient très vite très bon marché. Poids MIT, contexte de 1M, 2 500 requêtes simultanées selon les limites publiées. MiniMax M3 est le dauphin, exactement au tarif d'Inkling-Small, avec l'entrée vidéo en prime.

DeepSeek a annoncé une surtaxe 2x aux heures de pointe de 09h00 à 12h00 et de 14h00 à 18h00, heure de Pékin. Pas encore de date de début, donc modélisez votre pic contre le tarif doublé.

Optez pour DeepSeek V4 Flash ou GLM-5.2

1Mservi, les deux modèles 256KInkling-Small, natif 384K / 128Ksortie max, DeepSeek / GLM

Les deux annoncent une fenêtre de 1M et les deux la servent réellement, ce qui est la différence qui compte. GLM-5.2 coûte le même prix que GLM-5.1 à 200K, donc la fenêtre est arrivée gratuitement. Surveillez tout de même les plafonds de sortie : DeepSeek autorise 384K en sortie, GLM plafonne à 128K.

Contexte long et raisonnement à contexte long sont deux choses différentes. Inkling-Small obtient 63 % au test de raisonnement à contexte long d'AA, donc une fenêtre plus grande seule ne réglera pas un problème de mémoire.

Optez pour Kimi K3, ou Gemini 3.6 Flash si vous avez besoin de l'audio

3,00 $ / 15,00 $Kimi K3, par 1M 1,50 $ / 7,50 $Gemini 3.6 Flash, par 1M 2,8Tparamètres de Kimi K3

Kimi K3 est conçu pour des exécutions d'agent longue durée et ses poids sont publics, à 2,8 billions de paramètres en 4 bits. Gemini 3.6 Flash facture un tarif d'entrée fixe unique sur texte, image, vidéo, audio et PDF, ce qui est inhabituel et utile si vos entrées sont mélangées.

Kimi K3 n'a pas de palier batch et le palier de dépense d'entrée autorise 3 requêtes par minute. Vérifiez les limites de débit face à votre trafic avant de vous engager.

1. DeepSeek V4 Flash

Idéal pour : faire ce que fait Inkling-Small, à environ un quart du coût de sortie.

L'interface de chat web gratuite de DeepSeek, capturée depuis DeepSeek

C'est la comparaison à laquelle un vrai utilisateur d'Inkling-Small pense en premier, et c'était aussi le commentaire le plus substantiel du fil de lancement sur r/LocalLLaMA :

Reddit

« Je me demande comment il se compare à DSV4 Flash. Comparable sur le benchmark d'intelligence d'Artificial Analysis (tous les deux à 40). Semble un peu meilleur en codage / workflows agentiques cependant. »

Voilà la forme que ça prend. DeepSeek V4 Flash tourne avec 284B au total et 13B actifs, à côté des 12B d'Inkling-Small, et AA place les deux à 40. Moteur similaire. Facture pas si similaire.

Il y a une chose que les décomptes de paramètres cachent, et elle compte si l'auto-hébergement est sur votre liste. DeepSeek se distribue nativement en FP4 et FP8 mixtes là où Inkling-Small se distribue en bf16, donc à précision native, un exécuteur local a placé l'un à environ 160 Go contre 540 Go. Sur le papier, à peu près la même taille. En pratique, trois fois plus de mémoire.

Fonctionnalités. Poids sous licence MIT sur Hugging Face, plus une fenêtre de contexte de 1M et une sortie maximale de 384K, la plus grande de cette liste, et de loin. La limitation de débit se fait par concurrence plutôt que par requêtes par minute, avec un plafond publié de 2 500 requêtes simultanées par compte.

Avantages. L'économie du cache est la vraie histoire ici. Un hit de cache coûte 0,0028 $ par million de tokens d'entrée, 50 fois moins que le taux de cache manqué de 0,14 $, donc tout ce qui a un prompt système stable devient absurdement bon marché. Et MIT est la licence la plus propre du groupe, aucun seuil de revenus, aucune clause d'attribution.

Inconvénients. Texte uniquement, donc tout l'audio que vous fournissiez à Inkling-Small n'a plus nulle part où aller. Il y a aussi une note de bas de page sur la page de tarifs annonçant une future surtaxe 2x aux heures de pointe entre 09h00 et 12h00 et 14h00 et 18h00, heure de Pékin, avec une date d'entrée en vigueur « sous réserve de l'annonce officielle ». Une inconnue connue logée dans votre modèle de coûts.

Tarifs. 0,14 $ en entrée et 0,28 $ en sortie par million, hits de cache à 0,0028 $. Pro se situe à 0,435 $ et 0,87 $, soit exactement 3,1 fois Flash des deux côtés. Les exemples chiffrés se trouvent dans notre analyse des tarifs de DeepSeek V4 Flash, et nous l'avons comparé à Kimi K3 séparément.

Mon avis : si l'argent est votre raison de partir, arrêtez de lire ici. Si c'est la précision, continuez, car devenir moins cher n'a jamais fait qu'un modèle sache plus.

2. Inkling, le parent

Idéal pour : rester sur les mêmes poids, le même outillage et la même licence tout en rachetant la fiabilité factuelle.

Inkling tournant en local dans Unsloth Studio avec un compteur de contexte de 1 048,6k, capturé depuis Unsloth
Inkling tournant en local dans Unsloth Studio avec un compteur de contexte de 1 048,6k, capturé depuis Unsloth

Souvent, l'alternative la plus intéressante à un petit modèle est le grand modèle dont il a été distillé, et ici les chiffres le démontrent clairement. Sous la même méthodologie AA, Inkling obtient 41 sur l'Intelligence Index contre 40 pour Small, donc match nul. AA-Omniscience est là où ils se séparent : 2,05 avec 39,95 % de précision, contre -9,0 et 30,5 %. Près d'un tiers de questions supplémentaires reviennent correctes.

Fonctionnalités. 975B au total avec 41B actifs sur 66 couches, Apache 2.0, et texte plus image plus audio en entrée. Trois fournisseurs de service désormais, là où le lancement n'en avait qu'un : DeepInfra, Together AI et Thinking Machines.

Avantages. Même licence, même famille, donc la migration se résume surtout à changer une chaîne de caractères du modèle. La ligne FP8 de DeepInfra est rapide, 201,5 tokens par seconde, et le coût par tâche d'Intelligence Index y ressort à 0,4296 $, bon marché pour ce niveau.

Inconvénients. Deux pages AA sont actuellement en désaccord sur le prix, donc mieux vaut savoir laquelle vous citez. La page du modèle indique 1,87 $ en entrée et 4,68 $ en sortie. Les lignes des fournisseurs indiquent toutes 1,00 $ et 4,05 $. Ces chiffres de fournisseurs restent cohérents entre eux sur les trois, donc c'est la paire contre laquelle je planifierais. Le contexte servi est aussi confus. Il est de 524k au mieux, et la ligne bon marché et rapide de DeepInfra plafonne à 131k, soit 13,1 % du million annoncé.

Tarifs. Selon les données des fournisseurs, 1,00 $ en entrée et 4,05 $ en sortie, avec 0,17 $ pour un hit de cache et 0,724 $ en mélangé. Appelons cela 3,4 fois le tarif de sortie de Small. Si c'est le parent que vous magasinez, l'article sur les alternatives à Inkling couvre la gamme plus large.

Mon avis : le choix évident, et celui que la plupart des gens sautent, parce que « passer au grand frère » donne l'impression d'admettre que le petit était une erreur. Ce n'était pas le cas. C'était juste le mauvais outil pour un travail de connaissance.

3. GLM-5.2

Idéal pour : les poids ouverts les plus solides de cette liste que vous pouvez réalistement héberger vous-même.

Le matériel de lancement de GLM-5.2 par Z.ai, capturé depuis Z.ai

GLM-5.2 est le cran au-dessus qui vous maintient en territoire sous licence MIT. Environ 753B paramètres au total, avec un contexte de 1M que son API sert réellement, et 2,23 millions de téléchargements sur le dépôt zai-org/GLM-5.2. Ce nombre de téléchargements indique que la communauté de l'auto-hébergement l'a déjà testé sous toutes les coutures.

Fonctionnalités. Poids MIT avec un contexte de 1M et une sortie maximale de 128K, puis une entrée en cache à 0,26 $, avec un stockage de cache listé comme gratuit pour l'instant. Z.ai vend aussi une formule d'abonnement. Le Coding Plan débute à 18 $ par mois, réduit à 12,60 $, avec 10 000 crédits par semaine.

Z.ai publie sa propre courbe de niveau d'effort, et la regarder vaut mieux que de prendre le score en gros titre au pied de la lettre :

Le graphique de Z.ai du score de codage agentique en fonction des tokens de sortie moyens par tâche, comparant GLM-5.2 et GLM-5.1 à deux versions de Claude Opus, capturé depuis Z.ai
Le graphique de Z.ai du score de codage agentique en fonction des tokens de sortie moyens par tâche, comparant GLM-5.2 et GLM-5.1 à deux versions de Claude Opus, capturé depuis Z.ai

Avantages. GLM-5.2 coûte le même prix que coûtait GLM-5.1, 1,40 $ et 4,40 $, et pendant ce temps la fenêtre de contexte est passée de 200K à 1M. Une mise à niveau gratuite, tout simplement. Une licence MIT sans clause de revenus vaut aussi plus qu'un ou deux points de benchmark une fois que vous livrez ça dans un produit.

Inconvénients. Ce plafond de sortie de 128K est le plus serré parmi les options en poids ouverts ici, comparé aux 384K de DeepSeek. Les crédits du Coding Plan se consument à 3x aux heures de pointe et 2x hors pointe, avec le tarif hors pointe temporairement à 1x jusqu'à fin septembre, donc les calculs de l'abonnement demandent de la surveillance.

Tarifs. 1,40 $ en entrée, 4,40 $ en sortie, 0,26 $ en cache. Des petits frères moins chers existent si vous pouvez vous contenter de moins. GLM-4.7 et GLM-4.6 sont tous deux à 0,60 $ et 2,20 $, tandis que GLM-4.7-FlashX est à 0,07 $ et 0,40 $.

Mon avis : le meilleur compromis licence-capacité de la liste. Si votre service juridique a déjà demandé ce qui se passe le jour où un fournisseur change ses conditions, montrez-lui cette ligne.

4. MiniMax M3

Idéal pour : égaler exactement le prix d'Inkling-Small tout en ajoutant l'entrée vidéo.

La page du modèle MiniMax M3, capturée depuis MiniMax

C'est un alignement direct de prix, ce qui rend la comparaison inhabituellement claire. Sous 512K d'entrée, MiniMax M3 facture 0,30 $ en entrée et 1,20 $ en sortie, identique au tarif natif d'Inkling-Small, pour un modèle de 428B avec 23B actifs. Ce qui vous laisse choisir sur tout sauf le coût.

Fonctionnalités. Un contexte de 1M avec 512K garanti comme minimum, des lectures de cache à 0,06 $, et une entrée texte plus image plus vidéo arrivant via des parties de contenu image_url et video_url. Le mode réflexion coûte pareil activé ou désactivé. Les poids sont disponibles en direct sur Hugging Face sous MiniMaxAI/MiniMax-M3, avec 170 353 téléchargements à ce jour.

Avantages. Presque le double des paramètres actifs d'Inkling-Small pour le même prix, avec l'entrée vidéo en plus, ce que rien d'autre à ce prix sur la liste n'offre. La page de tarifs qualifie le tarif actuel de « Réduction permanente de 50 % », et aucune date d'expiration n'y est indiquée où que ce soit.

Inconvénients. La licence est ici le vrai hic. La MINIMAX COMMUNITY LICENSE est non commerciale par défaut, l'usage commercial demande un crédit visible « Built with MiniMax M3 », et au-delà de 20 M$ de revenus annuels il faut une autorisation écrite. Au-delà de 512K d'entrée, les deux tarifs doublent, donc 0,60 $ et 2,40 $. Il existe aussi un niveau Priority, à 1,5x, si la file plus rapide en vaut la peine pour vous.

Tarifs. 0,30 $ et 1,20 $ jusqu'à 512K d'entrée, puis 0,60 $ et 2,40 $ au-delà, lectures de cache à 0,06 $. Priority tourne à 0,45 $ et 1,80 $, ou 0,90 $ et 3,60 $ une fois le seuil dépassé.

Mon avis : bon moteur, licence qu'il faut s'asseoir pour lire. Une startup sous la ligne des revenus, contente d'afficher le crédit, obtient ici plus de modèle par dollar que ce qu'elle quitte.

5. Kimi K3

Idéal pour : le travail d'agent longue durée où l'exécution compte plus que le prix du token.

L'interface de chat de Kimi, l'assistant et le frontend d'agent de Moonshot AI, capturé depuis Moonshot AI

Kimi K3 est un bond bien plus grand que tout ce qui précède, et dans sa propre documentation tarifaire, Moonshot le présente comme le fleuron pour « le codage longue durée et le travail de connaissance de bout en bout ». Avec 2,8 billions de paramètres servis en mxfp4 4 bits, c'est aussi le plus grand modèle ici dont vous pouvez télécharger les poids.

Fonctionnalités. Un contexte de 1 048 576 tokens, un raisonnement toujours actif derrière un réglage reasoning_effort de low, high ou max (max par défaut), et un dépôt moonshotai/Kimi-K3 non restreint. La recherche web est facturée séparément, 0,005 $ par appel réussi.

Avantages. Des poids ouverts à cette échelle, c'est inhabituel. Le taux de hit de cache de 0,30 $ contre 3,00 $ pour une entrée en cache manqué est aussi une économie de 10x chaque fois que le contexte se répète. Et la gamme intermédiaire est couverte par des petits frères moins chers, avec kimi-k2.7-code à 0,95 $ et 4,00 $.

Inconvénients. Deux pièges opérationnels ici, et les deux mordent. K3 n'est pas pris en charge sur le palier batch, donc la remise de 60 % que reçoivent les autres modèles Kimi ne l'atteint pas. Le système de paliers est aussi conditionné aux dépenses : le palier 0, à 1 $ de recharge cumulée, autorise 1 requête simultanée et 3 requêtes par minute, montant à 1 000 simultanées et 10 000 RPM une fois le palier 5 atteint à 3 000 $. La licence a l'apparence d'une MIT, puis ajoute une clause exigeant un accord séparé pour les entreprises de modèle-en-service dépassant 20 M$ de revenus sur toute période de douze mois consécutifs.

Tarifs. 3,00 $ en entrée et 15,00 $ en sortie, avec 0,30 $ pour un hit de cache. À 12,5 fois le tarif de sortie d'Inkling-Small, personne ne devrait confondre cela avec un changement latéral. Les tableaux complets des paliers sont dans les tarifs de Kimi K3.

Mon avis : le choix quand la charge est une longue exécution d'agent plutôt que des milliers de courtes réponses. Pour un trafic en forme de tickets, le justifier face à GLM-5.2 à un tiers du prix devient difficile.

6. Qwen3.8-Max

Idéal pour : un modèle fermé avec une fenêtre vraiment généreuse et une allocation d'essai gratuite.

L'interface de chat de Qwen, l'assistant et le frontend d'API d'Alibaba Cloud, capturé depuis Alibaba Cloud

Qwen3.8-Max est là où vous atterrissez une fois que vous avez décidé que les poids ouverts ne sont pas l'objectif et que le niveau commercial supérieur d'Alibaba l'est. La bonne surprise sur la page de facturation est que Max a enfin abandonné les tranches de longueur d'entrée. Une seule bande, couvrant toute la fenêtre du million de tokens.

Fonctionnalités. Un contexte de 1M, une sortie maximale de 131K et un raisonnement maximal de 262K, avec un TPM de 2 millions contre un RPM de 15 000. Le cache implicite coûte 0,25 $. Il y a aussi un quota gratuit de 1 million de tokens, valable 90 jours.

Avantages. L'absence de tranches par longueur d'entrée est un changement plus important qu'il n'y paraît. La règle de tranches d'Alibaba fonctionne en tout ou rien, donc sur l'ancien qwen3-max, franchir une frontière refacturait toute la requête, et un prompt de 33K tokens passait de 1,20 $ à 2,40 $ en entrée. Ici, ce piège a disparu. Le million de tokens gratuits vous donne aussi une vraie marge pour évaluer correctement.

Inconvénients. Un seul identifiant de modèle, deux prix, selon la portée du déploiement : 2,00 $ et 6,00 $ sur les tableaux International et Singapore, 1,65 $ et 4,951 $ sur les tableaux Global. Un écart de 18 % sans aucune différence de comportement derrière est déroutant à budgétiser. Le quota gratuit est réservé à Singapour, son compteur ne se met pas en pause pour inactivité, et ce qui reste est annulé à l'expiration. Le batch offre 50 % de réduction mais ne se cumule pas avec les remises de cache. Max est aussi fermé, et les poids Qwen publiés ont deux générations de retard, le plus récent datant du 24/04/2026.

Tarifs. 2,00 $ en entrée et 6,00 $ en sortie sur International et Singapore, puis 1,65 $ et 4,951 $ sur Global. La création explicite de cache coûte 2,50 $, soit 125 % de l'entrée. Les détails complets se trouvent dans notre article sur les tarifs de Qwen3.8-Max, et il y a le récapitulatif des alternatives à Qwen3.8-Max si vous magasinez dans l'autre sens.

Mon avis : solide, et un peu surévalué face à GLM-5.2, qui demande moins et vous donne les poids en plus. Le quota gratuit reste une raison de l'essayer.

7. Gemini 3.6 Flash

Idéal pour : l'entrée audio et multimédia sans payer de prime sur le format.

L'application web Gemini de Google, capturée depuis Google

Étiez-vous sur Inkling-Small spécifiquement pour l'entrée audio ? Alors ceci est le remplaçant le plus proche avec un vrai niveau de service derrière lui. Gemini 3.6 Flash facture un tarif d'entrée fixe unique de 1,50 $ couvrant le texte, l'image, la vidéo, l'audio et le PDF, et cela rompt avec un schéma que Google lui-même avait établi. Sur Gemini 2.5 Flash, l'entrée audio coûtait 1,00 $ contre 0,30 $ pour le texte, et sur 2.0 Flash le multiplicateur montait à 7x.

Fonctionnalités. 1 048 576 tokens d'entrée contre 65 536 en sortie, mise en cache à 0,15 $ par million plus 1,00 $ par million par heure de stockage, avec les paliers Batch et Flex tous deux à moitié prix, 0,75 $ et 3,75 $.

Avantages. Le tarif média fixe est ce qui se distingue ici, et un palier Batch à 0,75 $ et 3,75 $ rend le travail en volume abordable. La page de tarifs de Google le liste comme stable plutôt que comme aperçu, et cela compte si cela doit approcher des clients.

Inconvénients. Ce plafond de sortie de 65 536 est le plus serré ici, donc les longues générations doivent être découpées. La facturation de cache basée sur le stockage fonctionne comme un compteur continu plutôt qu'un frais unique, à l'inverse des tarifs de lecture de cache fixes ailleurs. Les poids sont fermés, donc pas d'auto-hébergement. L'ancrage sur Gemini 3.x n'est aussi pas disponible sur le palier gratuit, ce qui signifie qu'évaluer coûte de l'argent.

Tarifs. Standard, c'est 1,50 $ en entrée et 7,50 $ en sortie, Batch ou Flex 0,75 $ et 3,75 $, Priority 2,70 $ et 13,50 $. Là où le budget est la contrainte, Gemini 3.5 Flash-Lite arrive à 0,30 $ et 2,50 $, et il n'a pas non plus de distinction audio. L'échelle complète est dans les tarifs de Gemini 3.6 Flash.

Mon avis : le choix audio. Aussi le seul modèle ici auquel j'enverrais du contenu multimédia mixte en volume sans y réfléchir à deux fois.

8. Claude Opus 5

Idéal pour : les cas où une réponse fausse formulée avec assurance coûte de l'argent réel.

L'application web de Claude, capturée depuis Anthropic

C'est l'extrémité de l'échelle, et une raison pour laquelle il figure sur la liste. Il répond au problème spécifique qu'a Inkling-Small. Claude Opus 5 coûte 5,00 $ en entrée et 25,00 $ en sortie, environ 21 fois le tarif de sortie d'Inkling-Small, et vous l'achetez quand le préjudice d'une mauvaise réponse dépasse la facture de tokens.

Fonctionnalités. Le contexte complet de 1M au tarif standard, sans aucun palier de surtaxe pour contexte long, ce qui est inhabituel. La documentation tarifaire d'Anthropic le détaille : une requête de 900k tokens est facturée au même tarif par token qu'une de 9k. Les lectures de cache coûtent 0,50 $. L'API Batch applique une réduction fixe de 50 % sur les deux côtés, 2,50 $ et 12,50 $, et elle se cumule avec le cache.

Avantages. Sans falaise de longueur de contexte, toute une catégorie de mauvaises surprises de facturation disparaît. La réflexion étendue n'a pas de prix séparé et est facturée comme une sortie standard. Le batch combiné au cache fait aussi baisser considérablement les charges lourdes et répétitives par rapport au prix affiché.

Inconvénients. Dans toute comparaison de coûts, le tokenizer est le piège. Anthropic note que Claude 4.7 et les versions ultérieures « produisent environ 30 % de tokens en plus pour le même texte » que l'ancien tokenizer, donc cette étiquette de 25,00 $ sous-estime le véritable écart par tâche face à un concurrent encore sur un ancien tokenizer. Le mode rapide double les deux côtés à 10,00 $ et 50,00 $, ne fonctionne que sur l'API native et ne se cumule pas avec Batch. Les poids sont fermés.

Tarifs. Standard 5,00 $ et 25,00 $, Batch 2,50 $ et 12,50 $, mode rapide 10,00 $ et 50,00 $, lecture de cache 0,50 $. L'arrêt moins cher est Sonnet 5 à 2,00 $ et 10,00 $ jusqu'au 31 août 2026, qui passe à 3,00 $ et 15,00 $ le 1er septembre. Quand cet écart vaut la peine d'être payé est traité dans notre comparaison Opus 5 contre Sonnet 5.

Mon avis : excessif pour la plupart du trafic de tickets, exactement adapté aux 5 % qui touchent à l'argent, à la politique ou à un contrat. Orientez selon le type de question plutôt que de choisir un seul modèle pour tout.

L'échelle des prix, en une seule image

Alignez les huit côte à côte selon le prix de sortie, et la forme de la décision devient évidente.

Graphique en barres du prix de sortie par million de tokens sur sept modèles, avec Inkling-Small mis en évidence près du bas de la fourchette
Graphique en barres du prix de sortie par million de tokens sur sept modèles, avec Inkling-Small mis en évidence près du bas de la fourchette

Inkling-Small est déjà proche du plancher. Il existe exactement un cran significatif vers le bas, DeepSeek V4 Flash à 0,28 $, plus un déplacement latéral au même prix chez MiniMax M3. Tout le reste ici est un cran vers le haut, et ce qu'achète un cran vers le haut n'est jamais la vitesse.

Cela vaut la peine de faire le calcul de ce que tout cela coûte à volume de tickets. Prenez mille tickets sur un mois, et comptez 2 000 tokens de sortie par réponse, ce qui est généreux pour une réponse de support. Donc 2 millions de tokens de sortie.

ModèleCoût de sortie, 2M tokensContre Inkling-Small
DeepSeek V4 Flash0,56 $1,84 $ moins cher
Inkling-Small2,40 $référence
MiniMax M32,40 $identique
GLM-5.28,80 $6,40 $ de plus
Inkling8,10 $5,70 $ de plus
Gemini 3.6 Flash15,00 $12,60 $ de plus
Kimi K330,00 $27,60 $ de plus
Claude Opus 550,00 $47,60 $ de plus

À ce volume, tout l'écart entre le moins cher et le plus cher est d'environ 50 $ par mois. Une seule escalade mal gérée vous coûte plus que cela. C'est le véritable argument pour monter dans l'échelle, et aussi la raison pour laquelle le choix du modèle n'est pas là où se trouve le plus de levier.

Ce qu'aucun d'eux ne résout dans une file de support

Aucune des huit lignes ci-dessus ne résout la partie suivante, et c'est pourquoi je continue à répondre quand quelqu'un me dit avoir trouvé un modèle moins cher.

J'ai vu cet échec exact survenir sur des comptes payants. Un modèle ne s'arrête pas quand la récupération revient vide. Il remplit le vide avec ce qu'il a appris pendant l'entraînement. Un client, un fournisseur danois d'énergie solaire, a eu son bot inventer des affirmations d'abonnement et les envoyer à de vrais clients. Un autre a posé une question à son bot et a reçu « Oxygène (tableau périodique) » en retour. Aucun des deux cas n'était un mauvais modèle. Les deux étaient un modèle sans rien contre quoi s'ancrer, et rien pour l'empêcher de deviner.

Un responsable support parmi nos comptes a exprimé la même inquiétude en termes plus directs, en disant à l'IA ce qu'elle ne devait pas faire :

« arrête de dire aux clients qu'on va régler ça. Tu n'en sais rien »

Un responsable support e-commerce, inquiet qu'un bot promette trop sur les dates de livraison. Le même type de problème. Le modèle a l'air sûr de lui, et cet air sûr de lui est la partie dangereuse. La propre décomposition AA-Briefcase d'Inkling-Small le dit sans détour : 270,86 points Elo de mieux en présentation qu'en analyse.

Deux chemins pour une même question de client : un modèle brut répondant de mémoire face à un modèle ancré qui évalue sa confiance et escalade
Deux chemins pour une même question de client : un modèle brut répondant de mémoire face à un modèle ancré qui évalue sa confiance et escalade

Un modèle plus grand n'est pas la solution. Deux choses avec lesquelles aucun modèle n'est livré, elles, le sont. D'abord l'ancrage, pour que la réponse sorte de votre centre d'aide et de vos tickets passés plutôt que de la mémoire paramétrique. Ensuite un seuil de confiance, pour que tout ce qui est sous la barre parte vers une personne plutôt que de sortir. Ces deux éléments transforment un moteur brut en quelque chose que vous pouvez pointer vers une file en direct, et ils sont tout le sujet de la prévention des hallucinations de l'IA.

L'autre raison pour laquelle les gens arrêtent de comparer les modèles est plus banale que ça. Un développeur avec qui nous avons parlé, en train de monter une base de connaissances sur les incidents informatiques, avait déjà fait le tour. Il a essayé l'API d'un fournisseur et l'a trouvée trop coûteuse, en a essayé une autre et l'a trouvée peu fiable, et à la fin il voulait juste quelque chose qui fonctionne. Comparer les modèles, c'est amusant. Entretenir une couche modèle, pas vraiment.

Essayez eesel

Si le modèle que vous choisissez va répondre à des questions de clients, le conseil honnête vient en deux parties. Prenez celui des huit ci-dessus qui correspond à votre budget et à votre licence. Puis ne construisez pas vous-même la couche au-dessus.

Cette couche, c'est ce qu'est eesel. Il se connecte à Zendesk, Freshdesk ou quoi que ce soit d'autre que vous utilisez déjà, apprend de vos tickets résolus passés et de votre centre d'aide plutôt que des données d'entraînement d'un modèle, et ne répond qu'une fois qu'il franchit un seuil de confiance que vous définissez vous-même. Tout ce qui est sous ce seuil escalade. Et avant de toucher au trafic réel, vous pouvez le simuler contre votre propre historique de tickets, c'est ainsi que vous apprenez ce qu'il aurait mal fait avant qu'un client ne le découvre.

Le tableau de bord du helpdesk IA d'eesel, où un coéquipier IA résout et rédige des tickets de support
Le tableau de bord du helpdesk IA d'eesel, où un coéquipier IA résout et rédige des tickets de support

Je mets notre propre taux d'erreur factuelle mesuré de 7 % en avant plutôt que de l'enfouir, parce que c'est le chiffre qui compte pendant que vous choisissez un modèle. Il vient du trafic Zendesk réel d'un bijoutier allemand, environ mille tickets par mois, validé de manière croisée sur 284 discussions et 100 tickets, avec récupération sur leur véritable centre d'aide. L'ancrage ne vous mènera pas à zéro. Il vous donne un chiffre que vous pouvez mesurer, sur lequel vous pouvez fixer un seuil, puis améliorer, et c'est une catégorie de chose différente d'un modèle qui devine avec assurance.

Le positionnement commercial n'est délibérément pas au poste. La facturation se fait par ticket résolu, donc les tarifs suivent le travail effectué et non les effectifs. Gratuit à essayer. Si vous préférez d'abord vérifier les chiffres par vous-même, le guide de déviation des tickets est un bon point de départ.

Mon avis

Inkling-Small est un bon petit modèle à qui l'on demande sans cesse de faire un travail pour lequel il n'a pas été conçu. Il exécute bien et à un prix déjà proche du plancher, et sa fiabilité de connaissance mesure -9,0. Ces deux faits ne sont pas en tension. Ensemble, ils décrivent un outil.

Vous partez pour le coût ? Prenez DeepSeek V4 Flash et c'est réglé. Si ce sont les réponses fausses qui vous poussent à partir, montez vers l'Inkling parent pour la solution bon marché, ou vers Claude Opus 5 pour la solution coûteuse, et faites-le en sachant qu'aucune des deux ne vous mène à zéro.

Et si la raison est que la fenêtre de contexte ne correspond pas à la fiche, GLM-5.2 sert ce qu'il annonce, sous MIT. C'est la ligne que je prendrais si on m'obligeait à n'en choisir qu'une.

Le verdict honnête sur les huit reste cependant le même. Changer de moteur déplace votre facture et vos scores de benchmark. Cela ne change rien à ce qui se passe quand un client demande quelque chose que votre documentation n'a jamais couvert. Combler cet écart demande de la récupération, un seuil de confiance, un transfert. Aucune mise à niveau de modèle ne le fait pour vous, et cela vaut la peine de le régler avant de passer un autre après-midi à lire des benchmarks de classification de tickets par IA.

Questions fréquentes

Quelles sont les meilleures alternatives à Inkling-Small ?
Pour la plupart des équipes, cela se résume à trois options : DeepSeek V4 Flash si vous voulez le même travail moins cher, Inkling lui-même si vous voulez rester dans la même famille avec une meilleure fiabilité factuelle, et Claude Opus 5 si une mauvaise réponse coûte de l'argent réel. La liste complète de cet article couvre aussi GLM-5.2, MiniMax M3, Kimi K3, Qwen3.8-Max et Gemini 3.6 Flash.
Existe-t-il une alternative moins chère à Inkling-Small ?
Oui. Les tarifs de DeepSeek V4 Flash sont de 0,14 $ en entrée et 0,28 $ en sortie par million de tokens, contre 0,30 $ et 1,20 $ pour Inkling-Small, donc la sortie est environ quatre fois moins chère. MiniMax M3 égale exactement le tarif d'Inkling-Small sous 512K d'entrée. Si vous essayez de réduire votre coût par résolution, le poste modèle est rarement le plus important.
Pourquoi passer d'Inkling-Small à une autre solution ?
Pour sa fiabilité des connaissances. Artificial Analysis note Inkling-Small à -9,0 sur l'indice AA-Omniscience avec une précision de 30,5 %, alors que son modèle parent se situe à 2,05 avec 39,95 %. Cet écart se manifeste par des hallucinations de l'IA en support client lorsqu'on pose au modèle une question que votre base de connaissances ne couvre pas.
Inkling-Small a-t-il vraiment une fenêtre de contexte de 1M ?
La fiche du modèle indique 1M et aucun de ses deux fournisseurs ne le sert. Thinking Machines sert 256 000 tokens et DeepInfra 524 288, selon Artificial Analysis. Le même écart existe sur le modèle parent. Si le contexte long est la raison de votre choix, consultez l'explicatif Inkling-Small avant de construire en vous basant sur 1M.
Quelle alternative à Inkling-Small a la meilleure licence ouverte ?
DeepSeek V4 Flash et GLM-5.2 sont tous deux publiés sous licence MIT, la position commerciale la plus propre du groupe. Inkling-Small et son modèle parent sont en Apache 2.0. Kimi K3 et MiniMax M3 portent tous deux des licences propres avec des seuils de revenus, et celle de MiniMax est non commerciale par défaut. Pour un tour d'horizon plus complet, voyez notre récapitulatif des agents IA open source.
Combien coûte l'exécution d'une alternative à Inkling-Small sur des tickets de support ?
Les tokens sont le petit chiffre. À 1,20 $ par million de tokens de sortie, un mois avec mille tickets coûte quelques dollars d'inférence. Ce qui coûte de l'argent, c'est la couche de récupération, la logique d'escalade et le contrôle qualité, c'est pourquoi les équipes préfèrent généralement acheter cette couche plutôt que de la construire. Notre page de tarifs facture par ticket résolu plutôt que par poste, et le coût du service client IA détaille les calculs.
Puis-je auto-héberger une alternative à Inkling-Small au lieu de payer par token ?
Oui, et les poids de DeepSeek V4 Flash, GLM-5.2, Kimi K3 et MiniMax M3 sont tous publiés. La facture se déplace vers le matériel plutôt que de disparaître, et vous héritez du service, des évaluations et des mises à jour. Les équipes qui prennent cette voie pour le service client IA constatent généralement que le modèle n'a jamais été la partie difficile.
Inkling-Small est-il suffisant pour le support client à lui seul ?
Pas à lui seul, et rien d'autre sur cette liste ne l'est non plus. Un modèle brut répond à partir de ses données d'entraînement quand la récupération revient vide, ce qui est exactement la façon dont une mauvaise réponse formulée avec assurance parvient à un client. La solution consiste en un ancrage plus un seuil de confiance qui transfère le dossier, ce dont traitent la gestion de l'escalade par IA et le transfert vers un agent.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Un petit modèle mis de côté tandis que cinq modèles alternatifs captent la lumière
Alternatives

8 meilleures alternatives à Inkling-Small en 2026

Inkling-Small est bon marché et rapide, mais son score de connaissance mesuré est négatif. Voici 8 alternatives à Inkling-Small, avec des prix réels et le piège de chacune.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Une haute colonne ornementée aux côtés de huit colonnes plus petites de styles variés
Alternatives

Les 8 meilleures alternatives à Claude Opus 5 en 2026

Claude Opus 5 domine l'index indépendant de 1,8 point et coûte 86 fois plus cher par tâche que le modèle dix points en dessous. Huit alternatives, évaluées sur le coût mesuré par tâche.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026
Une haute colonne ornementée à côté de huit colonnes plus petites de styles variés
Alternatives

8 meilleures alternatives à Claude Opus 5 en 2026

Claude Opus 5 domine l'index indépendant de 1,8 point et coûte 86 fois plus par tâche que le modèle situé dix points en dessous. Huit alternatives, classées selon le coût mesuré par tâche.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026
Un développeur choisissant entre des fiches de modèles, avec la fiche de la baleine DeepSeek au centre entourée de modèles concurrents
Alternatives

Les 8 meilleures alternatives à DeepSeek V4 Flash en 2026

Huit vraies alternatives à DeepSeek V4 Flash, comparées sur les chiffres. Personne ne change pour le prix ou la vitesse, alors je les classe selon les quatre lacunes réelles de Flash.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 4, 2026
Illustration d'une personne comparant plusieurs super-agents d'IA comme alternatives à Skywork AI
Alternatives

7 meilleures alternatives à Skywork AI en 2026

Les meilleures alternatives à Skywork AI en 2026, des super-agents généralistes comme Manus aux outils de recherche, créateurs de présentations et une option spécialisée dans le support, avec de vrais prix.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Un appelant parlant à trois options différentes d'agent vocal, avec le logo Grok à gauche
Alternatives

Les 10 meilleures alternatives à Grok Voice Think Fast 2 en 2026

Grok Voice Think Fast 2.0 vient de devenir 60% plus cher sur l'alias par défaut. Dix alternatives réelles, avec un coût horaire mesuré et des chiffres de benchmark honnêtes.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Une personne au téléphone face à trois options d'agent vocal différentes, avec le logo Grok à gauche
Alternatives

Les 10 meilleures alternatives à Grok Voice Think Fast 2 en 2026

Grok Voice Think Fast 2.0 vient de devenir 60% plus cher sur l'alias par défaut. Dix vraies alternatives, avec coût horaire mesuré et chiffres de benchmark honnêtes.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Illustration éditoriale pour un comparatif des alternatives à Google Gemini 3.5 Pro
Alternatives

8 meilleures alternatives à Gemini 3.5 Pro en 2026

Vous cherchez des alternatives à Gemini 3.5 Pro ? Le hic : 3.5 Pro n'est pas encore disponible. Voici 8 modèles que vous pouvez réellement utiliser dès aujourd'hui, avec de vrais tarifs et nos recommandations.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustration éditoriale représentant une comparaison de modèles d'IA phares comme alternatives à GPT-5.6 Sol
Alternatives

9 meilleures alternatives à GPT-5.6 Sol en 2026

GPT-5.6 Sol est le modèle phare d'OpenAI, au prix d'un modèle phare : 5$/30$ par million de tokens, le même tarif que GPT-5.5. Voici 9 vraies alternatives à Sol, et à qui chacune convient.

Rama Adi NugrahaRama Adi NugrahaJul 17, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement