Les 8 meilleures alternatives à Inkling-Small en 2026
Kurnia Kharisma Agung Samiadjie
Katelin Teen
Dernière modification August 4, 2026

Pourquoi on regarde déjà au-delà d'Inkling-Small
Thinking Machines Lab a lancé Inkling-Small le 30/07/2026 sous licence Apache 2.0, quinze jours après le modèle parent. Le pari était raisonnable et le modèle le tient effectivement. Un quart de la taille du parent, plus rapide et moins cher aussi, et sur la propre fiche du fournisseur, il bat même le parent sur SWE-bench Verified, 80,2 contre 77,6.
L'accueil sur r/LocalLLaMA avait beaucoup à dire sur ce mot « small ». Le troisième commentaire le plus voté du fil de lancement ne parle pas de benchmarks du tout :
« Bientôt, avec tous ces modèles de 2-3T, ils vont appeler « small » des modèles de 500-700B... en pleurs avec 12 Go de VRAM »
C'est vrai. Mais ce n'est pas le nom qui pousse les gens à quitter le modèle. C'est ce qu'il sait.
Artificial Analysis le classe à un Intelligence Index de 40, rang #15 sur 101, ce qui est assez respectable. Puis la même page rapporte le test de connaissance AA-Omniscience : un indice de -9,0, une précision de 30,5 %, un taux d'hallucination de 56,9 %. AA décrit cette évaluation comme mesurant la « fiabilité des connaissances et l'hallucination » sur une plage de -100 à 100. Un chiffre négatif là-dedans n'est donc pas un artefact d'arrondi. C'est le modèle qui cherche une réponse qu'il n'a pas.
L'analyse AA-Briefcase est la partie à laquelle je reviens sans cesse. Un Elo global de 917,13, qui ne dit pas grand-chose jusqu'à ce qu'on le décompose : présentation 1067,99 contre qualité analytique de 797,13. Le modèle écrit une meilleure réponse qu'il n'en sait réellement.
Les personnes qui font tourner ces modèles sur leur propre matériel l'ont remarqué rapidement, et sur un axe plus tranchant que celui des tableaux de benchmarks :
« Mais moins bon que GPT 5.5 Luna sur l'indice Omniscience, car il invente trop de réponses. 84 % de taux d'hallucination, c'est pourquoi je préfère d'autres modèles ouverts, ils sont meilleurs pour « détecter » leur propre incertitude. »
Ce chiffre de 84 % est plus élevé que les 56,9 % affichés aujourd'hui sur la page AA, donc prenez le chiffre exact comme sa lecture et non la mienne. Dans les deux cas, le point tient toujours, et c'est le bon point à faire valoir. Ils choisissent un modèle selon s'il sait quand il ne sait pas, plutôt que selon sa qualité en code.

Trois autres choses poussent les gens à le quitter. Le prix n'en fait pas partie.
La fenêtre de contexte n'est pas la fenêtre de contexte. AA liste le modèle à 1M de tokens. Ce que ses deux fournisseurs servent réellement est 256 000 (Thinking Machines) et 524 288 (DeepInfra). Donc quiconque a lu « 1M » sur la fiche et a construit en s'appuyant sur ce chiffre ne l'obtient pas. Même problème sur le modèle parent, où le meilleur chiffre servi est de 524k chez trois fournisseurs, et la ligne la moins chère et la plus rapide de DeepInfra plafonne à 131k.
Deux fournisseurs, c'est mince. Le parent en a trois, et le groupe qui sert DeepSeek ou GLM est encore plus grand. Le jour du lancement, le modèle n'était même pas sur OpenRouter, une lacune qu'un commentateur a signalée sur Hacker News en même temps que les décomptes de paramètres. Les deux fournisseurs dont vous disposez se comportent aussi différemment. DeepInfra tourne 1,43 fois plus vite sur une charge de 10k, puis se retrouve derrière le fournisseur natif à 100k, 82,36 tokens par seconde contre 113,36. Votre profil de latence change selon la longueur du prompt, et c'est une chose terrible à découvrir en production.
Une couverture mince laisse aussi moins de marge pour comparer les options quand un fournisseur commence à faire des économies, ce qui arrive plus souvent que ne le laissent voir les benchmarks publiés :
« En fait, nous avons constaté que beaucoup de fournisseurs d'inférence quantifient les poids ou même le cache KV, et à cause des prix bas auxquels ils servent en lots massifs, cela entraîne un débit instable. »
Le prix n'est pas un seul chiffre. Le fournisseur natif est à 0,30 $ en entrée et 1,20 $ en sortie. DeepInfra demande 0,58 $ et 1,44 $ pour le contexte plus long. En mélangé, AA affiche 0,222 $ sur son ratio par défaut de 7:2:1, tandis que le mélange classique de 3:1 arrive à 0,525 $. Donc quel que soit le chiffre unique que vous finissez par citer, c'est en réalité un choix de ratios, et ce choix compte dès que vous modélisez le coût du service client IA à grand volume.
Pour être honnête, tout cela ne fait pas d'Inkling-Small un mauvais modèle. Le raisonnement représente 95,5 % de sa facture de sortie, ce qui est exactement d'où vient l'intelligence, et GPQA Diamond à 89,5 % plus le raisonnement à contexte long à 63 % sont de vrais chiffres. C'est un exécutant. Les ennuis ne commencent que lorsqu'on demande à un exécutant d'être un sachant.
Comment j'ai choisi ces huit
J'écris beaucoup de ces récapitulatifs et le piège ne change jamais. Classer par benchmark, publier, passer à autre chose. Alors j'ai gardé le filtre plus étroit ici.
Chacune des huit devait être quelque chose vers lequel un utilisateur d'Inkling-Small pourrait basculer cette semaine, donc une API publique en production avec des tarifs publiés, sans liste d'attente. Chaque prix vient de la page de facturation propre du fournisseur au 05/08/2026 plutôt que d'un site comparateur, car les chiffres de ces sites deviennent obsolètes en moins de deux semaines. Là où un fournisseur publie à la fois le contexte servi et le contexte annoncé, j'ai vérifié l'un contre l'autre. J'ai aussi lu les licences, et cela a compté, car deux modèles ici ont des seuils de revenus cachés dans les leurs.
Ce que je n'ai pas fait, c'est prétendre que six mois de trafic de production sont passés par les huit. J'ai lu la documentation et les pages de facturation, les fiches des modèles, les mesures AA, puis je n'ai dit que ce que cela permettait d'étayer.
Les meilleures alternatives à Inkling-Small en un coup d'œil
Tous les prix ci-dessous sont par million de tokens en USD, vérifiés le 05/08/2026.
| Modèle | Idéal pour | Poids | Paramètres | Entrée | Sortie | Contexte réel | Modalités en entrée | Le hic |
|---|---|---|---|---|---|---|---|---|
| Inkling-Small (référence) | Exécution agentique bon marché | Apache 2.0 | 276B / 12B actifs (266B selon AA) | 0,30 $ | 1,20 $ | 256K natif, 524 288 chez DeepInfra | Texte, image, audio | Indice de connaissance -9,0 |
| DeepSeek V4 Flash | Même travail, un quart du coût | MIT | 284B / 13B | 0,14 $ | 0,28 $ | 1M | Texte | Une surtaxe 2x aux heures de pointe est annoncée |
| Inkling, le parent | Rester dans la famille, en sachant plus | Apache 2.0 | 975B / 41B | 1,00 $ | 4,05 $ | 524K au mieux, 131K au moins cher | Texte, image, audio | Deux pages AA citent des prix différents |
| GLM-5.2 | Les poids ouverts les plus solides que vous puissiez héberger | MIT | ~753B au total | 1,40 $ | 4,40 $ | 1M | Texte | Plafond de sortie de 128K |
| MiniMax M3 | Entrée vidéo, au prix d'Inkling-Small | Licence communautaire propre | 428B / 23B | 0,30 $ | 1,20 $ | 1M, 512K garanti | Texte, image, vidéo | Non commercial par défaut |
| Kimi K3 | Travail d'agent longue durée | Licence propre (Kimi K3 Licence) | 2,8T | 3,00 $ | 15,00 $ | 1 048 576 | Texte | Pas de palier batch, 3 RPM au palier d'entrée |
| Qwen3.8-Max | Modèle fermé, fenêtre généreuse | Fermé | Non divulgué | 2,00 $ | 6,00 $ | 1M | Texte | Deux prix pour un seul modèle |
| Gemini 3.6 Flash | Entrée audio sans surcoût | Fermé | Non divulgué | 1,50 $ | 7,50 $ | 1 048 576 | Texte, image, vidéo, audio, PDF | Plafond de sortie de 65 536 |
| Claude Opus 5 | Quand les mauvaises réponses coûtent de l'argent | Fermé | Non divulgué | 5,00 $ | 25,00 $ | 1M, sans surtaxe | Texte, image | Le tokenizer plus récent émet ~30 % de tokens en plus |
1. DeepSeek V4 Flash
Idéal pour : faire ce que fait Inkling-Small, à environ un quart du coût de sortie.
C'est la comparaison à laquelle un vrai utilisateur d'Inkling-Small pense en premier, et c'était aussi le commentaire le plus substantiel du fil de lancement sur r/LocalLLaMA :
« Je me demande comment il se compare à DSV4 Flash. Comparable sur le benchmark d'intelligence d'Artificial Analysis (tous les deux à 40). Semble un peu meilleur en codage / workflows agentiques cependant. »
Voilà la forme que ça prend. DeepSeek V4 Flash tourne avec 284B au total et 13B actifs, à côté des 12B d'Inkling-Small, et AA place les deux à 40. Moteur similaire. Facture pas si similaire.
Il y a une chose que les décomptes de paramètres cachent, et elle compte si l'auto-hébergement est sur votre liste. DeepSeek se distribue nativement en FP4 et FP8 mixtes là où Inkling-Small se distribue en bf16, donc à précision native, un exécuteur local a placé l'un à environ 160 Go contre 540 Go. Sur le papier, à peu près la même taille. En pratique, trois fois plus de mémoire.
Fonctionnalités. Poids sous licence MIT sur Hugging Face, plus une fenêtre de contexte de 1M et une sortie maximale de 384K, la plus grande de cette liste, et de loin. La limitation de débit se fait par concurrence plutôt que par requêtes par minute, avec un plafond publié de 2 500 requêtes simultanées par compte.
Avantages. L'économie du cache est la vraie histoire ici. Un hit de cache coûte 0,0028 $ par million de tokens d'entrée, 50 fois moins que le taux de cache manqué de 0,14 $, donc tout ce qui a un prompt système stable devient absurdement bon marché. Et MIT est la licence la plus propre du groupe, aucun seuil de revenus, aucune clause d'attribution.
Inconvénients. Texte uniquement, donc tout l'audio que vous fournissiez à Inkling-Small n'a plus nulle part où aller. Il y a aussi une note de bas de page sur la page de tarifs annonçant une future surtaxe 2x aux heures de pointe entre 09h00 et 12h00 et 14h00 et 18h00, heure de Pékin, avec une date d'entrée en vigueur « sous réserve de l'annonce officielle ». Une inconnue connue logée dans votre modèle de coûts.
Tarifs. 0,14 $ en entrée et 0,28 $ en sortie par million, hits de cache à 0,0028 $. Pro se situe à 0,435 $ et 0,87 $, soit exactement 3,1 fois Flash des deux côtés. Les exemples chiffrés se trouvent dans notre analyse des tarifs de DeepSeek V4 Flash, et nous l'avons comparé à Kimi K3 séparément.
Mon avis : si l'argent est votre raison de partir, arrêtez de lire ici. Si c'est la précision, continuez, car devenir moins cher n'a jamais fait qu'un modèle sache plus.
2. Inkling, le parent
Idéal pour : rester sur les mêmes poids, le même outillage et la même licence tout en rachetant la fiabilité factuelle.

Souvent, l'alternative la plus intéressante à un petit modèle est le grand modèle dont il a été distillé, et ici les chiffres le démontrent clairement. Sous la même méthodologie AA, Inkling obtient 41 sur l'Intelligence Index contre 40 pour Small, donc match nul. AA-Omniscience est là où ils se séparent : 2,05 avec 39,95 % de précision, contre -9,0 et 30,5 %. Près d'un tiers de questions supplémentaires reviennent correctes.
Fonctionnalités. 975B au total avec 41B actifs sur 66 couches, Apache 2.0, et texte plus image plus audio en entrée. Trois fournisseurs de service désormais, là où le lancement n'en avait qu'un : DeepInfra, Together AI et Thinking Machines.
Avantages. Même licence, même famille, donc la migration se résume surtout à changer une chaîne de caractères du modèle. La ligne FP8 de DeepInfra est rapide, 201,5 tokens par seconde, et le coût par tâche d'Intelligence Index y ressort à 0,4296 $, bon marché pour ce niveau.
Inconvénients. Deux pages AA sont actuellement en désaccord sur le prix, donc mieux vaut savoir laquelle vous citez. La page du modèle indique 1,87 $ en entrée et 4,68 $ en sortie. Les lignes des fournisseurs indiquent toutes 1,00 $ et 4,05 $. Ces chiffres de fournisseurs restent cohérents entre eux sur les trois, donc c'est la paire contre laquelle je planifierais. Le contexte servi est aussi confus. Il est de 524k au mieux, et la ligne bon marché et rapide de DeepInfra plafonne à 131k, soit 13,1 % du million annoncé.
Tarifs. Selon les données des fournisseurs, 1,00 $ en entrée et 4,05 $ en sortie, avec 0,17 $ pour un hit de cache et 0,724 $ en mélangé. Appelons cela 3,4 fois le tarif de sortie de Small. Si c'est le parent que vous magasinez, l'article sur les alternatives à Inkling couvre la gamme plus large.
Mon avis : le choix évident, et celui que la plupart des gens sautent, parce que « passer au grand frère » donne l'impression d'admettre que le petit était une erreur. Ce n'était pas le cas. C'était juste le mauvais outil pour un travail de connaissance.
3. GLM-5.2
Idéal pour : les poids ouverts les plus solides de cette liste que vous pouvez réalistement héberger vous-même.
GLM-5.2 est le cran au-dessus qui vous maintient en territoire sous licence MIT. Environ 753B paramètres au total, avec un contexte de 1M que son API sert réellement, et 2,23 millions de téléchargements sur le dépôt zai-org/GLM-5.2. Ce nombre de téléchargements indique que la communauté de l'auto-hébergement l'a déjà testé sous toutes les coutures.
Fonctionnalités. Poids MIT avec un contexte de 1M et une sortie maximale de 128K, puis une entrée en cache à 0,26 $, avec un stockage de cache listé comme gratuit pour l'instant. Z.ai vend aussi une formule d'abonnement. Le Coding Plan débute à 18 $ par mois, réduit à 12,60 $, avec 10 000 crédits par semaine.
Z.ai publie sa propre courbe de niveau d'effort, et la regarder vaut mieux que de prendre le score en gros titre au pied de la lettre :

Avantages. GLM-5.2 coûte le même prix que coûtait GLM-5.1, 1,40 $ et 4,40 $, et pendant ce temps la fenêtre de contexte est passée de 200K à 1M. Une mise à niveau gratuite, tout simplement. Une licence MIT sans clause de revenus vaut aussi plus qu'un ou deux points de benchmark une fois que vous livrez ça dans un produit.
Inconvénients. Ce plafond de sortie de 128K est le plus serré parmi les options en poids ouverts ici, comparé aux 384K de DeepSeek. Les crédits du Coding Plan se consument à 3x aux heures de pointe et 2x hors pointe, avec le tarif hors pointe temporairement à 1x jusqu'à fin septembre, donc les calculs de l'abonnement demandent de la surveillance.
Tarifs. 1,40 $ en entrée, 4,40 $ en sortie, 0,26 $ en cache. Des petits frères moins chers existent si vous pouvez vous contenter de moins. GLM-4.7 et GLM-4.6 sont tous deux à 0,60 $ et 2,20 $, tandis que GLM-4.7-FlashX est à 0,07 $ et 0,40 $.
Mon avis : le meilleur compromis licence-capacité de la liste. Si votre service juridique a déjà demandé ce qui se passe le jour où un fournisseur change ses conditions, montrez-lui cette ligne.
4. MiniMax M3
Idéal pour : égaler exactement le prix d'Inkling-Small tout en ajoutant l'entrée vidéo.
C'est un alignement direct de prix, ce qui rend la comparaison inhabituellement claire. Sous 512K d'entrée, MiniMax M3 facture 0,30 $ en entrée et 1,20 $ en sortie, identique au tarif natif d'Inkling-Small, pour un modèle de 428B avec 23B actifs. Ce qui vous laisse choisir sur tout sauf le coût.
Fonctionnalités. Un contexte de 1M avec 512K garanti comme minimum, des lectures de cache à 0,06 $, et une entrée texte plus image plus vidéo arrivant via des parties de contenu image_url et video_url. Le mode réflexion coûte pareil activé ou désactivé. Les poids sont disponibles en direct sur Hugging Face sous MiniMaxAI/MiniMax-M3, avec 170 353 téléchargements à ce jour.
Avantages. Presque le double des paramètres actifs d'Inkling-Small pour le même prix, avec l'entrée vidéo en plus, ce que rien d'autre à ce prix sur la liste n'offre. La page de tarifs qualifie le tarif actuel de « Réduction permanente de 50 % », et aucune date d'expiration n'y est indiquée où que ce soit.
Inconvénients. La licence est ici le vrai hic. La MINIMAX COMMUNITY LICENSE est non commerciale par défaut, l'usage commercial demande un crédit visible « Built with MiniMax M3 », et au-delà de 20 M$ de revenus annuels il faut une autorisation écrite. Au-delà de 512K d'entrée, les deux tarifs doublent, donc 0,60 $ et 2,40 $. Il existe aussi un niveau Priority, à 1,5x, si la file plus rapide en vaut la peine pour vous.
Tarifs. 0,30 $ et 1,20 $ jusqu'à 512K d'entrée, puis 0,60 $ et 2,40 $ au-delà, lectures de cache à 0,06 $. Priority tourne à 0,45 $ et 1,80 $, ou 0,90 $ et 3,60 $ une fois le seuil dépassé.
Mon avis : bon moteur, licence qu'il faut s'asseoir pour lire. Une startup sous la ligne des revenus, contente d'afficher le crédit, obtient ici plus de modèle par dollar que ce qu'elle quitte.
5. Kimi K3
Idéal pour : le travail d'agent longue durée où l'exécution compte plus que le prix du token.
Kimi K3 est un bond bien plus grand que tout ce qui précède, et dans sa propre documentation tarifaire, Moonshot le présente comme le fleuron pour « le codage longue durée et le travail de connaissance de bout en bout ». Avec 2,8 billions de paramètres servis en mxfp4 4 bits, c'est aussi le plus grand modèle ici dont vous pouvez télécharger les poids.
Fonctionnalités. Un contexte de 1 048 576 tokens, un raisonnement toujours actif derrière un réglage reasoning_effort de low, high ou max (max par défaut), et un dépôt moonshotai/Kimi-K3 non restreint. La recherche web est facturée séparément, 0,005 $ par appel réussi.
Avantages. Des poids ouverts à cette échelle, c'est inhabituel. Le taux de hit de cache de 0,30 $ contre 3,00 $ pour une entrée en cache manqué est aussi une économie de 10x chaque fois que le contexte se répète. Et la gamme intermédiaire est couverte par des petits frères moins chers, avec kimi-k2.7-code à 0,95 $ et 4,00 $.
Inconvénients. Deux pièges opérationnels ici, et les deux mordent. K3 n'est pas pris en charge sur le palier batch, donc la remise de 60 % que reçoivent les autres modèles Kimi ne l'atteint pas. Le système de paliers est aussi conditionné aux dépenses : le palier 0, à 1 $ de recharge cumulée, autorise 1 requête simultanée et 3 requêtes par minute, montant à 1 000 simultanées et 10 000 RPM une fois le palier 5 atteint à 3 000 $. La licence a l'apparence d'une MIT, puis ajoute une clause exigeant un accord séparé pour les entreprises de modèle-en-service dépassant 20 M$ de revenus sur toute période de douze mois consécutifs.
Tarifs. 3,00 $ en entrée et 15,00 $ en sortie, avec 0,30 $ pour un hit de cache. À 12,5 fois le tarif de sortie d'Inkling-Small, personne ne devrait confondre cela avec un changement latéral. Les tableaux complets des paliers sont dans les tarifs de Kimi K3.
Mon avis : le choix quand la charge est une longue exécution d'agent plutôt que des milliers de courtes réponses. Pour un trafic en forme de tickets, le justifier face à GLM-5.2 à un tiers du prix devient difficile.
6. Qwen3.8-Max
Idéal pour : un modèle fermé avec une fenêtre vraiment généreuse et une allocation d'essai gratuite.
Qwen3.8-Max est là où vous atterrissez une fois que vous avez décidé que les poids ouverts ne sont pas l'objectif et que le niveau commercial supérieur d'Alibaba l'est. La bonne surprise sur la page de facturation est que Max a enfin abandonné les tranches de longueur d'entrée. Une seule bande, couvrant toute la fenêtre du million de tokens.
Fonctionnalités. Un contexte de 1M, une sortie maximale de 131K et un raisonnement maximal de 262K, avec un TPM de 2 millions contre un RPM de 15 000. Le cache implicite coûte 0,25 $. Il y a aussi un quota gratuit de 1 million de tokens, valable 90 jours.
Avantages. L'absence de tranches par longueur d'entrée est un changement plus important qu'il n'y paraît. La règle de tranches d'Alibaba fonctionne en tout ou rien, donc sur l'ancien qwen3-max, franchir une frontière refacturait toute la requête, et un prompt de 33K tokens passait de 1,20 $ à 2,40 $ en entrée. Ici, ce piège a disparu. Le million de tokens gratuits vous donne aussi une vraie marge pour évaluer correctement.
Inconvénients. Un seul identifiant de modèle, deux prix, selon la portée du déploiement : 2,00 $ et 6,00 $ sur les tableaux International et Singapore, 1,65 $ et 4,951 $ sur les tableaux Global. Un écart de 18 % sans aucune différence de comportement derrière est déroutant à budgétiser. Le quota gratuit est réservé à Singapour, son compteur ne se met pas en pause pour inactivité, et ce qui reste est annulé à l'expiration. Le batch offre 50 % de réduction mais ne se cumule pas avec les remises de cache. Max est aussi fermé, et les poids Qwen publiés ont deux générations de retard, le plus récent datant du 24/04/2026.
Tarifs. 2,00 $ en entrée et 6,00 $ en sortie sur International et Singapore, puis 1,65 $ et 4,951 $ sur Global. La création explicite de cache coûte 2,50 $, soit 125 % de l'entrée. Les détails complets se trouvent dans notre article sur les tarifs de Qwen3.8-Max, et il y a le récapitulatif des alternatives à Qwen3.8-Max si vous magasinez dans l'autre sens.
Mon avis : solide, et un peu surévalué face à GLM-5.2, qui demande moins et vous donne les poids en plus. Le quota gratuit reste une raison de l'essayer.
7. Gemini 3.6 Flash
Idéal pour : l'entrée audio et multimédia sans payer de prime sur le format.
Étiez-vous sur Inkling-Small spécifiquement pour l'entrée audio ? Alors ceci est le remplaçant le plus proche avec un vrai niveau de service derrière lui. Gemini 3.6 Flash facture un tarif d'entrée fixe unique de 1,50 $ couvrant le texte, l'image, la vidéo, l'audio et le PDF, et cela rompt avec un schéma que Google lui-même avait établi. Sur Gemini 2.5 Flash, l'entrée audio coûtait 1,00 $ contre 0,30 $ pour le texte, et sur 2.0 Flash le multiplicateur montait à 7x.
Fonctionnalités. 1 048 576 tokens d'entrée contre 65 536 en sortie, mise en cache à 0,15 $ par million plus 1,00 $ par million par heure de stockage, avec les paliers Batch et Flex tous deux à moitié prix, 0,75 $ et 3,75 $.
Avantages. Le tarif média fixe est ce qui se distingue ici, et un palier Batch à 0,75 $ et 3,75 $ rend le travail en volume abordable. La page de tarifs de Google le liste comme stable plutôt que comme aperçu, et cela compte si cela doit approcher des clients.
Inconvénients. Ce plafond de sortie de 65 536 est le plus serré ici, donc les longues générations doivent être découpées. La facturation de cache basée sur le stockage fonctionne comme un compteur continu plutôt qu'un frais unique, à l'inverse des tarifs de lecture de cache fixes ailleurs. Les poids sont fermés, donc pas d'auto-hébergement. L'ancrage sur Gemini 3.x n'est aussi pas disponible sur le palier gratuit, ce qui signifie qu'évaluer coûte de l'argent.
Tarifs. Standard, c'est 1,50 $ en entrée et 7,50 $ en sortie, Batch ou Flex 0,75 $ et 3,75 $, Priority 2,70 $ et 13,50 $. Là où le budget est la contrainte, Gemini 3.5 Flash-Lite arrive à 0,30 $ et 2,50 $, et il n'a pas non plus de distinction audio. L'échelle complète est dans les tarifs de Gemini 3.6 Flash.
Mon avis : le choix audio. Aussi le seul modèle ici auquel j'enverrais du contenu multimédia mixte en volume sans y réfléchir à deux fois.
8. Claude Opus 5
Idéal pour : les cas où une réponse fausse formulée avec assurance coûte de l'argent réel.
C'est l'extrémité de l'échelle, et une raison pour laquelle il figure sur la liste. Il répond au problème spécifique qu'a Inkling-Small. Claude Opus 5 coûte 5,00 $ en entrée et 25,00 $ en sortie, environ 21 fois le tarif de sortie d'Inkling-Small, et vous l'achetez quand le préjudice d'une mauvaise réponse dépasse la facture de tokens.
Fonctionnalités. Le contexte complet de 1M au tarif standard, sans aucun palier de surtaxe pour contexte long, ce qui est inhabituel. La documentation tarifaire d'Anthropic le détaille : une requête de 900k tokens est facturée au même tarif par token qu'une de 9k. Les lectures de cache coûtent 0,50 $. L'API Batch applique une réduction fixe de 50 % sur les deux côtés, 2,50 $ et 12,50 $, et elle se cumule avec le cache.
Avantages. Sans falaise de longueur de contexte, toute une catégorie de mauvaises surprises de facturation disparaît. La réflexion étendue n'a pas de prix séparé et est facturée comme une sortie standard. Le batch combiné au cache fait aussi baisser considérablement les charges lourdes et répétitives par rapport au prix affiché.
Inconvénients. Dans toute comparaison de coûts, le tokenizer est le piège. Anthropic note que Claude 4.7 et les versions ultérieures « produisent environ 30 % de tokens en plus pour le même texte » que l'ancien tokenizer, donc cette étiquette de 25,00 $ sous-estime le véritable écart par tâche face à un concurrent encore sur un ancien tokenizer. Le mode rapide double les deux côtés à 10,00 $ et 50,00 $, ne fonctionne que sur l'API native et ne se cumule pas avec Batch. Les poids sont fermés.
Tarifs. Standard 5,00 $ et 25,00 $, Batch 2,50 $ et 12,50 $, mode rapide 10,00 $ et 50,00 $, lecture de cache 0,50 $. L'arrêt moins cher est Sonnet 5 à 2,00 $ et 10,00 $ jusqu'au 31 août 2026, qui passe à 3,00 $ et 15,00 $ le 1er septembre. Quand cet écart vaut la peine d'être payé est traité dans notre comparaison Opus 5 contre Sonnet 5.
Mon avis : excessif pour la plupart du trafic de tickets, exactement adapté aux 5 % qui touchent à l'argent, à la politique ou à un contrat. Orientez selon le type de question plutôt que de choisir un seul modèle pour tout.
L'échelle des prix, en une seule image
Alignez les huit côte à côte selon le prix de sortie, et la forme de la décision devient évidente.

Inkling-Small est déjà proche du plancher. Il existe exactement un cran significatif vers le bas, DeepSeek V4 Flash à 0,28 $, plus un déplacement latéral au même prix chez MiniMax M3. Tout le reste ici est un cran vers le haut, et ce qu'achète un cran vers le haut n'est jamais la vitesse.
Cela vaut la peine de faire le calcul de ce que tout cela coûte à volume de tickets. Prenez mille tickets sur un mois, et comptez 2 000 tokens de sortie par réponse, ce qui est généreux pour une réponse de support. Donc 2 millions de tokens de sortie.
| Modèle | Coût de sortie, 2M tokens | Contre Inkling-Small |
|---|---|---|
| DeepSeek V4 Flash | 0,56 $ | 1,84 $ moins cher |
| Inkling-Small | 2,40 $ | référence |
| MiniMax M3 | 2,40 $ | identique |
| GLM-5.2 | 8,80 $ | 6,40 $ de plus |
| Inkling | 8,10 $ | 5,70 $ de plus |
| Gemini 3.6 Flash | 15,00 $ | 12,60 $ de plus |
| Kimi K3 | 30,00 $ | 27,60 $ de plus |
| Claude Opus 5 | 50,00 $ | 47,60 $ de plus |
À ce volume, tout l'écart entre le moins cher et le plus cher est d'environ 50 $ par mois. Une seule escalade mal gérée vous coûte plus que cela. C'est le véritable argument pour monter dans l'échelle, et aussi la raison pour laquelle le choix du modèle n'est pas là où se trouve le plus de levier.
Ce qu'aucun d'eux ne résout dans une file de support
Aucune des huit lignes ci-dessus ne résout la partie suivante, et c'est pourquoi je continue à répondre quand quelqu'un me dit avoir trouvé un modèle moins cher.
J'ai vu cet échec exact survenir sur des comptes payants. Un modèle ne s'arrête pas quand la récupération revient vide. Il remplit le vide avec ce qu'il a appris pendant l'entraînement. Un client, un fournisseur danois d'énergie solaire, a eu son bot inventer des affirmations d'abonnement et les envoyer à de vrais clients. Un autre a posé une question à son bot et a reçu « Oxygène (tableau périodique) » en retour. Aucun des deux cas n'était un mauvais modèle. Les deux étaient un modèle sans rien contre quoi s'ancrer, et rien pour l'empêcher de deviner.
Un responsable support parmi nos comptes a exprimé la même inquiétude en termes plus directs, en disant à l'IA ce qu'elle ne devait pas faire :
« arrête de dire aux clients qu'on va régler ça. Tu n'en sais rien »
Un responsable support e-commerce, inquiet qu'un bot promette trop sur les dates de livraison. Le même type de problème. Le modèle a l'air sûr de lui, et cet air sûr de lui est la partie dangereuse. La propre décomposition AA-Briefcase d'Inkling-Small le dit sans détour : 270,86 points Elo de mieux en présentation qu'en analyse.

Un modèle plus grand n'est pas la solution. Deux choses avec lesquelles aucun modèle n'est livré, elles, le sont. D'abord l'ancrage, pour que la réponse sorte de votre centre d'aide et de vos tickets passés plutôt que de la mémoire paramétrique. Ensuite un seuil de confiance, pour que tout ce qui est sous la barre parte vers une personne plutôt que de sortir. Ces deux éléments transforment un moteur brut en quelque chose que vous pouvez pointer vers une file en direct, et ils sont tout le sujet de la prévention des hallucinations de l'IA.
L'autre raison pour laquelle les gens arrêtent de comparer les modèles est plus banale que ça. Un développeur avec qui nous avons parlé, en train de monter une base de connaissances sur les incidents informatiques, avait déjà fait le tour. Il a essayé l'API d'un fournisseur et l'a trouvée trop coûteuse, en a essayé une autre et l'a trouvée peu fiable, et à la fin il voulait juste quelque chose qui fonctionne. Comparer les modèles, c'est amusant. Entretenir une couche modèle, pas vraiment.
Essayez eesel
Si le modèle que vous choisissez va répondre à des questions de clients, le conseil honnête vient en deux parties. Prenez celui des huit ci-dessus qui correspond à votre budget et à votre licence. Puis ne construisez pas vous-même la couche au-dessus.
Cette couche, c'est ce qu'est eesel. Il se connecte à Zendesk, Freshdesk ou quoi que ce soit d'autre que vous utilisez déjà, apprend de vos tickets résolus passés et de votre centre d'aide plutôt que des données d'entraînement d'un modèle, et ne répond qu'une fois qu'il franchit un seuil de confiance que vous définissez vous-même. Tout ce qui est sous ce seuil escalade. Et avant de toucher au trafic réel, vous pouvez le simuler contre votre propre historique de tickets, c'est ainsi que vous apprenez ce qu'il aurait mal fait avant qu'un client ne le découvre.

Je mets notre propre taux d'erreur factuelle mesuré de 7 % en avant plutôt que de l'enfouir, parce que c'est le chiffre qui compte pendant que vous choisissez un modèle. Il vient du trafic Zendesk réel d'un bijoutier allemand, environ mille tickets par mois, validé de manière croisée sur 284 discussions et 100 tickets, avec récupération sur leur véritable centre d'aide. L'ancrage ne vous mènera pas à zéro. Il vous donne un chiffre que vous pouvez mesurer, sur lequel vous pouvez fixer un seuil, puis améliorer, et c'est une catégorie de chose différente d'un modèle qui devine avec assurance.
Le positionnement commercial n'est délibérément pas au poste. La facturation se fait par ticket résolu, donc les tarifs suivent le travail effectué et non les effectifs. Gratuit à essayer. Si vous préférez d'abord vérifier les chiffres par vous-même, le guide de déviation des tickets est un bon point de départ.
Mon avis
Inkling-Small est un bon petit modèle à qui l'on demande sans cesse de faire un travail pour lequel il n'a pas été conçu. Il exécute bien et à un prix déjà proche du plancher, et sa fiabilité de connaissance mesure -9,0. Ces deux faits ne sont pas en tension. Ensemble, ils décrivent un outil.
Vous partez pour le coût ? Prenez DeepSeek V4 Flash et c'est réglé. Si ce sont les réponses fausses qui vous poussent à partir, montez vers l'Inkling parent pour la solution bon marché, ou vers Claude Opus 5 pour la solution coûteuse, et faites-le en sachant qu'aucune des deux ne vous mène à zéro.
Et si la raison est que la fenêtre de contexte ne correspond pas à la fiche, GLM-5.2 sert ce qu'il annonce, sous MIT. C'est la ligne que je prendrais si on m'obligeait à n'en choisir qu'une.
Le verdict honnête sur les huit reste cependant le même. Changer de moteur déplace votre facture et vos scores de benchmark. Cela ne change rien à ce qui se passe quand un client demande quelque chose que votre documentation n'a jamais couvert. Combler cet écart demande de la récupération, un seuil de confiance, un transfert. Aucune mise à niveau de modèle ne le fait pour vous, et cela vaut la peine de le régler avant de passer un autre après-midi à lire des benchmarks de classification de tickets par IA.
Questions fréquentes
Quelles sont les meilleures alternatives à Inkling-Small ?
Existe-t-il une alternative moins chère à Inkling-Small ?
Pourquoi passer d'Inkling-Small à une autre solution ?
Inkling-Small a-t-il vraiment une fenêtre de contexte de 1M ?
Quelle alternative à Inkling-Small a la meilleure licence ouverte ?
Combien coûte l'exécution d'une alternative à Inkling-Small sur des tickets de support ?
Puis-je auto-héberger une alternative à Inkling-Small au lieu de payer par token ?
Inkling-Small est-il suffisant pour le support client à lui seul ?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.






