Die 8 besten Inkling-Small-Alternativen 2026
Kurnia Kharisma Agung Samiadjie
Katelin Teen
Zuletzt bearbeitet August 4, 2026

Warum Leute schon über Inkling-Small hinausschauen
Thinking Machines Lab brachte Inkling-Small am 30.07.2026 unter Apache 2.0 heraus, fünfzehn Tage nach dem Elternmodell. Das Versprechen war vernünftig, und das Modell hält es auch ein. Ein Viertel der Größe des Elternmodells, dabei schneller und günstiger, und auf dem eigenen Datenblatt des Anbieters schlägt es das Elternmodell sogar bei SWE-bench Verified, 80,2 gegenüber 77,6.
Die Reaktion auf r/LocalLLaMA hatte einiges zu diesem Wort "small" zu sagen. Der drittwichtigste Kommentar im Launch-Thread geht überhaupt nicht auf Benchmarks ein:
"Bald werden sie bei all diesen 2-3T-Modellen 'small' für 500-700B-Modelle sagen ... weint mit 12 GB VRAM"
Fair genug. Die Namensgebung ist aber nicht das, was Leute vom Modell wegtreibt. Was es weiß, ist es.
Artificial Analysis setzt es auf einen Intelligence Index von 40, Rang #15 von 101, was durchaus ansehnlich ist. Dann berichtet dieselbe Seite den AA-Omniscience-Wissenstest: einen Index von -9,0, eine Genauigkeit von 30,5 %, eine Halluzinationsrate von 56,9 %. AA beschreibt diesen Eval als Messung von "Wissenszuverlässigkeit und Halluzination" auf einer Skala von -100 bis 100. Eine negative Zahl dort ist also kein Rundungsartefakt. Es ist das Modell, das nach einer Antwort greift, die es nicht hat.
Die AA-Briefcase-Aufschlüsselung ist der Teil, zu dem ich immer wieder zurückkomme. Gesamt-Elo von 917,13, was wenig verrät, bis man es aufteilt: Präsentation 1067,99 gegenüber analytischer Qualität von 797,13. Das Modell schreibt eine bessere Antwort, als es tatsächlich weiß.
Leute, die diese Modelle auf eigener Hardware laufen lassen, haben das schnell bemerkt, und auf einer schärferen Achse, als es die Benchmark-Tabellen tun:
"Aber schlechter als GPT 5.5 Luna im Omniscience-Index, weil es sich zu viele Antworten ausdenkt. 84 % Halluzinationsrate, deshalb bevorzuge ich andere offene Modelle, die sind besser darin, ihre eigene Unsicherheit zu 'erkennen'."
Diese 84 %-Zahl liegt höher als die 56,9 %, die heute auf der AA-Seite stehen, also nehmen Sie die genaue Zahl als deren Lesart und nicht als meine. Der Punkt bleibt trotzdem richtig, und es ist der richtige Punkt. Sie wählen ein Modell danach aus, ob es weiß, wenn es etwas nicht weiß, statt danach, wie gut es Code schreibt.

Drei weitere Dinge treiben Leute davon weg. Der Preis gehört nicht dazu.
Das Kontextfenster ist nicht das Kontextfenster. AA listet das Modell mit 1 Mio. Tokens. Was seine beiden Anbieter tatsächlich liefern, sind 256.000 (Thinking Machines) und 524.288 (DeepInfra). Wer also "1 Mio." auf dem Datenblatt gelesen und dagegen gebaut hat, bekommt das nicht. Dasselbe Problem beim Elternmodell, wo der beste gelieferte Wert 524k über drei Anbieter ist und DeepInfras günstigste und schnellste Zeile bei 131k endet.
Zwei Anbieter sind dünn. Das Elternmodell hat drei, und die Menge an Anbietern für DeepSeek oder GLM ist noch größer. Am Launch-Tag war das Modell nicht einmal auf OpenRouter verfügbar, eine Lücke, die ein Kommentator auf Hacker News neben den Parameterzahlen anmerkte. Die beiden Anbieter, die Sie bekommen, verhalten sich außerdem unterschiedlich. DeepInfra läuft bei einer 10k-Last 1,43-mal schneller, fällt dann bei 100k hinter First-Party zurück, 82,36 Tokens pro Sekunde gegenüber 113,36. Ihr Latenzprofil verschiebt sich mit der Prompt-Länge, und das ist eine furchtbare Sache, die man erst in der Produktion herausfindet.
Dünne Abdeckung lässt Ihnen außerdem weniger Spielraum, sich umzuschauen, wenn ein Anbieter anfängt, Abstriche zu machen, was häufiger passiert, als die veröffentlichten Benchmarks vermuten lassen:
"Tatsächlich haben wir festgestellt, dass viele Inferenz-Anbieter die Gewichte oder sogar den KV-Cache quantisieren, und wegen der niedrigen Preise, zu denen sie in riesigen Batches liefern, ergibt sich ein instabiler Durchsatz."
Der Preis ist keine einzelne Zahl. First-Party liegt bei 0,30 $ Input und 1,20 $ Output. DeepInfra verlangt 0,58 $ und 1,44 $ für den längeren Kontext. Vermischt zeigt AA 0,222 $ bei ihrem Standard-Verhältnis von 7:2:1, während die klassische 3:1-Mischung bei 0,525 $ landet. Welche einzelne Zahl Sie also am Ende zitieren, ist eigentlich eine Entscheidung über Verhältnisse, und diese Entscheidung zählt, sobald Sie KI-Kundenservice-Kosten im großen Maßstab modellieren.
Um fair zu bleiben: Nichts davon summiert sich zu einem schlechten Modell. Reasoning nimmt 95,5 % seiner Output-Rechnung ein, genau dort, wo die Intelligenz herkommt, und GPQA Diamond mit 89,5 % plus Long-Context-Reasoning mit 63 % sind echte Zahlen. Das Ding ist ein Macher. Probleme entstehen erst, wenn Sie von einem Macher verlangen, ein Wisser zu sein.
Wie ich diese acht ausgewählt habe
Ich schreibe viele solcher Übersichten, und die Falle bleibt immer dieselbe. Nach Benchmark ranken, veröffentlichen, weiterziehen. Also habe ich den Filter hier enger gehalten.
Jedes der acht musste etwas sein, zu dem ein Inkling-Small-Nutzer diese Woche wechseln könnte, also eine live öffentliche API mit veröffentlichten Preisen, keine Wartelisten. Jeder Preis kam von der eigenen Abrechnungsseite des Anbieters am 05.08.2026, nicht von einer Vergleichsseite, denn deren Zahlen sind innerhalb von zwei Wochen veraltet. Wo ein Anbieter sowohl gelieferten als auch beworbenen Kontext veröffentlicht, habe ich beides gegeneinander geprüft. Die Lizenzen habe ich auch gelesen, und das war wichtig, denn zwei Modelle hier haben Umsatzschwellen in ihren Lizenzen versteckt.
Was ich nicht getan habe: vorgeben, dass sechs Monate Produktionsverkehr über alle acht gelaufen sind. Ich habe die Dokumentation und die Abrechnungsseiten gelesen, die Modell-Datenblätter, die AA-Messungen, und dann nur das gesagt, was die auch belegen.
Die besten Inkling-Small-Alternativen im Überblick
Alle Preise unten sind pro Million Tokens in USD, geprüft am 05.08.2026.
| Modell | Am besten für | Gewichte | Parameter | Input | Output | Realer Kontext | Modalitäten Input | Der Haken |
|---|---|---|---|---|---|---|---|---|
| Inkling-Small (Basis) | Günstige agentische Ausführung | Apache 2.0 | 276B / 12B aktiv (266B laut AA) | 0,30 $ | 1,20 $ | 256K First-Party, 524.288 bei DeepInfra | Text, Bild, Audio | Wissens-Index -9,0 |
| DeepSeek V4 Flash | Derselbe Job, ein Viertel der Kosten | MIT | 284B / 13B | 0,14 $ | 0,28 $ | 1M | Text | Ein 2x-Spitzenzuschlag wurde angekündigt |
| Inkling, das Elternmodell | In der Familie bleiben, mehr wissen | Apache 2.0 | 975B / 41B | 1,00 $ | 4,05 $ | 524K bestenfalls, 131K günstigste | Text, Bild, Audio | Zwei AA-Seiten nennen unterschiedliche Preise |
| GLM-5.2 | Stärkste offene Gewichte, die Sie hosten können | MIT | ~753B gesamt | 1,40 $ | 4,40 $ | 1M | Text | 128K Output-Grenze |
| MiniMax M3 | Video-Input, zum Preis von Inkling-Small | Eigene Community-Lizenz | 428B / 23B | 0,30 $ | 1,20 $ | 1M, 512K garantiert | Text, Bild, Video | Standardmäßig nicht-kommerziell |
| Kimi K3 | Agentenarbeit über lange Zeiträume | Eigene Lizenz (Kimi K3 Licence) | 2,8T | 3,00 $ | 15,00 $ | 1.048.576 | Text | Keine Batch-Stufe, 3 RPM auf der Einstiegsstufe |
| Qwen3.8-Max | Geschlossenes Modell, großzügiges Fenster | Geschlossen | Nicht offengelegt | 2,00 $ | 6,00 $ | 1M | Text | Zwei Preise für ein Modell |
| Gemini 3.6 Flash | Audio-Input ohne Aufschlag | Geschlossen | Nicht offengelegt | 1,50 $ | 7,50 $ | 1.048.576 | Text, Bild, Video, Audio, PDF | 65.536 Output-Obergrenze |
| Claude Opus 5 | Wenn falsche Antworten Geld kosten | Geschlossen | Nicht offengelegt | 5,00 $ | 25,00 $ | 1M, kein Aufschlag | Text, Bild | Neuerer Tokenizer erzeugt ~30 % mehr Tokens |
1. DeepSeek V4 Flash
Am besten für: das zu tun, was Inkling-Small tut, für etwa ein Viertel der Output-Kosten.
Das ist der Vergleich, zu dem ein echter Inkling-Small-Nutzer zuerst greift, und es war auch der wichtigste inhaltliche Kommentar im r/LocalLLaMA-Launch-Thread:
"Ich frage mich, wie es sich mit DSV4 Flash vergleicht. Vergleichbar im Artificial-Analysis-Intelligenz-Benchmark (beide 40). Scheint aber etwas besser bei Coding-/Agenten-Workflows zu sein."
Das ist die Größenordnung. DeepSeek V4 Flash läuft mit 284B gesamt und 13B aktiv, neben Inkling-Smalls 12B, und AA setzt beide auf 40. Ähnlicher Motor. Keine ähnliche Rechnung.
Es gibt eine Sache, die die Parameterzahlen verstecken, und sie zählt, wenn Self-Hosting auf Ihrer Liste steht. DeepSeek liefert nativ in gemischtem FP4 und FP8, während Inkling-Small in bf16 liefert, also kam ein lokaler Runner bei nativer Präzision auf etwa 160 GB gegenüber 540 GB. Auf dem Papier ungefähr dieselbe Größe. In der Praxis das Dreifache an Speicher.
Funktionen. MIT-lizenzierte Gewichte auf Hugging Face, plus ein 1-Mio.-Kontextfenster und ein maximaler Output von 384K, der größte auf dieser Liste mit deutlichem Abstand. Rate-Limiting läuft nach Gleichzeitigkeit statt nach Anfragen pro Minute, mit einer veröffentlichten Obergrenze von 2.500 gleichzeitigen Anfragen pro Konto.
Vorteile. Die Cache-Ökonomie ist die eigentliche Geschichte. Ein Cache-Treffer kostet 0,0028 $ pro Million Input-Tokens, 50x unter der Cache-Miss-Rate von 0,14 $, also wird alles mit einem stabilen System-Prompt absurd günstig. Und MIT ist die sauberste Lizenz in der Gruppe, keine Umsatzschwelle, keine Namensnennungspflicht.
Nachteile. Nur Text, jedes Audio, das Sie bisher an Inkling-Small gefüttert haben, hat also keinen Platz mehr. Es gibt außerdem eine Fußnote auf der Preisseite, die einen künftigen 2x-Spitzenzuschlag zwischen 09:00 und 12:00 sowie 14:00 und 18:00 Uhr Peking-Zeit ankündigt, Inkrafttreten "vorbehaltlich der offiziellen Ankündigung". Eine bekannte Unbekannte in Ihrem Kostenmodell.
Preise. 0,14 $ Input und 0,28 $ Output pro Million, Cache-Treffer bei 0,0028 $. Pro liegt bei 0,435 $ und 0,87 $, was genau 3,1-mal Flash entspricht, auf beiden Seiten. Die durchgerechneten Beispiele stehen in unserer Aufschlüsselung zu DeepSeek V4 Flash Preise, und wir haben es separat gegen Kimi K3 getestet.
Meine Einschätzung: Wenn Geld Ihr Grund für den Wechsel ist, hören Sie hier auf zu lesen. Wenn es die Genauigkeit ist, lesen Sie weiter, denn günstiger werden hat noch nie dazu geführt, dass ein Modell mehr weiß.
2. Inkling, das Elternmodell
Am besten für: bei denselben Gewichten, demselben Tooling und derselben Lizenz zu bleiben und sich die Faktentreue zurückzukaufen.

Oft ist die interessanteste Alternative zu einem kleinen Modell das große, aus dem es destilliert wurde, und hier belegen die Zahlen das klar. Unter derselben AA-Methodik erreicht Inkling 41 im Intelligence Index gegenüber Smalls 40, also ein Ausgleich. Bei AA-Omniscience trennen sie sich: 2,05 bei 39,95 % Genauigkeit, gegenüber -9,0 und 30,5 %. Fast ein Drittel mehr Fragen kommen richtig zurück.
Funktionen. 975B gesamt mit 41B aktiv über 66 Schichten, Apache 2.0, und Text plus Bild plus Audio als Input. Inzwischen drei Serving-Anbieter, wo es beim Launch einen gab: DeepInfra, Together AI und Thinking Machines.
Vorteile. Gleiche Lizenz, gleiche Familie, die Migration ist also größtenteils nur eine Modell-String-Änderung. DeepInfras FP8-Zeile ist schnell, 201,5 Tokens pro Sekunde, und die Kosten pro Intelligence-Index-Aufgabe liegen dort bei 0,4296 $, günstig für diese Klasse.
Nachteile. Zwei AA-Seiten sind sich derzeit uneinig über den Preis, also sollten Sie wissen, welchen Sie zitieren. Die Modellseite nennt 1,87 $ Input und 4,68 $ Output. Die Anbieter-Zeilen nennen alle 1,00 $ und 4,05 $. Diese Anbieter-Zahlen bleiben über alle drei hinweg konsistent, also sind das die Zahlen, gegen die ich planen würde. Der gelieferte Kontext ist ebenfalls unübersichtlich. Bestenfalls 524k, und DeepInfras günstige, schnelle Zeile endet bei 131k, oder 13,1 % der beworbenen Million.
Preise. Nach den Anbieterdaten 1,00 $ Input und 4,05 $ Output, mit 0,17 $ für einen Cache-Treffer und 0,724 $ vermischt. Nennen wir es das 3,4-Fache von Smalls Output-Satz. Wenn Sie das Elternmodell shoppen, deckt der Beitrag zu Inkling-Alternativen die breitere Übersicht ab.
Meine Einschätzung: die naheliegende Wahl, und die, die die meisten überspringen, weil sich "Upgrade auf das größere Geschwistermodell" wie ein Eingeständnis anfühlt, dass das kleine ein Fehler war. Das war es nicht. Es war nur das falsche Werkzeug für einen Wissens-Job.
3. GLM-5.2
Am besten für: die stärksten offenen Gewichte auf dieser Liste, die Sie realistisch selbst hosten können.
GLM-5.2 ist der Schritt nach oben, der Sie innerhalb von MIT-lizenziertem Gebiet hält. Etwa 753B Parameter gesamt, mit einem 1-Mio.-Kontext, den die API auch tatsächlich liefert, und 2,23 Millionen Downloads im zai-org/GLM-5.2-Repo. Diese Downloadzahl verrät, dass die Self-Hosting-Community es bereits ausgiebig getestet hat.
Funktionen. MIT-Gewichte mit einem 1-Mio.-Kontext und einem maximalen Output von 128K, dann Cached Input bei 0,26 $, Cache-Speicher derzeit kostenlos. Z.ai verkauft auch einen Abonnement-Weg. Der Coding Plan startet bei 18 $ im Monat, reduziert auf 12,60 $, mit 10.000 Credits pro Woche.
Z.ai veröffentlicht seine eigene Effort-Level-Kurve, und ein Blick darauf ist besser, als die Schlagzeilenwertung für bare Münze zu nehmen:

Vorteile. GLM-5.2 kostet genauso viel wie GLM-5.1, 1,40 $ und 4,40 $, und in der Zwischenzeit stieg das Kontextfenster von 200K auf 1M. Ein glattes Upgrade, ohne Aufpreis. Eine MIT-Lizenz ohne Umsatzklausel ist zudem mehr wert als ein oder zwei Benchmark-Punkte, sobald Sie das in einem Produkt ausliefern.
Nachteile. Diese 128K-Output-Grenze ist die engste unter den Open-Weights-Optionen hier, verglichen mit DeepSeeks 384K. Credits im Coding Plan verbrennen sich mit 3x in Spitzenzeiten und 2x außerhalb, mit einer vorübergehend auf 1x gesenkten Nebenzeit-Rate bis Ende September, die Abo-Rechnung braucht also Aufmerksamkeit.
Preise. 1,40 $ Input, 4,40 $ Output, 0,26 $ Cached. Günstigere Geschwister gibt es, wenn Sie mit weniger leben können. GLM-4.7 und GLM-4.6 liegen beide bei 0,60 $ und 2,20 $, während GLM-4.7-FlashX bei 0,07 $ und 0,40 $ liegt.
Meine Einschätzung: der beste Lizenz-zu-Fähigkeit-Deal auf der Liste. Wenn Ihr Rechtsteam je gefragt hat, was passiert, wenn ein Anbieter die Bedingungen ändert, zeigen Sie auf diese Zeile.
4. MiniMax M3
Am besten für: Inkling-Smalls exakten Preis zu treffen und dabei Video-Input hinzuzufügen.
Das hier ist eine direkte Preisangleichung, und das macht den Vergleich ungewöhnlich klar. Unterhalb von 512K Input verlangt MiniMax M3 0,30 $ Input und 1,20 $ Output, identisch zu Inkling-Smalls First-Party-Satz, aus einem 428B-Modell mit 23B aktiv. Damit entscheiden Sie über alles außer den Kosten.
Funktionen. Ein 1-Mio.-Kontext mit 512K als garantiertem Minimum, Cache-Lesevorgänge bei 0,06 $, und Text plus Bild plus Video-Input über image_url- und video_url-Content-Teile. Thinking-Modus kostet an oder aus dasselbe. Die Gewichte liegen live auf Hugging Face unter MiniMaxAI/MiniMax-M3, bisher 170.353 Downloads.
Vorteile. Fast das Doppelte von Inkling-Smalls aktiven Parametern für dasselbe Geld, und Video-Input dazu, was nichts anderes zu diesem Preis auf der Liste bietet. Die Preisseite nennt den aktuellen Satz "Permanent 50 % Rabatt", und nirgendwo darauf steht ein Ablaufdatum.
Nachteile. Die Lizenz ist hier der echte Haken. Die MINIMAX COMMUNITY LICENSE ist standardmäßig nicht-kommerziell, kommerzielle Nutzung will eine sichtbare "Built with MiniMax M3"-Nennung, und über 20 Mio. $ Jahresumsatz brauchen Sie eine schriftliche Genehmigung. Über 512K Input hinweg verdoppeln sich beide Sätze, also 0,60 $ und 2,40 $. Es gibt auch eine Priority-Stufe, bei 1,5x, wenn Ihnen die schnellere Warteschlange das wert ist.
Preise. 0,30 $ und 1,20 $ bis 512K Input, dann 0,60 $ und 2,40 $ darüber, Cache-Lesevorgänge bei 0,06 $. Priority läuft mit 0,45 $ und 1,80 $, oder 0,90 $ und 3,60 $ über der Schwelle.
Meine Einschätzung: guter Motor, eine Lizenz, die Sie sich hinsetzen und lesen müssen. Ein Startup unter der Umsatzgrenze, das die Namensnennung gerne druckt, bekommt hier mehr Modell pro Dollar als von dem, das es verlässt.
5. Kimi K3
Am besten für: Agentenarbeit über lange Zeiträume, bei der der Lauf mehr zählt als der Token-Preis.
Kimi K3 ist ein viel größerer Sprung als alles zuvor, und in seiner eigenen Preisdokumentation nennt Moonshot es das Flaggschiff für "Coding über lange Zeiträume und End-to-End-Wissensarbeit". Mit 2,8 Billionen Parametern, geliefert in 4-Bit mxfp4, ist es auch das größte Modell hier, dessen Gewichte Sie herunterladen können.
Funktionen. Ein Kontext von 1.048.576 Tokens, immer aktives Reasoning hinter einer reasoning_effort-Einstellung von low, high oder max (max ist Standard), und ein ungatetes moonshotai/Kimi-K3-Repo. Websuche wird separat abgerechnet, 0,005 $ pro erfolgreichem Aufruf.
Vorteile. Offene Gewichte in dieser Größenordnung sind ungewöhnlich. Die Cache-Treffer-Rate von 0,30 $ gegenüber 3,00 $ Cache-Miss-Input ist zudem eine 10x-Ersparnis, wann immer sich Kontext wiederholt. Und der Mittelbereich ist mit günstigeren Geschwistern abgedeckt, kimi-k2.7-code liegt bei 0,95 $ und 4,00 $.
Nachteile. Zwei operative Fallstricke hier, und beide beißen. K3 wird nicht auf der Batch-Stufe unterstützt, der 60%ige Batch-Rabatt anderer Kimi-Modelle erreicht es also nicht. Das Stufensystem ist ebenfalls ausgabengesteuert: Stufe 0, bei 1 $ kumuliertem Aufladen, erlaubt 1 gleichzeitige Anfrage und 3 Anfragen pro Minute, ansteigend auf 1.000 gleichzeitige und 10.000 RPM, sobald Sie Stufe 5 mit 3.000 $ erreichen. Die Lizenz sieht MIT-förmig aus, fügt dann aber eine Klausel hinzu, die für Model-as-a-Service-Unternehmen ab 20 Mio. $ Umsatz in einem beliebigen Zwölf-Monats-Zeitraum eine separate Vereinbarung verlangt.
Preise. 3,00 $ Input und 15,00 $ Output, mit 0,30 $ bei einem Cache-Treffer. Beim 12,5-Fachen von Inkling-Smalls Output-Satz sollte niemand das für einen seitlichen Wechsel halten. Die vollständigen Stufentabellen stehen in Kimi K3 Preise.
Meine Einschätzung: die Wahl, wenn die Last ein langer Agenten-Lauf ist statt Tausende kurzer Antworten. Für ticketförmigen Traffic wird es schwer, das gegenüber GLM-5.2 zu einem Drittel des Preises zu rechtfertigen.
6. Qwen3.8-Max
Am besten für: ein geschlossenes Modell mit einem wirklich großzügigen Fenster und einer kostenlosen Testkontingent.
Qwen3.8-Max ist der Punkt, an dem Sie landen, sobald Sie entschieden haben, dass offene Gewichte nicht der Punkt sind und Alibabas oberste kommerzielle Stufe schon. Die angenehme Überraschung auf der Abrechnungsseite ist, dass Max endlich die Input-Längen-Klassen fallen gelassen hat. Eine Bandbreite, die das gesamte Millionen-Token-Fenster abdeckt.
Funktionen. Ein 1-Mio.-Kontext, maximal 131K Output und maximal 262K Reasoning, mit TPM von 2 Millionen gegenüber RPM von 15.000. Implizites Caching kostet 0,25 $. Es gibt außerdem ein kostenloses Kontingent von 1 Million Tokens, gültig für 90 Tage.
Vorteile. Kein Input-Längen-Tiering ist eine größere Sache, als es klingt. Alibabas Tiering-Regel funktioniert alles-oder-nichts, also hat beim älteren qwen3-max das Überschreiten einer Grenze die gesamte Anfrage neu bepreist, und ein 33K-Token-Prompt sprang beim Input von 1,20 $ auf 2,40 $. Hier ist diese Falle weg. Die kostenlose Million Tokens gibt Ihnen zudem echten Spielraum, um richtig zu evaluieren.
Nachteile. Eine Modell-ID, zwei Preise, abhängig vom Deployment-Umfang: 2,00 $ und 6,00 $ auf den International- und Singapore-Tabellen, 1,65 $ und 4,951 $ auf den Global-Tabellen. Eine Spanne von 18 % ohne Verhaltensunterschied dahinter ist verwirrend zu budgetieren. Das kostenlose Kontingent ist nur für Singapore, seine Uhr pausiert nicht bei Inaktivität, und was übrig bleibt, verfällt beim Ablauf. Batch nimmt 50 % Rabatt, lässt sich aber nicht mit Cache-Rabatten kombinieren. Max ist ebenfalls geschlossen, und die veröffentlichten Qwen-Gewichte sind zwei Generationen zurück, die neueste vom 24.04.2026.
Preise. 2,00 $ Input und 6,00 $ Output auf International und Singapore, dann 1,65 $ und 4,951 $ auf Global. Explizite Cache-Erstellung kostet 2,50 $, das sind 125 % des Inputs. Die vollständigen Details stehen im Beitrag zu Qwen3.8-Max Preise, und es gibt die Übersicht Qwen3.8-Max-Alternativen, wenn Sie in die andere Richtung shoppen.
Meine Einschätzung: solide, und leicht überteuert gegenüber GLM-5.2, das weniger verlangt und Ihnen dafür die Gewichte gibt. Das kostenlose Kontingent bleibt trotzdem ein Grund, es auszuprobieren.
7. Gemini 3.6 Flash
Am besten für: Audio- und Mixed-Media-Input ohne Media-Aufschlag.
Waren Sie speziell wegen des Audio-Inputs bei Inkling-Small? Dann ist das der nächste Ersatz mit einem echten Service-Level dahinter. Gemini 3.6 Flash verlangt einen einzigen flachen Input-Satz von 1,50 $ über Text, Bild, Video, Audio und PDF, und das durchbricht ein Muster, das Google selbst gesetzt hatte. Bei Gemini 2.5 Flash kostete Audio-Input 1,00 $ gegenüber 0,30 $ für Text, und bei 2.0 Flash lag der Faktor bei 7x.
Funktionen. 1.048.576 Input-Tokens gegenüber 65.536 Output, Caching bei 0,15 $ pro Million plus 1,00 $ pro Million pro Stunde Speicher, mit Batch- und Flex-Stufen beide bei halbem Preis, 0,75 $ und 3,75 $.
Vorteile. Der flache Media-Satz ist hier das Herausstechende, und eine Batch-Stufe bei 0,75 $ und 3,75 $ macht Massenarbeit erschwinglich. Googles Preisseite listet es als stabil statt als Preview, und das zählt, wenn das in Kundennähe geht.
Nachteile. Diese 65.536-Output-Obergrenze ist hier die engste, lange Generierungen müssen also aufgeteilt werden. Speicherbasierte Cache-Abrechnung läuft als laufender Zähler statt als Einmalzahlung, anders als die flachen Cache-Lese-Sätze anderswo. Gewichte sind geschlossen, kein Self-Hosting also. Grounding auf Gemini 3.x ist auf der kostenlosen Stufe zudem nicht verfügbar, was bedeutet, dass Evaluieren Geld kostet.
Preise. Standard ist 1,50 $ Input und 7,50 $ Output, Batch oder Flex 0,75 $ und 3,75 $, Priority 2,70 $ und 13,50 $. Wo das Budget die Grenze ist, kommt Gemini 3.5 Flash-Lite mit 0,30 $ und 2,50 $, und es hat ebenfalls keinen Audio-Aufschlag. Die vollständige Preisstaffel steht in Gemini 3.6 Flash Preise.
Meine Einschätzung: die Audio-Wahl. Auch das einzige Modell hier, an das ich Mixed Media im großen Umfang schicken würde, ohne zweimal nachzudenken.
8. Claude Opus 5
Am besten für: die Fälle, in denen eine selbstsicher falsche Antwort echtes Geld kostet.
Das ist das äußere Ende der Leiter, und ein Grund, warum es auf der Liste steht. Es beantwortet genau das Problem, das Inkling-Small hat. Claude Opus 5 kostet 5,00 $ Input und 25,00 $ Output, etwa das 21-Fache von Inkling-Smalls Output-Satz, und den kaufen Sie, wenn der Nachteil einer falschen Antwort die Token-Rechnung übersteigt.
Funktionen. Der volle 1-Mio.-Kontext zum Standardpreis, mit keiner Long-Context-Zuschlagsstufe, was ungewöhnlich ist. Anthropics Preisdokumentation buchstabiert es aus: Eine Anfrage mit 900.000 Tokens wird zum selben Token-Satz abgerechnet wie eine mit 9.000. Cache-Lesevorgänge kosten 0,50 $. Die Batch-API nimmt einen flachen 50%-Rabatt auf beide Seiten, 2,50 $ und 12,50 $, und er lässt sich mit Caching kombinieren.
Vorteile. Ohne Kontextlängen-Klippe verschwindet eine ganze Kategorie von Abrechnungsüberraschungen. Extended Thinking hat keinen separaten Preis und wird als Standard-Output abgerechnet. Batch zusammen mit Caching zieht auch schwere, sich wiederholende Lasten weit unter den Listenpreis.
Nachteile. In jedem Kostenvergleich ist der Tokenizer die Falle. Anthropic merkt an, dass Claude 4.7 und neuer "für denselben Text etwa 30 % mehr Tokens erzeugt" als der ältere Tokenizer, also unterschätzt dieses 25,00-$-Etikett die echte Lücke pro Aufgabe gegenüber einem Konkurrenten, der noch auf einem älteren läuft. Fast Mode verdoppelt beide Seiten auf 10,00 $ und 50,00 $, läuft nur auf der First-Party-API und lässt sich nicht mit Batch kombinieren. Gewichte sind geschlossen.
Preise. Standard 5,00 $ und 25,00 $, Batch 2,50 $ und 12,50 $, Fast Mode 10,00 $ und 50,00 $, Cache-Lesevorgang 0,50 $. Der günstigere Stopp ist Sonnet 5 bei 2,00 $ und 10,00 $ bis zum 31. August 2026, was sich am 1. September auf 3,00 $ und 15,00 $ ändert. Wann diese Lücke sich lohnt, deckt unser Vergleich Opus 5 gegen Sonnet 5 ab.
Meine Einschätzung: Übertrieben für den meisten Ticket-Traffic, genau richtig für die 5 %, die Geld, Richtlinien oder einen Vertrag betreffen. Routen Sie nach Fragetyp, statt ein Modell für alles zu wählen.
Die Preisleiter, in einem Bild
Legen Sie die acht nebeneinander nach Output-Preis, und die Form der Entscheidung wird offensichtlich.

Inkling-Small ist schon nah am Boden. Es gibt genau einen bedeutsamen Schritt nach unten, DeepSeek V4 Flash bei 0,28 $, plus einen seitlichen Wechsel zum selben Preis bei MiniMax M3. Alles andere hier ist ein Schritt nach oben, und was ein Schritt nach oben kauft, ist nie Geschwindigkeit.
Es lohnt sich, die Rechnung für Ticket-Volumen aufzumachen. Nehmen Sie tausend Tickets in einem Monat, und rechnen Sie mit 2.000 Output-Tokens pro Antwort, was für eine Support-Antwort großzügig ist. Also 2 Millionen Output-Tokens.
| Modell | Output-Kosten, 2M Tokens | Gegenüber Inkling-Small |
|---|---|---|
| DeepSeek V4 Flash | 0,56 $ | 1,84 $ günstiger |
| Inkling-Small | 2,40 $ | Basis |
| MiniMax M3 | 2,40 $ | identisch |
| GLM-5.2 | 8,80 $ | 6,40 $ mehr |
| Inkling | 8,10 $ | 5,70 $ mehr |
| Gemini 3.6 Flash | 15,00 $ | 12,60 $ mehr |
| Kimi K3 | 30,00 $ | 27,60 $ mehr |
| Claude Opus 5 | 50,00 $ | 47,60 $ mehr |
Bei diesem Volumen liegt die gesamte Spanne von günstigstem bis teuerstem bei etwa 50 $ im Monat. Eine schlecht behandelte Eskalation kostet Sie mehr als das. Das ist das eigentliche Argument, die Leiter hochzuklettern, und auch der Grund, warum die Modellwahl selten dort liegt, wo der meiste Hebel sitzt.
Was keines davon in einer Support-Warteschlange löst
Keine der acht Zeilen oben löst den nächsten Teil, und deshalb widerspreche ich immer noch, wenn mir jemand erzählt, er habe ein günstigeres Modell gefunden.
Ich habe genau dieses Versagen bei zahlenden Konten erlebt. Ein Modell hört nicht auf, wenn das Retrieval leer zurückkommt. Es füllt die Lücke aus dem, was es im Training gelernt hat. Ein Kunde, ein dänischer Solarenergie-Anbieter, ließ seinen Bot Abo-Behauptungen erfinden und an echte Kunden senden. Ein anderer fragte seinen Bot etwas und bekam "Sauerstoff (Periodensystem)" zurück. Kein Fall davon war ein schlechtes Modell. Beides war ein Modell ohne etwas, an dem es sich verankern konnte, und ohne etwas, das es davon abhielt zu raten.
Ein Support-Manager auf unseren Konten brachte dieselbe Sorge deutlicher auf den Punkt, indem er der KI sagte, was sie nicht tun soll:
"Hör auf, Kunden zu sagen, dass wir das für sie klären. Das weißt du nicht."
Ein E-Commerce-Support-Manager, besorgt darüber, dass ein Bot Liefertermine überversprach. Dasselbe Grundproblem. Das Modell klingt sicher, und dieses Sicher-Klingen ist der gefährliche Teil. Inkling-Smalls eigene AA-Briefcase-Aufteilung sagt es unumwunden: 270,86 Elo-Punkte besser im Präsentieren als im Analysieren.

Ein größeres Modell ist nicht die Lösung. Zwei Dinge, mit denen kein Modell ausgeliefert wird, sind es. Erst Grounding, damit die Antwort aus Ihrer Wissensdatenbank und Ihren vergangenen Tickets kommt statt aus dem parametrischen Gedächtnis. Dann ein Confidence-Gate, damit alles unter der Schwelle an einen Menschen geht statt hinauszugehen. Diese beiden Dinge machen aus einem rohen Motor etwas, das Sie auf eine Live-Warteschlange richten können, und sie sind das ganze Thema von KI-Halluzinationsprävention.
Der andere Grund, warum Leute aufhören, Modelle zu vergleichen, ist banaler als das. Ein Entwickler, mit dem wir gesprochen haben und der eine IT-Incident-Wissensdatenbank aufbaute, hatte die Runde schon gedreht. Er hat die API eines Anbieters ausprobiert und für zu teuer befunden, eine andere ausprobiert und für unzuverlässig befunden, und wollte am Ende nur etwas, das funktioniert. Modelle zu vergleichen macht Spaß. Eine Modellschicht zu warten nicht.
eesel ausprobieren
Wenn das Modell, das Sie wählen, Kundenfragen beantworten soll, kommt der ehrliche Rat in zwei Teilen. Nehmen Sie, welches der acht oben zu Ihrem Budget und Ihrer Lizenz passt. Bauen Sie dann nicht selbst die Schicht darüber.
Diese Schicht ist es, was eesel ist. Es klinkt sich in Zendesk, Freshdesk oder was auch immer Sie schon nutzen, lernt aus Ihren vergangenen gelösten Tickets und Ihrer Wissensdatenbank statt aus den Trainingsdaten eines Modells, und antwortet erst, sobald es eine von Ihnen selbst gesetzte Sicherheitsschwelle erreicht. Alles darunter eskaliert. Und bevor es echten Traffic berührt, können Sie es gegen Ihre eigene Ticket-Historie simulieren, so lernen Sie, was es falsch gemacht hätte, bevor ein Kunde es tut.

Ich stelle unsere eigene gemessene Fehlerquote von 7 % bei Fakten nach vorne, statt sie zu vergraben, weil das die Zahl ist, die zählt, während Sie ein Modell auswählen. Sie kam vom echten Zendesk-Traffic eines deutschen Schmuckhändlers, etwa tausend Tickets im Monat, kreuzvalidiert über 284 Chats und 100 Tickets, mit Retrieval über deren echte Wissensdatenbank. Grounding bringt Sie nicht auf null. Es bringt Ihnen eine Zahl, die Sie messen, an der Sie gaten und die Sie verbessern können, und das ist eine andere Kategorie von Sache als ein selbstsicher ratendes Modell.
Die kommerzielle Ausrichtung ist bewusst nicht pro Sitzplatz. Die Abrechnung läuft pro gelöstem Ticket, sodass die Preise erledigte Arbeit statt Kopfzahl verfolgen. Kostenlos zum Testen. Wenn Sie die Zahlen erst gegenchecken wollen, ist der Leitfaden zur Ticket-Deflection ein guter Startpunkt.
Meine Einschätzung
Inkling-Small ist ein gutes kleines Modell, dem die Leute ständig einen Job zumuten, für den es nicht gebaut wurde. Es führt gut aus, zu einem Preis, der schon nahe am Boden liegt, und seine Wissenszuverlässigkeit misst -9,0. Diese beiden Fakten stehen nicht im Widerspruch. Zusammen beschreiben sie ein Werkzeug.
Wechseln Sie wegen der Kosten? Nehmen Sie DeepSeek V4 Flash, und Sie sind fertig. Wenn falsche Antworten der Grund für Ihren Wechsel sind, gehen Sie zum Eltern-Inkling für die günstige Lösung, oder zu Claude Opus 5 für die teure, und gehen Sie mit dem Wissen hinein, dass keines der beiden Sie auf null bringt.
Und wenn der Grund ist, dass das Kontextfenster nicht zum Datenblatt passt, liefert GLM-5.2, was es bewirbt, unter MIT. Das ist die Zeile, die ich nehmen würde, wenn ich mich auf eine festlegen müsste.
Das ehrliche Urteil über alle acht bleibt aber dasselbe. Motoren zu tauschen verschiebt Ihre Rechnung und Ihre Benchmark-Werte. Es ändert nichts daran, was passiert, wenn ein Kunde etwas fragt, das Ihre Dokumentation nie beantwortet hat. Diese Lücke zu schließen braucht Retrieval, eine Sicherheitsschwelle, eine Übergabe. Kein Modell-Upgrade macht das für Sie, und es lohnt sich, das zu lösen, bevor Sie einen weiteren Nachmittag mit dem Lesen von KI-Ticket-Klassifizierung-Benchmarks verbringen.
Häufig gestellte Fragen
Was sind die besten Inkling-Small-Alternativen?
Gibt es eine günstigere Alternative zu Inkling-Small?
Warum sollte man von Inkling-Small wechseln?
Hat Inkling-Small wirklich ein 1-Mio.-Kontextfenster?
Welche Inkling-Small-Alternative hat die beste offene Lizenz?
Wie teuer ist es, eine Inkling-Small-Alternative für Support-Tickets zu betreiben?
Kann ich eine Inkling-Small-Alternative selbst hosten, statt pro Token zu zahlen?
Reicht Inkling-Small allein für den Kundensupport aus?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.






