Grok 4.6 im Test: Was die Eval-Tabelle wirklich sagt, wenn man die Verlierer-Zeilen liest

Alicia Kirana Utomo
Geschrieben von

Alicia Kirana Utomo

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet August 12, 2026

Expertengeprüft
Handgezeichnete Illustration mit dem Grok-Logo und einer Bewertungskarte mit gemischten Sternebewertungen in verschiedenen Kategorien

Wähle deinen Anwendungsfall, dann lies das Urteil

Das Nützlichste, was ich dir geben kann, ist nicht noch eine Benchmark-Tabelle. Es ist die Antwort auf „gilt das für mich?". Das Urteil zu Grok 4.6 dreht sich komplett, je nachdem, was du baust.

Was sich seit Grok 4.5 tatsächlich geändert hat

xAI hat Grok 4.6 am 12. August 2026 veröffentlicht, etwa fünf Wochen nach Grok 4.5. Fünf Wochen sind ein schneller Takt, und man sieht es an dem, was sich bewegt hat und was nicht.

Die Trainingsgeschichte ist ungewöhnlich offen. xAI sagt, man habe eine längere ergänzende Trainingsphase als bei 4.5 durchlaufen und dann Grok 4.5 selbst genutzt, um die SFT-Trajektorien über Reasoning-Stufen und Agenten-Harnesses hinweg neu zu erzeugen, wobei schlechte Traces mit modellbasierten Prüfungen herausgefiltert wurden. Mit anderen Worten: Das Vorgängermodell hat dieses hier trainiert, und die RL-Stufe war auf agentische Aufgaben ausgerichtet: Kernel-Optimierung, Webentwicklung, computergestütztes Design.

Das Datenblatt hat sich kaum bewegt. Laut der grok-4.6-Modellseite bleibt das Kontextfenster bei 500.000 Tokens, das Modell nimmt Text und Bild als Input und gibt Text aus, mit Function Calling, strukturierten Outputs und Reasoning. Die Rate-Limits liegen bei 150 Anfragen pro Sekunde und 50 Mio. Tokens pro Minute, über us-east-1 und us-west-2 hinweg.

Was sich bewegt hat, sind die Werte. Artificial Analysis sieht es bei 61 Punkten im Intelligence Index, 5 Punkte mehr als Grok 4.5 und 23 mehr als Grok 4.3. Fünf Punkte in fünf Wochen sind ein echter Generationssprung, kein bloßes Versionsnummer-Update.

Die Eval-Tabelle richtig lesen

Eine Illustration einer Person, die die zwei kurzen Zeilen auf einer Bewertungskarte betrachtet, während drei längere Zeilen darüber stehen
Eine Illustration einer Person, die die zwei kurzen Zeilen auf einer Bewertungskarte betrachtet, während drei längere Zeilen darüber stehen

Unten steht xAIs eigene Tabelle. Ich finde sie aufschlussreicher als den Blogpost drumherum. Fett ist der Gewinner pro Zeile.

EvaluationGrok 4.6 HighGrok 4.5 HighGPT-5.6 Sol MaxFable 5 Max
AA Intelligence Index61566162
GDPVal-AA v21753152617281741
CursorBench v3.269,9%66,7%67,2%70,5%
DeepSWE v1.165,9%54%73%70%
FrontierCode v1.1 (Extended)61,3%56,6%60,6%63,6%
APEX-Agents57,5%47,1%56,7%59,2%
Terminal-Bench v3.026%15,7%34,6%34,1%
APEX-SWE56,4%53,6%58,8%
AA-Briefcase1577131315021574
Harvey LAB (Vals)15,8%12,9%2,5%11,3%

Vier Dinge fallen ins Auge.

Grok 4.6 gewinnt die Wissensarbeit-Zeilen und verliert die Software-Engineering-Zeilen. Es holt GDPVal-AA, AA-Briefcase und Harvey LAB klar für sich. Es verliert bei DeepSWE um 7,1 Punkte und bei Terminal-Bench um 8,6 Punkte. Für einen Launch-Post, der um agentisches Coding herum betitelt ist, ist das eine merkwürdige Form.

Die Harvey-Zahl ist die seltsamste Zelle der Tabelle. Grok 4.6 erreicht 15,8% bei diesem juristischen Analyse-Benchmark gegenüber GPT-5.6 Sols 2,5%. Eine 6-fache Lücke bei einem einzelnen Eval bedeutet meist, dass der Eval etwas Enges misst oder ein Modell genau auf diese Aufgabenform hin getunt wurde. Ich würde kein Rechtsprodukt auf einer einzigen Zeile aufbauen, aber es lohnt sich, es zu wissen.

Terminal-Bench hat zwei aktive Versionsnummern, und sie widersprechen sich völlig. xAIs Kennzahlenblatt zeigt 26% bei v3.0. Artificial Analysis zeigt 88,4% bei v2.1 und nennt das auf Höhe der führenden Modelle. Beides stimmt. v3.0 ist die schwerere Revision. Wenn du eine Terminal-Bench-Zahl ohne Version siehst, sagt sie dir gar nichts.

Die Sprünge von 4.5 zu 4.6 sind genau dort am größten, wo Agenten leben. DeepSWE stieg von 54% auf 65,9%. APEX-Agents von 47,1% auf 57,5%. AA-Briefcase von 1313 auf 1577. Was auch immer die agentische RL-Stufe getan hat, es hat bei den Aufgaben funktioniert, die über viele Schritte laufen.

Eine weitere Tabellenzeile, die nicht in xAIs Chart auftaucht. Artificial Analysis misst 𝜏³-Banking, einen mehrstufigen Kundenservice-Eval mit Tool-Nutzung, und Grok 4.6 erreicht 50,7%. Das bringt es in die Top zwei, gleichauf mit Qwen3.8 Max bei 51,3%. Ich komme später auf diese Zahl zurück, denn Top zwei bedeutet weniger, als es klingt.

Geschwindigkeit und Kosten, gemessen statt behauptet

Hier macht Grok 4.6 sein stärkstes Argument, und es ist eigentlich kein Benchmark-Argument.

Die Listenpreise sind unverändert gegenüber Grok 4.5: $2,00 pro 1 Mio. Input, $0,50 gecacht, $6,00 Output, laut xAIs Preisseite. Ab 200.000 Prompt-Tokens verdoppelt sich jeder Satz auf $4,00 / $1,00 / $12,00. Den Preis über eine Generation hinweg konstant zu halten ist ungewöhnlich an der Spitze, und Artificial Analysis sagt das auch ausdrücklich.

Der Vergleich, der zählt, ist der mit Modellen innerhalb von zwei Punkten des Index. Claude Opus 5 kostet $5/$25. GPT-5.6 Sol kostet $5/$30. Grok 4.6 zieht mit Sol gleich, bei einem Fünftel des Output-Satzes, und der Output-Satz dominiert die Kosten bei reasoning-lastiger Arbeit.

Gemessen statt gelistet, auf OpenRouters Grok-4.6-Seite, bleibt das Bild bestehen:

MesswertxAI StandardxAI (ZDR)
Effektiv bezahlter Input$0,7249/Mio.$0,7812/Mio.
Effektiv bezahlter Output$6,125/Mio.$6,116/Mio.
Cache-Trefferquote90,3%88,0%
Durchsatz (3-Tage-Schnitt)94 Tok/s92 Tok/s
Latenz (3-Tage-Schnitt)0,62s0,96s
Tool-Call-Fehlerrate0,08%0,02%
Fehlerrate strukturierter Outputs4,00%0,00%

Zwei davon verdienen einen zweiten Blick. Der effektive Input-Preis liegt bei $0,72, nicht bei $2, weil echter Traffic in 90% der Fälle einen Cache-Treffer erzielt. Und die Fehlerrate von 4,00% bei strukturierten Outputs auf dem Standard-Endpunkt gegenüber 0,00% beim ZDR-Endpunkt ist ein echter operativer Unterschied, kein Rundungsartefakt. Wenn du JSON-Schemas für Tool Calls fixierst, teste beide.

Artificial Analysis beziffert die Gesamtrechnung für den Index auf $1.068,47 für die Bewertung von Grok 4.6, was $0,84 pro Aufgabe ergibt – dasselbe wie Kimi K3 bei etwas geringerer Intelligenz. Es erzeugte dabei 72 Mio. Tokens, gegenüber einem Median von 71 Mio., ist also einen Tick geschwätziger, aber nicht auffällig.

Die eine Zeile, die sich gegen Käufer bewegt hat, ist der gecachte Input, und die Community hat es innerhalb von Stunden bemerkt:

Hacker News

"Seems the cache read pricing almost doubled from $0.30 in Grok 4.5 to $0.50 in Grok 4.6. In my experience in heavy coding sessions most pricing is just cache read and cache write like 80% of my token bill."

Das ist ein berechtigter Fang, und die Rechnung stimmt. Es ist eine Erhöhung um 67% bei genau dem Posten, der lange Agenten-Sitzungen dominiert. Es ist aber auch immer noch ein gecachter Input von $0,50 bei einem Modell, das mit GPT-5.6 Sol gleichzieht, also würde ich es einen echten Rückschritt innerhalb eines nach wie vor exzellenten Angebots nennen. Unser Guide zu den xAI-Preisen enthält die vollständige Preisstaffel.

Was Leute sagen, die es tatsächlich testen

Benchmarks sind ein Input. Unten steht, wie der erste Tag echter Nutzung aussah. Ich habe Berichte mit Zahlen ausgewählt statt bloßer Eindrücke.

Der nützlichste Datenpunkt, den ich gefunden habe, war ein direkter Head-to-Head-Lauf durch dasselbe Feature auf derselben Codebasis:

Hacker News

"Tested both DS v4 pro 0813 and Grok 4.6 (all from openrouter) on Codex cli. Worked on a same new feature development on my project. Deepseek 4 pro: Worked for 12m 02s, cost $0.12, has bug. Grok 4.6: Worked for 3m 18s, cost $1.41, no bug."

Das ist 3,6-mal schneller und 11,75-mal teurer, mit einem funktionierenden Ergebnis gegenüber einem defekten. Es ist ein Einzelversuch einer Person, also als Signal behandeln, nicht als Befund, aber es erfasst den tatsächlichen Trade-off gegenüber einem günstigen Open-Weights-Modell wie DeepSeek V4 Flash besser als jeder Index-Wert.

Das Geschwindigkeitsthema wiederholte sich:

Hacker News

"I used to be a Claude user. Since trying Grok 4.5 and especially Grok 4.6, I don't want to go back to Claude any more (I have early access to 4.6). Grok is 3x+ faster than Claude and I can't tell the diff in engineering work quality. As an engineer, speed is important to me."

Und ein Entwickler beschrieb den Workflow-Wechsel genau, was die Art von Detail ist, die mich einen Bericht glauben lässt:

Hacker News

"My go-to workflow was Sol for planning and Grok for building. But my in my first tests with Grok 4.6, I found it quite good and I'll start using it for both; assuming it's as good at is shows at benchmarks it's unbeatable at cost/time."

Skepsis gab es auch, und sie betraf meist die Frage, ob der Index das Richtige misst:

Hacker News

"I haven't tried so it's pure speculation based on benchmarks, but I'd assume Grok 4.6 is around Opus 4.8 in real world use, but clearly below Opus 5."

Das ist eine vernünftige Vorannahme. Index-Parität und Parität in der echten Welt sind unterschiedliche Behauptungen, und die ehrliche Antwort einen Tag nach dem Launch ist, dass noch niemand genug Stunden damit verbracht hat. Was ich sagen kann: Das Argument Preis pro Einheit Intelligenz hängt nicht davon ab, diese Debatte zu klären.

Die Zeile, die der Launch-Post ausgelassen hat

Eine Illustration eines Support-Agenten, der zu zwei gleich selbstbewussten Sprechblasen aufblickt, eine durchgezogen und eine hohl mit einem Fragezeichen darin
Eine Illustration eines Support-Agenten, der zu zwei gleich selbstbewussten Sprechblasen aufblickt, eine durchgezogen und eine hohl mit einem Fragezeichen darin

xAIs Eval-Tabelle hat zehn Zeilen, und keine davon handelt vom Falschliegen. Artificial Analysis misst genau das, und diese Zahlen wären es, die ich ganz oben auf die Seite setzen würde, wenn ich den Launch-Post schreiben würde.

AA-Omniscience-Genauigkeit: 48,2%. Nicht-Halluzinationsrate: 65,7%.

Lies die zweite Zahl genau, denn man kann sie leicht als „halluziniert in 34% der Fälle" missverstehen. Es ist die Rate, mit der eine Halluzination unter den nicht korrekten Antworten vermieden wird. Wenn Grok 4.6 also etwas nicht weiß, sagt es das etwa zwei von drei Malen, und erfindet in den anderen Fällen eine Antwort. Der Benchmark existiert genau deshalb, weil das Verweigern einer Antwort nicht so bestraft werden sollte wie ein selbstbewusstes Falschliegen.

Bei einem Coding-Agenten wird eine falsche Antwort von einem Test abgefangen. Bei einem kundenzugewandten Agenten wird eine falsche Antwort abgeschickt.

Ich baue KI-Agenten bei eesel, und ich habe genau dieses Fehlermuster in der Produktion mehr als einmal beobachtet. Ein Fall, an den ich oft denke: Ein europäisches Team für Fahrzeug-Telematik, das Zendesk nutzt, mit rund 200 Tickets pro Monat und Wachstum Richtung 2.000, stellte fest, dass ihr Agent munter die Unterstützung für Automarken bestätigte, die nirgendwo in ihrer Datenbank auftauchten. Die KI hatte keine Fehlfunktion. Ihr Helpcenter sagte „wir unterstützen alle Modelle", und das Modell glaubte es. Ihr Entwickler beschrieb die ersten Wochen als Versuch und Irrtum, was ziemlich genau die ehrlichste Beschreibung eines Rohmodell-Einsatzes ist, die ich je gehört habe.

Das ist eine Nicht-Halluzinationsrate von 65,7%, die auf eine für Menschen geschriebene Wissensdatenbank trifft. Nichts an Grok 4.6s Trainingslauf behebt das. Was es behebt, ist die Begrenzung dessen, woraus das Modell schöpfen darf, und die Kontrolle dessen, was es abschicken darf.

Solltest du Grok 4.6 also in eine Support-Warteschlange stellen?

Berechtigte Frage. Die ehrliche Antwort hat zwei Teile, und sie zeigen in unterschiedliche Richtungen.

Als Engine ist es eine legitim gute Wahl. 50,7% bei 𝜏³-Banking sind Top zwei unter allem, was Artificial Analysis getestet hat, und 𝜏³-Banking ist der öffentliche Benchmark, der dem, was ein Support-Agent tatsächlich tut, am nächsten kommt: mehrstufig, tool-nutzend, kundenzugewandt. Eine Tool-Call-Fehlerrate von 0,08% und 94 Tok/s bedeuten, dass es mitten im Gespräch nicht ins Stocken gerät. Bei $2/$6 sehen die Unit Economics von Support-Ticket-Automatisierung gut aus.

Als Produkt ist es keins. Top zwei beim Kundenservice bedeutet, dass es ungefähr die Hälfte dieser Gespräche löst. Die andere Hälfte ist da, wo die eigentliche Arbeit liegt: wissen, wann man aufhört, wann man an einen Menschen übergibt, welches Makro man auslöst, welche Bestellabfrage man ausführt, und was man niemals versprechen darf. Nichts davon ist eine Modellfähigkeit. Es ist Eskalations-Design, Retrieval-Umfang und ein Confidence-Score-Schwellenwert, den du an deiner eigenen Historie kalibriert hast.

Ich sage das als jemand, dessen Team genau wegen dieser Überlegung Deals verliert. Mehrere eesel-Kunden sind gegangen, um direkt auf einer Spitzenmodell-API aufzubauen, und das ist die häufigste konkurrierende Alternative, die wir von technischen Teams sehen. Manchmal funktioniert es. Was sie meist zurückbringt, ist nicht die Modellqualität, sondern der zweite Monat: Niemand will Ticket-Triage-Regeln, Markenstimme-Drift, Berechtigungen für die Wissensdatenbank und eine Bereitschaftsrotation für einen Chatbot besitzen.

Wenn du diese Woche ein Modell auswählst, gehört Grok 4.6 auf die Shortlist neben Claude Opus 5 und GPT-5.6. Wenn du entscheidest, wie du Kunden antwortest, ist das Modell die uninteressanteste Entscheidung, die du treffen wirst.

Ein Spitzenmodell auf deinem Helpdesk – ohne den zweiten Monat?

Die Reports-Ansicht von eesel AI mit Aufgabenvolumen, Trigger-Ereignissen nach Typ und Genehmigungsnutzung pro Tool
Die Reports-Ansicht von eesel AI mit Aufgabenvolumen, Trigger-Ereignissen nach Typ und Genehmigungsnutzung pro Tool

Das ist der Teil, den dir eine rohe API nicht geben kann. Bevor eesel ein einziges Live-Ticket beantwortet, lässt es deinen Agenten über deine eigenen historischen Tickets laufen und zeigt dir, was er gesagt hätte – auf deinen Daten, mit deiner Wissensdatenbank samt ihrer Lücken. So hört die 65,7%-Frage auf, ein Benchmark zu sein, und wird zu einer Zahl, die du tatsächlich gemessen hast, auf deiner Warteschlange, bevor ein Kunde sie je gesehen hat. Verbinde einen Helpdesk, schau dir die Simulation an, entscheide dann. eesel testen, kostenlos.

Fazit

Kauf es, wenn du lange agentische Sitzungen für Wissensarbeit, Recherche, Analyse oder dokumentenlastige Aufgaben fährst und der Preis zählt. Bestwerte in der Tabelle bei GDPVal-AA und AA-Briefcase, bei $2/$6, und Aufgaben in halb so vielen Runden wie Claude Opus 5 abschließen – das ist eine schwer zu widerlegende Kombination. Kauf es auch, wenn reine Geschwindigkeit deinen Workflow verändert. Mehrere Entwickler berichteten unabhängig voneinander von 3x, und einer maß 3m 18s gegenüber 12m 02s bei derselben Aufgabe.

Lass es, wenn dein Workload autonome Softwareentwicklung oder terminal-lastige Ops ist. DeepSWE 65,9% gegenüber Sols 73%, und Terminal-Bench v3.0 bei 26% gegenüber 34,6% sind keine knappen Entscheidungen, und das sind xAIs eigene veröffentlichte Zahlen.

Sei vorsichtig, wenn es vor Kunden landet. Es ist eines der beiden besten Modelle beim Kundenservice-Benchmark, und trotzdem scheitert es an der Hälfte dieser Gespräche, mit einer Nicht-Halluzinationsrate von 65,7% darunter. Das ist kein Grok-Problem, jedes Spitzenmodell hat eine Version dieser Zeile. Es ist ein Grund, warum die Helpdesk-Schicht mehr zählt als die Modellwahl.

Mein Gesamteindruck: das beste Preis-Intelligenz-Verhältnis an der Spitze, Stand August 2026, fälschlich als Coding-Release etikettiert, während seine echte Stärke Wissensarbeit ist. Fünf Punkte Index-Gewinn in fünf Wochen bei stabilen Preisen sind die Geschichte, und die Erhöhung der Cache-Rate ist das Sternchen.

Wenn du das umfassendere Vergleichsset willst, starte mit Grok-4.5-Alternativen und lies danach den Claude-Opus-5-Test.

Für die Token-Mathematik für sich allein geht die Preisstaffel zu xAI-Preisen tiefer als dieser Test.

Häufig gestellte Fragen

Ist Grok 4.6 gut? Zu welchem Fazit kommt dieser Grok-4.6-Test?
Es ist ein echtes Spitzenmodell und aktuell das beste Preis-Intelligenz-Verhältnis an der Spitze der Tabelle. Es erreicht 61 Punkte im Artificial Analysis Intelligence Index, gleichauf mit GPT-5.6 Sol, bei $2/$6 gegenüber Sols $5/$30. Der Haken in diesem Grok-4.6-Test: Seine Siege häufen sich bei Wissensarbeit, nicht bei reiner Softwareentwicklung. Wenn du ein Modell für eine Support-Warteschlange auswählst, zählt die Shortlist-Logik in unserem Guide zum besten KI-Agenten für den Kundenservice mehr als der Index-Wert.
Wie schneidet Grok 4.6 im Vergleich zu Grok 4.5 ab?
Es gewinnt 5 Punkte im Intelligence Index dazu, von 56 auf 61, etwa fünf Wochen nachdem Grok 4.5 erschienen ist. Die größten Sprünge gibt es bei agentischen Evals: DeepSWE steigt von 54% auf 65,9%, APEX-Agents von 47,1% auf 57,5%, und AA-Briefcase von 1313 auf 1577. Die Token-Preise bleiben identisch. Die Werte des Vorgängermodells findest du in unserem Grok-4.5-Test und in der Aufschlüsselung zu den Grok-4.5-Preisen.
Wie viel kostet der Betrieb von Grok 4.6?
$2,00 pro 1 Mio. Input-Tokens, $0,50 gecacht, und $6,00 für Output laut xAIs Preisseite, verdoppelt sich auf $4/$1/$12 jenseits von 200.000 Prompt-Tokens. Artificial Analysis hat $1.068,47 ausgegeben, um es über den gesamten Index zu bewerten, bei $0,84 pro Aufgabe. Die vollständige Preisstaffel steht in unserem Guide zu den xAI-Preisen, und für Support-Teams zählt eigentlich die Zahl der Kosten pro Lösung.
Halluziniert Grok 4.6?
Ja, und der Launch-Post erwähnt das nicht. Artificial Analysis hat eine AA-Omniscience-Genauigkeit von 48,2% und eine Nicht-Halluzinationsrate von 65,7% gemessen, was bedeutet, dass ungefähr ein Drittel seiner nicht korrekten Antworten selbstbewusste Erfindungen sind statt eines Eingeständnisses, es nicht zu wissen. Das ist der ganze Grund, warum ein Rohmodell eine Retrieval-Grenze braucht. Unser Guide zur Vermeidung von Halluzinationen im Support und der Beitrag darüber, wie man einen Support-Agenten ehrlich hält, behandeln beide die Lösung.
Ist Grok 4.6 gut für den Kundenservice?
Auf dem Papier ist es eines der beiden besten getesteten Modelle für mehrstufigen Kundenservice, mit 50,7% bei 𝜏³-Banking. Lies das aber noch einmal genau: Top zwei bedeutet, dass es immer noch die Hälfte dieser Gespräche nicht schafft. Grok 4.6 ist eine solide Engine, aber kein Support-Produkt für sich allein, weshalb Eskalationsregeln und ein Confidence-Score-Gate mehr für die Lösungsquote tun als der Modelltausch. Das vollständige Bild gibt es unter KI für den Kundenservice.
Wo kann ich Grok 4.6 nutzen?
Es erschien gleichzeitig in der xAI-API, in Grok Build und bei Cursor, außerdem bei OpenRouter, Vercel und Cloudflare. Cursor und Grok Build boten in der Launch-Woche beide die doppelte inkludierte Nutzung. Unsere Seiten zu Cursor-Preisen und Cursor-Erfahrungen behandeln diese Seite, und Grok Bot behandelt xAIs separates Agentenprodukt.
Wie groß ist das Kontextfenster von Grok 4.6?
500.000 Tokens, unverändert gegenüber Grok 4.5, laut der grok-4.6-Modellseite. Der Haken ist, dass sich jeder Satz verdoppelt, sobald eine Anfrage über 200.000 hinausgeht, weshalb das zum Listenpreis nutzbare Kontextfenster eigentlich 200.000 beträgt. Lange Ticket-Threads kommen dem selten nahe, aber eine komplette Wissensdatenbank, in einen Prompt gestopft, schon – ein Argument mehr für Retrieval statt Brute Force.
Welche Alternativen sollte ich mit Grok 4.6 vergleichen?
Claude Opus 5 führt den Index mit 63 an, Claude Fable 5 liegt bei 62, und GPT-5.6 Sol zieht mit Grok bei 61 gleich. Darunter erreicht Kimi K3 die gleichen $0,84 pro Aufgabe, und Qwen3.8 Max lag bei Kundenservice-Tools knapp vorn. Starte mit Grok-4.5-Alternativen oder der breiteren Liste an xAI-Alternativen.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Handgezeichnete Illustration von drei Personen, die Modell-Scorecards vergleichen, neben einer Waage, die Kosten gegen eine Checkliste abwägt
Trending

Grok 4.6 Alternativen: 7 Modelle im Vergleich der Rechnungsform

Grok 4.6 kostet 2 $/6 $ und verdoppelt jeden Satz, sobald eine Anfrage 200k Tokens überschreitet. Ich habe geprüft, was sieben Alternativen tatsächlich verlangen und welche diese Klippe entfernen, statt sie nur zu verschieben.

Alicia Kirana UtomoAlicia Kirana UtomoAug 13, 2026
Illustration eines KI-Teammitglieds am Laptop, das von zwei Kollegen mit Checkliste und Lupe überprüft wird, mit dem Grok-Zeichen links
Trending

Grok Bot im Test: Was in der frühen Beta wirklich funktioniert

Grok Bot gibt jedem KI-Teammitglied einen Cloud-Computer und echte Logins. Ich habe jede Doku-Seite und die erste Woche an Nutzerberichten durchgesehen, um zu sehen, was tatsächlich funktioniert.

Rama Adi NugrahaRama Adi NugrahaAug 13, 2026
Redaktionelle Illustration mit dem Grok-Logo, Benchmark-Balken und einem Preisschild, die einen Grok 4.5 Test darstellt
Trending

Grok 4.5 im Test: Benchmarks, Preise und das Urteil

xAIs Grok 4.5 startete am 8. Juli mit einem #4-Platz im Intelligence Index und dem besten agentischen Tool-Use-Ergebnis im gesamten Feld. Hier ist der echte Test, mit Benchmarks, Preisen und wer es wirklich nutzen sollte.

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026
Illustration von zwei Personen, die einen Stapel Kostenebenen prüfen, oben Sitzplätze und unten Token-Verbrauch, mit dem Grok-Logo links
Trending

Grok Bot Preise 2026: der 200-Dollar-Plan und der ungedeckelte Zähler

Grok Bot kostet 200 $ im Monat oder 120 $ pro Sitzplatz, aber der Preis auf der Website ist nur die Eintrittsgebühr. Die Doku sagt, es gibt noch keine Ausgabenobergrenze, und der Zähler läuft wöchentlich.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 13, 2026
Grok 4.6 Preise 2026: jede Rate und was Teams wirklich zahlen
Trending

Grok 4.6 Preise 2026: jede Rate und was Teams wirklich zahlen

Grok 4.6 kostet laut Preisliste 2,00 $ Input und 6,00 $ Output pro Million Tokens. Der von OpenRouter gemessene effektive Input-Preis liegt bei 0,74 $. Hier ist jeder Posten auf der Rechnung – und über welche Tür du am besten kaufst.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 13, 2026
Illustration eines KI-Teammitglieds, das an einem Schreibtisch neben zwei Kolleginnen arbeitet, mit Tool-Icons darüber und dem Grok-Logo links
Trending

Grok Bot erklärt: Was xAIs immer aktive KI-Teammitglieder wirklich tun

Grok Bot gibt jedem KI-Teammitglied einen eigenen Cloud-Computer und meldet es in Ihren echten Tools an. So funktioniert es, das kostet es, und hier bricht das Konzept.

Alicia Kirana UtomoAlicia Kirana UtomoAug 12, 2026
Strichzeichnung eines Entwicklers und eines Support-Mitarbeiters, die über Sprachwellen sprechen, neben dem Grok-Logo
Trending

Grok Voice Think Fast 2.0 Preise: Was $0.08/Min. wirklich kostet

Grok Voice Think Fast 2.0 kostet $0.08 pro Minute Audio, 60% mehr als 1.0. Der Alias grok-voice-latest wechselt heute dorthin, hier ist die echte Rechnung pro Anruf.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Strichzeichnung eines Entwicklers und eines Support-Mitarbeiters, die über Sprachwellen sprechen, daneben das Grok-Logo
Trending

Grok Voice Think Fast 2.0 Preise: Was $0.08/Min. kostet

Grok Voice Think Fast 2.0 kostet $0.08 pro Minute Audio, 60% mehr als 1.0. Der grok-voice-latest-Alias wechselt heute darauf, hier also die reale Kostenrechnung pro Anruf.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Strichzeichnung eines Support-Mitarbeiters mit Headset neben dem Grok-Logo, mit einer Sprachwellenform in einer Sprechblase
Trending

Grok Voice Think Fast 2.0: was sich ändert und was es kostet

Grok Voice Think Fast 2.0 erreicht 82,9% im Speech-to-Speech-Index von Artificial Analysis und antwortet in 0,70s. Es kostet aber auch 60% mehr pro Minute, und der Standard-Alias wechselt am 5. August dorthin.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten