Grok Voice Think Fast 2.0 im Test: schnell, scharf, gedeckelt

Alicia Kirana Utomo
Geschrieben von

Alicia Kirana Utomo

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet August 4, 2026

Expertengeprüft
Zwei Personen im Gespräch mit Sprachwellenformen dazwischen und dem Grok-Logo darüber

Was ich wirklich getestet habe, und was nicht

Ich möchte ehrlich sein, worauf das hier basiert, denn "ich habe es getestet" wird bei Sprachmodellen ziemlich locker verwendet.

Was ich durchgearbeitet habe: xAIs Speech-to-Speech-Dokumentation von vorne bis hinten, dazu die Modellkarte mit ihren veröffentlichten Grenzwerten und die Preistabelle auf der Preisseite.

Dazu kommt der Launch-Beitrag und der unabhängige Lauf von Artificial Analysis, der es gegen 27 andere Modelle bewertet hat. Danach habe ich gelesen, was Leute sagen, die damit tatsächlich bauen.

Was ich nicht behaupten kann: Ich habe nicht tausend produktive Anrufe über eine echte Telefonleitung damit laufen lassen. Außerhalb von xAI hat das niemand, außer Starlink. Wenn dieser Beitrag also etwas über das Verhalten unter Last aussagt, stammt das aus einem veröffentlichten Grenzwert und nicht aus einer eigenen Praxiserfahrung, und ich werde jeweils sagen, um welches von beidem es sich handelt.

Ich baue bei eesel beruflich KI-Agenten, meist die Teile, die zwischen einem Modell und einem echten Kundengespräch sitzen. Das ist die Perspektive hier. Die Frage lautet nicht "wirkt das in einer Demo beeindruckend?". Sie lautet: "Was geht kaputt, wenn Dienstagnachmittag 40 Leute gleichzeitig anrufen?"

Die Bewertungstabelle

Hier das gesamte Urteil an einem Ort, bevor es ins Detail geht.

DimensionWertMeine Einschätzung
Gesprächsfluss95,1% Full Duplex BenchDie zentrale Verbesserung. 1.0 lag bei 77,8%. Unterbrechungen und Überlappungen sind nicht mehr die Schwachstelle.
Rohe Intelligenz82,9% AA-IndexPlatz zwei insgesamt, hinter Qwen mit 84,1%. Nah genug dran, um nicht ausschlaggebend zu sein.
Agentenhaftes Verhalten56,5% τ-voiceBestwert in der Tabelle, aber nur 1,9 Punkte vor Qwen mit 54,6%.
Latenz0,70s bis zum ersten AudioDritt-schnellster Wert. Schnell genug, dass es Anrufer nicht bemerken.
Transkription1,4-mal besser als 1.0Ein echter Fortschritt, und der Wert, den xAI am wenigsten in den Vordergrund stellt.
API-DesignProtokollkompatibel mit OpenAI RealtimeDer beste Teil des Produkts. Die Erweiterungen wirken, als hätte sie jemand geschrieben, der bereits einen Telefonagenten ausgeliefert hat.
Kostenvorhersehbarkeit4,80 $/h gemessen, 4,80 $/h ListenpreisFlache Abrechnung pro Minute. Selten, und mehr wert, als es klingt.
Skalierungsspielraum10 gleichzeitige SessionsDas Problem. Alles oben wird durch diese eine Zeile untergraben.
Deployment-OptionenNur us-east-1Keine EU-Region. Für viele Teams beendet das die Diskussion.

Urteil: Das Modell verdient eine klare Empfehlung, die Plattform verdient ein "prüf erst dein Volumen". Das sind zwei verschiedene Produkte, und Reviews bewerten meist nur das erste.

Wo es überzeugt

Vier Dinge sind aufgefallen, und nur eines davon ist die Zahl, mit der xAI den Launch überschrieben hat. Zusammengenommen beschreiben sie ein bestimmtes Modellprofil: nicht das intelligenteste verfügbare, sondern jenes, das scharf bleibt, während es schnell genug für eine Telefonleitung antwortet.

Unterbrechungen sind kein Verräter mehr

Die größte Veränderung gegenüber 1.0 ist Full Duplex Bench, das misst, wie ein Modell mit den unordentlichen Teilen eines echten Gesprächs umgeht: Reinreden, Überlappung, Zwischenlaute, jemand, der mitten im Satz die Meinung ändert. 1.0 erreichte 77,8%. 2.0 erreicht 95,1%.

Das ist der Wert, der einen Sprachagenten, den man erträgt, von einem unterscheidet, den man vergisst, dass es eine Maschine ist. Wer je Anrufaufzeichnungen gehört hat, kennt den typischen Fehler: Der Anrufer beginnt, sich zu korrigieren, der Bot redet einfach weiter, und der Anrufer wiederholt sich lauter oder verlangt einen Menschen. Das steht ziemlich weit oben in jeder Liste von Chatbot-Problemen, die Kunden aufgeben lassen, und die Übergabe-Muster in jedem ernsthaften Deployment existieren größtenteils, um genau diesen Moment abzufangen.

Fairerweise sei erwähnt: Das ist die einzige Zeile, in der Grok gegen OpenAI verliert. GPT-Realtime-2.1 High erreicht 95,7%. Ein Unterschied von 0,6 Punkten würde kein Anrufer je wahrnehmen, aber die Launch-Tabelle wird das auch nicht freiwillig erwähnen.

Der agentenhafte Wert ist die eigentliche Schlagzeile

τ-voice misst, ob ein Modell eine Aufgabe per Sprache wirklich abschließen kann, statt dabei nur gut zu klingen. Eine Bestellung nachschlagen, eine Richtlinie prüfen, dann eine Funktion aufrufen und mit der richtigen Antwort zurückkommen. Grok Voice Think Fast 2.0 erreicht hier 56,5%, den höchsten Wert in der gesamten Tabelle von Artificial Analysis.

Three ranking strips comparing Grok Voice Think Fast 2.0 against Qwen, GPT and Gemini on overall index, time to first audio, and agentic tau-voice score
Three ranking strips comparing Grok Voice Think Fast 2.0 against Qwen, GPT and Gemini on overall index, time to first audio, and agentic tau-voice score

Das zählt für jeden, der einen echten Agenten baut, mehr als der Gesamtindex, denn ein Sprachagent, der Tools nicht zuverlässig nutzen kann, ist ein sehr teurer FAQ-Vorleser. Es ist dieselbe Unterscheidung, die KI-Agenten von KI-Chatbots im Text trennt, und derselbe Grund, warum die nützlichen Beispiele für KI-Agenten immer diejenigen sind, die ein echtes System berühren, statt einen Artikel vorzulesen.

Die ehrliche Einschränkung: Qwen Audio 3.0 Realtime Plus liegt bei demselben Benchmark bei 54,6%. Groks Vorsprung beträgt also 1,9 Punkte, was nicht die Kluft ist, die die Darstellung suggeriert. Der Abstand zu OpenAIs Bestwert von 45,7% ist größer, und daher stammt die Formulierung "10 Punkte voraus", aber Qwen liegt direkt daneben.

Die Kombination aus Geschwindigkeit und Klugheit

0,70s bis zum ersten Audio, herunter von 1,25s bei 1.0. Deepslate Opal ist mit 0,44s schneller, und eine Gemini-Flash-Variante liegt bei 0,63s, sodass Grok auf Platz drei landet. Aber Qwen, das Modell, das es beim Gesamtindex schlägt, braucht 4,02s bis zum ersten Audio. Am Telefon ist das eine tote Pause, lang genug, dass der Anrufer "Hallo?" sagt.

Dieser Kompromiss ist das eigentliche Produkt. Jemand auf Hacker News hat es besser formuliert als der Launch-Beitrag selbst:

Hacker News

"Grok voice is the best voice AI voice assistant and it's not even close.

The speed + intelligence tradeoff is just right. While GPT voice is smug and unhumanlike despite trying hard to be human."

xAI gibt außerdem an, dass Reasoning-Token mit dem 0,4-fachen des P50-Werts des Vorgängers laufen, also schneller wurde, indem es klüger und nicht weniger nachdenklich wurde.

Transkription ist der unterschätzte Teil

Vergraben im Launch-Beitrag: Die Transkriptionsgenauigkeit ist 1,4-mal besser als bei 1.0, und 1,5- bis 2,0-mal besser als Deepgram Nova 3 und ElevenLabs Scribe v2 über 24 Sprachen hinweg. Bei verrauschtem oder Telefonie-Audio liegt der behauptete Abstand bei rund dem 10-Fachen.

Telefonie-Audio ist genau dort, wo Transkription normalerweise scheitert, und genau das ist die Art Audio, mit der eine Support-Leitung den ganzen Tag zu tun hat. Wer das gegen ElevenLabs oder einen dedizierten Speech-to-Text-Anbieter evaluiert, sollte diesem Wert für verrauschtes Audio mehr Gewicht geben als den Konversations-Benchmarks. Das ist auch die Achse, auf der der Transkriptions-Endpunkt von OpenAI meist eher aus Trägheit die Standardwahl war.

Aktuell gibt es 26 Stimmen im Repertoire, nachdem im Juli 2026 21 hinzugekommen sind, und jede davon lässt sich gegen eine geklonte Stimm-ID austauschen. Wer schon mal darum gekämpft hat, dass ein Bot über alle Kanäle hinweg wie das eigene Unternehmen klingt, weiß, dass das Problem der Markenstimme nicht verschwindet, nur weil die Ausgabe jetzt Audio ist.

Wo die Benchmark-Tabelle mehr verspricht, als sie hält

Drei Dinge, die die Launch-Darstellung nicht erzählt.

82,9% ist Platz zwei. Qwen Audio 3.0 Realtime Plus liegt bei 84,1%. Grok ist damit konkurrenzfähig und deutlich schneller, aber "State of the Art" leistet in der Marketingtext einige Überzeugungsarbeit. Wer sich zuletzt Qwens Modellfamilie oder Alibabas Preise angesehen hat, weiß, dass dort hart ausgeliefert wird.

Die beiden τ-voice-Werte von xAI nicht direkt vergleichen. Der Voice Agent Builder-Beitrag vom 1. Juli berichtet, dass Think Fast 1.0 in seinem eigenen τ-voice-Lauf 67,3% erreichte. Artificial Analysis bewertet dasselbe Modell mit 52,1%. Unterschiedliche Testrahmen, unterschiedliche Skalen. Wer diese beiden Zahlen in ein "Schau, wie sehr sich das verbessert hat"-Diagramm stapelt, vergleicht gar nichts. Dieselbe Vorsicht gilt für die Zahlen in Voice Agent Builder Preise, die immer noch die alte Rate zitieren.

Die Starlink-Zahlen gehören zu 1.0. Die viel zitierten 20% Verkaufskonversion und 70% autonome Lösungsrate von der Leitung +1 888 GO STARLINK mit 28 angebundenen Tools sind Think-Fast-1.0-Ergebnisse. Für 2.0 sagt xAI, A/B-Tests auf derselben Leitung hätten "einen deutlichen Anstieg" bei Konversion und Containment gezeigt, ohne eine Zahl zu veröffentlichen. Es ist außerdem ein hauseigenes Deployment innerhalb derselben Eigentümerstruktur, was es eher zum besten Fall als zu einem repräsentativen Beispiel macht.

Damit bauen: Die API ist der gute Teil

Ich hatte erwartet, dass die Dokumentation hier die Schwachstelle wäre, und es war genau umgekehrt. Vom Design her ist das die durchdachteste Realtime-Sprach-API, die ich gelesen habe.

A two-column checklist showing what carries over from OpenAI Realtime and which four event types you rewrite
A two-column checklist showing what carries over from OpenAI Realtime and which four event types you rewrite

Sie ist unter wss://api.x.ai/v1/realtime protokollkompatibel mit OpenAI Realtime, sodass die Migration bei einer bestehenden App nur eine Basis-URL und einen Schlüssel bedeutet. Man kann sogar das OpenAI-SDK behalten und es einfach auf https://api.x.ai/v1 zeigen lassen. Vier Dinge übertragen sich nicht: conversation.item.done, rate_limits.updated und die meisten output_audio_buffer.*-Events werden nicht ausgelöst, und ...input_audio_transcription.delta wird in .updated umbenannt und kumulativ, was die Transkriptanzeige stillschweigend zerstört, wenn man Deltas bisher aneinandergehängt hat.

Die xAI-eigenen Erweiterungen sind, wo es interessant wird, und sie lesen sich, als hätten sie Leute geschrieben, die schon einmal einen Telefonagenten ausgeliefert haben und dabei auf die Nase gefallen sind:

  • force_message spricht eine fest hinterlegte Zeile per TTS, ganz ohne das Modell einzubeziehen. Mit interruptible: false wird das Audio des Anrufers verworfen, bis der Satz zu Ende ist. Das löst das Problem der Compliance-Offenlegung ordentlich, statt darauf zu hoffen, dass der System-Prompt hält.
  • replace ist eine Aussprachetabelle, die vor dem TTS angewendet wird, sodass das Audio "Acme Mobull" sagt, während das Transkript weiter "Acme Mobile" liest. Der Abgleich ist unabhängig von Groß-/Kleinschreibung, respektiert vollständige Wortgrenzen, und der längste Treffer gewinnt.
  • resumption speichert Turns pro conversation_id zwischen und spielt sie bei einer erneuten Verbindung ab. Standardmäßig deaktiviert, beide Seiten müssen zustimmen, und der Verlauf verfällt nach 30 Minuten Inaktivität.
  • keyterms lenkt die Transkription auf bis zu 100 Fachbegriffe mit je 50 Zeichen, aktualisierbar mitten in der Session. Für eine Support-Leitung voller SKUs und Tarifnamen ist das der Unterschied zwischen einem brauchbaren Transkript und einem Durcheinander.
  • idle_timeout_ms wird nach jeder Antwort neu scharfgeschaltet, sodass der Agent einen stillen Anrufer wiederholt erneut ansprechen kann, statt einfach dazusitzen.

Der Parameter reasoning.effort akzeptiert genau zwei Werte: "high" (die Voreinstellung) und "none". Eine mittlere Einstellung gibt es nicht, was eine echte Lücke ist. Genau das hat jemand auf Hacker News zu einem früheren Grok-Voice-Release angesprochen:

Hacker News

"Grok voice model is also a thinking model. I agree that it's far better than the other voice models

Just give me a option to have a slower response but better model…"

Noch etwas, das die Dokumentation richtig macht und das die meisten Anbieter einen erst in Produktion entdecken lassen: Sie sagen ausdrücklich, man solle nach einem Tool-Aufruf warten, bis die Audiowiedergabe fertig ist, bevor man response.create sendet, weil der Server alle Audio-Deltas liefert, bevor die Funktionsaufruf-Events kommen. Wer das überspringt, bekommt überlappende Sprache. Sie schlagen sogar vor, während dieser Lücke einen "denkt nach"-Indikator anzuzeigen. Das ist ein hart erarbeitetes Detail, das aufgeschrieben wurde.

Der Rat des Migrationsleitfadens selbst lautet, den System-Prompt kürzer zu machen, nicht länger, was einiges darüber aussagt, wie das Modell abgestimmt wurde.

Die drei Grenzen, die den Rollout tatsächlich stoppen werden

Wäre ich derjenige, der das bewertet, wäre das der Abschnitt, den ich zuerst lese.

A funnel diagram showing inbound calls narrowing through a gate labelled 10 concurrent sessions per team, with the rest queued
A funnel diagram showing inbound calls narrowing through a gate labelled 10 concurrent sessions per team, with the rest queued

10 gleichzeitige Sessions pro Team. Das ist der veröffentlichte Standardwert auf der Modellkarte, auf Anfrage erhöhbar. Zehn gleichzeitige Anrufe sind für ein kleines Support-Team schon ein normaler Montagmorgen. Jeder Benchmark oben ist irrelevant, wenn Anruf elf nicht durchkommt, und "auf Anfrage erhöhbar" ist ein Verkaufsgespräch, kein Konfigurationsschalter. Wer einen KI-Callcenter-Agenten dimensioniert, sollte das als erste Frage behandeln, nicht als Fußnote.

Zum Vergleich: Fertige Sprachprodukte, die auf einem Helpdesk aufbauen, veröffentlichen meist überhaupt keine Session-Obergrenze, weil Nebenläufigkeit das Problem des Anbieters ist und nicht das eigene. Das gilt für Zendesks KI-Sprachagenten, für Freshcallers Einrichtung und für Salesforces Sprachagenten. Man tauscht Flexibilität dagegen ein, dass jemand anders die Kapazitätsplanung übernimmt.

Nur us-east-1. Eine einzige Region, keine EU-Option. Wer Vorgaben zur Datenresidenz hat, dem entscheidet das die Sache, bevor überhaupt irgendetwas anderes bewertet wird.

Keine Prioritätsstufe und kein Batch-Rabatt. Die 2-fache Prioritätsstufe gilt nur für Chat Completions und Responses. Der 20%-Batch-Rabatt gilt nur für Textmodelle. Sprache bekommt weder eine Überholspur noch einen Mengenrabatt, sodass die angezeigte Rate bei jeder Größenordnung die tatsächlich gezahlte Rate ist. Es gibt außerdem eine maximale Sessiondauer von 120 Minuten, großzügig für Support und eher knapp für alles, was einer überwachten Leitung ähnelt.

Noch zwei kleinere Dinge, die man kennen sollte. Speicher wird separat abgerechnet, falls der Agent Retrieval nutzt: Collections kosten 0,10 $/GiB/Tag, Dateien 0,025 $, Downloads 0,20 $/GiB. Und es gibt eine Gebühr von 0,05 $ bei einem Verstoß gegen die Nutzungsrichtlinien für jede Responses-Anfrage, die vor der Generierung blockiert wird.

Auf 2.0 wechseln oder bei 1.0 bleiben?

Der Alias-Wechsel am 5. August bedeutet, dass Nichtstun selbst schon eine Entscheidung ist. Wähle die Zeile, die auf dich zutrifft.

Was betreibst du gerade?

Wähle eine Option. Das Urteil ändert sich stark, je nachdem, welche davon auf dich zutrifft.

Nimm 2.0 und denk nicht weiter drüber nach

Bei Demo-Volumen ist der Preisanstieg von 60% ein Rundungsfehler, und der Sprung bei Full Duplex von 77,8% auf 95,1% ist der Unterschied zwischen einer Demo, die überzeugt, und einer, die es nicht tut. Lass dich vom Alias-Wechsel einfach mittragen.

Nimm 2.0, aber plane den Wechsel ein

Die Kosten pro Minute steigen am 5. August ohne eigenes Zutun von 0,05 $ auf 0,08 $. Bei 2.000 Minuten im Monat sind das 100 $ statt 160 $ mehr. Die Verbesserung im Gesprächsfluss ist es wert, aber lege die Zahl vorher demjenigen vor, der freigibt, bevor es die Rechnung für dich erledigt.

Erst die Session-Obergrenze klären, dann das Modell

10 gleichzeitige Sessions pro Team ist der veröffentlichte Standardwert, und ihn zu erhöhen ist ein Gespräch mit xAI, keine Konfigurationsänderung. Hol dir diese Zahl schriftlich zugesichert, bevor du irgendetwas benchmarkst. Ein Full-Duplex-Wert von 95,1% bringt Anruf elf nichts.

Das ist noch nicht dein Modell

Speech-to-Speech läuft ausschließlich in us-east-1, ohne veröffentlichte EU-Region. Kein Wert in diesem Beitrag ändert das. Bewerte es neu, sobald xAI eine zweite Region veröffentlicht.

Was Leute, die damit bauen, tatsächlich sagen

X ist der natürliche Ort für Reaktionen auf xAI, ist aber gerade schwer in der Tiefe zu lesen, sodass das brauchbare Signal auf Hacker News liegt. Zwei Threads tragen den größten Teil davon.

Der meistgevotete Kommentar im Think-Fast-2.0-Thread ist im Grunde eine Beschwerde darüber, wie wenig Beachtung der Launch bekommen hat:

Hacker News

"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"

Das ist bei der Fähigkeit eine faire Einschätzung, und es lohnt sich zu erwähnen, dass sich inzwischen auch die Preise angeglichen haben. Jeder bezahlte ElevenLabs-Agents-Tarif kommt auf fast genau 0,08 $ pro enthaltener Minute, was Groks neuer Rate auf den Cent genau entspricht. Bis zum 5. August unterbot Grok das um 37,5%.

Die abgewogenere Einschätzung von einigen Monaten zuvor hält sich gut:

Hacker News

"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."

Ungefähr dort lande ich auch. Ein Sprachmodell ist immer ein Kompromiss gegenüber einem Textmodell, das sich zehn Sekunden Zeit zum Nachdenken nehmen darf, und Grok macht diesen Kompromiss besser als der Rest des Feldes. Lies die Reviews aus Verbrauchersicht, und du wirst dasselbe Urteil weniger vorsichtig formuliert finden.

Die wiederkehrende Frustration in diesen Threads betrifft Tool-Nutzung im Sprachmodus, und es lohnt sich, das klarzustellen, weil es in beide Richtungen wirkt:

Hacker News

"What I'm missing from this announcement is the capability to use connectors and tools. I don't really get it - NONE of the frontier assistants can use tools / connectors while in voice mode"

Das bezieht sich auf Sprachassistenten für Verbraucher, und auf der API-Seite stimmt das für Grok nicht: Sessions unterstützen function, file_search, web_search, x_search und Remote-mcp-Tools, wobei die serverseitigen für einen ausgeführt werden. Server-Tools werden pro Aufruf abgerechnet, mit 5 $ pro 1.000 für Web- und X-Suche, 2,50 $ pro 1.000 für Collections und 10 $ pro 1.000 für die Suche in Anhängen. Die Lücke, die der Kommentar beschreibt, ist in der Verbraucher-Grok-App real, nicht in dem, was man selbst bauen würde. Es ist dieselbe Trennung, die sich durch den Sprach-Rollout von ChatGPT zieht: Die API ist der App schon eine Weile voraus.

Wer sollte zugreifen, und wer sollte warten

Zugreifen sollten alle, die einen Telefon- oder Sprachagenten bauen, der Dinge tun muss, nicht nur reden. Der τ-voice-Wert, die Tool-Unterstützung, die Erweiterungen force_message und keyterms, und der flache Minutenzähler summieren sich zum aktuell entwicklerfreundlichsten Sprach-Stack am Markt. Der Umstieg von OpenAIs Realtime-Audio ist so gut wie kostenlos.

Zugreifen sollten alle, denen Kostenvorhersehbarkeit für die Finanzabteilung wichtig ist. Artificial Analysis misst Groks tatsächliche Kosten mit 4,80 $ pro Stunde Eingabeaudio, identisch zum Listenpreis, weil der Zähler flach pro Minute läuft. GPT-Realtime-2 listet 1,15 $/h für die Eingabe, misst aber 4,14 $ inklusive allem. Sprachrechnungen, die zum aufgedruckten Preis passen, sind seltener, als sie sein sollten, was mit ein Grund ist, warum die Frage nach Agent- gegenüber Mensch-Kosten so schwer ehrlich zu beantworten ist.

Zugreifen sollten alle, die die Orchestrierung selbst bauen wollen. Wer lieber Kästchen herumzieht, findet in Voiceflows Preisen und den Alternativen zum Voice Agent Builder das No-Code-Ende desselben Markts.

Warten sollten alle, deren Volumen über zehn gleichzeitige Anrufe hinausgeht und die noch kein schriftlich erhöhtes Limit haben. Warten sollten alle, die eine EU-Region brauchen. Warten sollten alle, die sich auf die 0,05-$-Rate verlassen haben und nicht bemerkt hatten, dass sich der Alias unter ihnen verschiebt — in dem Fall heute noch grok-voice-think-fast-1.0 fixieren und nach eigenem Zeitplan entscheiden.

Nicht als Support-Lösung kaufen. Das ist ein Modell und eine API, kein Helpdesk-Agent. Es hat keine Ahnung von der Ticket-Historie, den Makros, den Eskalationsregeln oder davon, welche Fragen das Team bereits entschieden hat, dass die KI nicht anfassen soll. Alles oben dreht sich um die Sprachebene, und die Sprachebene macht vielleicht 20% dessen aus, was eine Support-Automatisierung wirklich funktionieren lässt. Der Rest ist der langweilige Teil: das eigene Produkt kennen, wissen, wann man aufhört, und sauber übergeben.

Eine CX-Leiterin bei einer DTC-Nahrungsergänzungsmarke hat diese Einschränkung besser auf den Punkt gebracht als jedes Datenblatt:

"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Kein Sprach-Benchmark misst das. Das ist eine Grundsatzfrage, und sie entscheidet, ob ein Rollout den ersten Monat übersteht.

Sprache ist die laute Hälfte einer Support-Queue

Die meisten Tickets, die zu Telefonanrufen werden, wären eine Stunde vorher schon per Text beantwortbar gewesen. Automatisierung der Erstantwort und ein Wissensdatenbank-Chatbot, den die KI tatsächlich lesen kann, verhindern mehr Anrufe als jedes Sprachmodell. Das ist es, was man reparieren sollte, bevor man eines einkauft.

eesel ist ein KI-Agent, der sich in den bereits genutzten Helpdesk einklinkt, mit vergangenen Tickets und dem Helpcenter trainiert statt mit einem handgeschriebenen System-Prompt, und der es erlaubt, das Ganze gegen die echte Ticket-Historie zu simulieren, bevor ein einziger Kunde damit in Berührung kommt. Dieser letzte Teil ist bewusst so gestaltet. Ich habe jahrelang gesehen, wie selbstsicher klingende Bots falsche Antworten geben, und ein Trockenlauf über bereits gelöste Tickets ist der einzige ehrliche Weg herauszufinden, was der eigene Bot tun wird. Es ist auch der Schritt, der einen echten KI-Agenten von einem regelbasierten Bot trennt, sobald die vorgegebenen Pfade zu Ende sind.

Es ist dieselbe Build-versus-Buy-Entscheidung, bei der viele Teams landen, nachdem sie eine Doku-Seite wie die von xAI gelesen und verstanden haben, wie viel davon sie selbst warten müssten:

"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."

Karel, GENERAL BYTES

Wer sich auch für die Sprachebene interessiert, kann mit Groks Voice Agent Builder und dem breiteren Feld der KI-Sprachanbieter weiterlesen. Wer erst die Queue dahinter in den Griff bekommen will: eesel ist kostenlos zum Ausprobieren und lässt sich in wenigen Minuten mit dem Helpdesk verbinden. Teams, die Gorgias oder Zendesk nutzen, haben es meist noch am selben Nachmittag echte Tickets beantworten lassen.

Drei Dinge, die sich als Nächstes zu lesen lohnen, je nachdem, wo man gerade hängt:

Häufig gestellte Fragen

Ist Grok Voice Think Fast 2.0 gut genug für produktive Sprachagenten?
Was das Modell selbst angeht: ja. Es erreicht 82,9% im Speech-to-Speech-Index von Artificial Analysis und 56,5% im agentenhaften τ-voice-Benchmark, den höchsten Agentic-Wert in dieser Tabelle. Der Engpass ist die Plattform drumherum: standardmäßig 10 gleichzeitige Sessions pro Team und nur eine einzige Region, us-east-1. Die vollständige Funktionsweise steht im Grok Voice Think Fast 2.0 Überblick, und was ein produktiver Einsatz üblicherweise braucht, in KI-Callcenter-Agenten.
Was ist neu an Grok Voice Think Fast 2.0 im Vergleich zu 1.0?
Full Duplex Bench stieg von 77,8% auf 95,1%, die Zeit bis zum ersten Audio sank von 1,25s auf 0,70s, und der Gesamtindex kletterte von 75,7% auf 82,9%. Die Transkriptionsgenauigkeit ist 1,4-mal besser als bei 1.0. Der Haken ist der Preis: Die Rate stieg von 0,05 $ auf 0,08 $ pro Minute, was der Grok Voice Preisüberblick in konkreten Zahlen durchrechnet.
Wie viel kostet Grok Voice Think Fast 2.0 pro Minute?
0,08 $ pro Minute Audio, beziehungsweise 4,80 $ pro Stunde, plus 0,004 $ pro Text-Eingabenachricht. Das ist ein Anstieg von 60% gegenüber der 1.0-Rate, und er greift automatisch, sobald man den Alias grok-voice-latest aufruft. Vergleiche das mit den ElevenLabs-Preisen und dem breiteren Feld der KI-Sprachanbieter, bevor du dich festlegst.
Kann ich eine OpenAI-Realtime-App zu Grok Voice migrieren?
Größtenteils ja. Der Endpunkt ist unter wss://api.x.ai/v1/realtime auf Protokollebene kompatibel mit OpenAI Realtime, sodass der Austausch von Basis-URL und Schlüssel den Großteil abdeckt. Vier Event-Typen verhalten sich anders, das listet der Migrationsabschnitt weiter unten auf. Wer gegen die OpenAI-Audio-API gebaut hat, sollte einen Nachmittag statt eines Sprints einplanen.
Ist Grok Voice Think Fast 2.0 besser als ElevenLabs für Support-Anrufe?
Sie kosten inzwischen dasselbe pro Minute, also entscheidet die Form. Grok ist Pay-as-you-go und erledigt Reasoning und Tool-Aufrufe in einem einzigen Modell; ElevenLabs verkauft vorausbezahlte Minutenpakete. Für eine Support-Queue speziell ist keines von beiden ein Helpdesk, weshalb Teams eine Sprachebene mit etwas wie einem KI-Helpdesk-Agenten kombinieren, der die Ticket-Historie bereits kennt.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Illustration of the Buzz app: chat channels where people and AI agents collaborate, with a honeycomb motif
AI

Was ist Buzz? Jack Dorseys KI-Agenten-Workspace erklärt

Buzz ist Jack Dorseys neue Open-Source-Team-Chat-App, in der Menschen und KI-Agenten dieselben Kanäle teilen. Was die App ist, für wen sie gedacht ist und wo der Haken liegt.

Alicia Kirana UtomoAlicia Kirana UtomoJul 23, 2026
Illustration einer No-Code-KI-Agenten-Builder-Canvas mit Workflow-Nodes
AI

Die 7 besten No-Code-KI-Agenten-Builder 2026

Ich habe die wichtigsten No-Code-KI-Agenten-Builder für Support-Teams 2026 getestet, von Botpress bis Copilot Studio, und bewertet, welcher wirklich zu deinem Setup passt.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 11, 2026
Illustration einer verzweigten KI-Leinwand, die Bilder, Folien und Text erzeugt
AI

Flowith im Test: Lohnt sich die KI-Agenten-Leinwand? (2026)

Ein praktischer Flowith-Test: was die verzweigte KI-Leinwand und Agent Neo wirklich können, was Flowith an Credits kostet und wer besser die Finger davon lässt.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Editorial-Illustration für einen Test von Gemini 3.6 Flash, Googles schnellem Arbeitspferd-KI-Modell
AI

Gemini 3.6 Flash im Test: Googles günstigeres, schnelleres Arbeitspferd

Ein praxisnaher Gemini 3.6 Flash Test: der neue Preis, die 17% weniger Tokens, wo es GPT-5.6 und Claude Sonnet 5 schlägt, und wo es noch hinterherhinkt.

Rama Adi NugrahaRama Adi NugrahaJul 22, 2026
Illustriertes Hero-Banner für eine Aufschlüsselung der Flowith-Preise mit Abo-Stufen und einem kreditbasierten Abrechnungsmodell
AI

Flowith-Preise (2026): Pläne, Credits und die tatsächlichen Kosten

Eine vollständige Aufschlüsselung der Flowith-Preise: die vier kreditbasierten Stufen, was ein Credit wirklich kauft, die Fallstricke, die auf der Preisseite nicht auftauchen, und für wen sich welcher Plan eignet.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustriertes Hero-Banner für einen Leitfaden zu Flowith, dem KI-Agenten-Kreativworkspace auf Basis einer unendlichen Node-Canvas
AI

Was ist Flowith? Die KI-Agenten-Canvas, Agent Neo und die Preise

Flowith ist ein KI-Agent, der auf einer unendlichen Canvas statt in einer Chatbox arbeitet. Hier erfährst du, was Agent Neo wirklich kann, was es kostet und wofür es geeignet ist.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Illustration für eine Übersicht der besten Alternativen zu Google Gemini 3.6 Flash im Jahr 2026
AI

Die 6 besten Alternativen zu Gemini 3.6 Flash im Jahr 2026

Die besten Alternativen zu Gemini 3.6 Flash im Jahr 2026, mit echten Preisen und Benchmarks: GPT-5.6 Luna, Claude Sonnet 5, Grok 4.5, Flash-Lite und mehr.

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Redaktionelle Hero-Illustration zu Metas Muse Image, einem agentischen KI-Bildgenerierungsmodell, in Meta-Blau
AI

Metas Muse Image: was es kann und wie gut es wirklich ist

Metas Muse Image ist ein kostenloses, agentisches Bildmodell, das im Web recherchiert und mitten in der Generierung Code schreibt. Hier erfährst du, was es kann und wie gut es wirklich ist.

Alicia Kirana UtomoAlicia Kirana UtomoJul 9, 2026
Illustration einer Kimi K3 Modell-Kachel neben einer Reihe von Preisstufen-Karten, in Kimi-Blau
AI

Kimi K3 Preise: Was Moonshots Frontier-Modell wirklich kostet

Kimi K3 Preise entschlüsselt: die 3-/15-Dollar-API-Rate, die 19-199-Dollar-App-Stufen, wie der 90%-Cache-Rabatt die Rechnung verändert, und wie das Modell im Vergleich zu Claude, GPT und DeepSeek abschneidet.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 17, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten