Grok Voice Think Fast 2.0: was sich ändert und was es kostet

Rama Adi Nugraha
Geschrieben von

Rama Adi Nugraha

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet August 4, 2026

Expertengeprüft
Strichzeichnung eines Support-Mitarbeiters mit Headset neben dem Grok-Logo, mit einer Sprachwellenform in einer Sprechblase

Was ich mit "Sprachmodell" tatsächlich meine

Ich verbringe seit ein paar Jahren meine Zeit damit, eesel in Helpdesks zu integrieren, und habe dabei viele Anbieterseiten über KI gelesen, die Kunden antwortet. Sprache ist die eine Kategorie, in der die Architektur-Behauptung real und überprüfbar ist, deshalb lohnt es sich, dabei genau zu sein.

Die meisten Sprach-Stacks sind drei Produkte im Trenchcoat: Sprache zu Text, ein Sprachmodell, dann Text zu Sprache, oft von drei verschiedenen Anbietern. Jeder Übergang bringt Latenz, Kosten und noch eine Sache, die um 2 Uhr nachts ausfallen kann. xAIs eigene Darstellung beim Launch des Voice Agent Builder war, dass genau das zusammengelegt werden sollte, und Think Fast 2.0 ist das Modell, das diese Zusammenlegung vornimmt.

Vergleich einer zusammengesetzten Pipeline aus Sprache-zu-Text, LLM und Text-zu-Sprache gegenüber einem einzigen Speech-to-Speech-Modellpfad
Vergleich einer zusammengesetzten Pipeline aus Sprache-zu-Text, LLM und Text-zu-Sprache gegenüber einem einzigen Speech-to-Speech-Modellpfad

Think-Fast-Modelle tun etwas Bestimmtes, das ich vorher noch nicht produktreif gesehen hatte: Sie denken, während sie schon sprechen. xAI beschreibt das als Denken parallel zum Sprechen, sodass das Nachdenken nicht vor der ersten Silbe steht. In der Praxis feuert ein Tool-Aufruf meist schon, bevor der Agent seinen ersten Satz beendet hat. Das ist der ganze Trick hinter den 0,70 Sekunden, und es erklärt, warum das Modell gleichzeitig schnell und ungewöhnlich gut bei mehrstufigen Aufgaben sein kann, was sich normalerweise gegenseitig ausschließt.

Think Fast 2.0 hat außerdem die Reasoning-Tokens stark reduziert. Laut xAI verbraucht die mediane Antwort das 0,4-Fache der Reasoning-Tokens von Think Fast 1.0, eine Änderung, die man eher bei einem langen Anruf spürt als in einer Demo.

Die Benchmark-Tabelle und die zwei Zeilen, die man leicht übersieht

Hier ist, was xAI am Launch-Tag veröffentlicht hat, mit Quelle Artificial Analysis.

BenchmarkThink Fast 2.0Think Fast 1.0GPT-Realtime-2.1 (High)Gemini 3.1 Flash (High)
AA Speech-to-Speech Quality Index82,9%75,7%79,1%69,5%
Sprach-Reasoning (Big Bench Audio)97,2%97,1%96,0%96,6%
Gesprächsdynamik (Full Duplex Bench)95,1%77,8%95,7%74,3%
Agentische Leistung (τ-voice Bench)56,5%52,1%45,7%37,7%
Zeit bis zum ersten Ton0,70s1,25s1,21s2,98s

Ein paar Dinge würde ich ansprechen, wenn du das über meine Schulter mitlesen würdest.

Erstens: Die für Support wichtigste Zeile ist τ-voice Bench mit 56,5%, und Grok gewinnt sie mit fast 11 Punkten Vorsprung vor dem besten OpenAI-Wert. τ-voice misst Agenten unter realistischen Anrufbedingungen: Lärm, Akzente, Unterbrechungen, Anrufer, die mitten im Satz ihre Meinung ändern. Es ist der bislang naheliegendste veröffentlichte Anhaltspunkt dafür, ob "das Ding einen echten Workflow auf einer echten Telefonleitung ausführen kann". Eine Obergrenze von 56,5% bedeutet aber auch, dass etwa zwei von fünf dieser schwierigen Szenarien immer noch fehlschlagen, eine Zahl, die ich jedem entgegenhalten würde, der volle Automatisierung verspricht.

Zweitens: Die Zeile zur Gesprächsdynamik ist diejenige, die xAI nicht gewinnt. GPT-Realtime-2.1 High liegt mit 95,7% zu 95,1% knapp vorn, und Groks Sprung kommt von 77,8%, war also klar der Fokus dieses Releases. Fairerweise: Das ist ein Zugewinn von 17 Punkten.

Nun zu dem Kontext, den xAIs eigene Tabelle auslässt. Öffnet man das vollständige Artificial-Analysis-Leaderboard, liegt Think Fast 2.0 insgesamt auf Platz zwei, nicht eins. Alibabas Qwen Audio 3.0 Realtime Plus liegt bei 84,1%. Es braucht dafür aber 4,02 Sekunden, um zu sprechen zu beginnen, gegenüber 0,70, was auf einer Telefonleitung den Unterschied zwischen einem Gespräch und toter Luft ausmacht. Ähnlich bei der Latenz: Deepslate Opal antwortet in 0,44s und Gemini 2.5 Flash Native Audio Dialog in 0,63s, beide schneller als Grok, und beide im Index deutlich dahinter. Groks Anspruch ist die Kombination, und bei dieser Kombination ist es das Beste auf dieser Seite.

Der Alias-Wechsel am 5. August, in Dollar

Das ist der Teil, den ich mir tatsächlich in den Kalender eintragen würde.

Verzweigungsdiagramm, das zeigt, wie sich grok-voice-latest zwischen Think Fast 2.0 zu 0,08 $ pro Minute und einem fixierten Think Fast 1.0 zu 0,05 $ pro Minute aufteilt
Verzweigungsdiagramm, das zeigt, wie sich grok-voice-latest zwischen Think Fast 2.0 zu 0,08 $ pro Minute und einem fixierten Think Fast 1.0 zu 0,05 $ pro Minute aufteilt

Laut der xAI-Preisseite sieht die Preistabelle für Sprache so aus:

Modell oder ModusRate
Speech to speech, grok-voice-think-fast-1.00,05 $ / Min. (3,00 $ / Std.) Audio, 0,004 $ / Texteingabe
Speech to speech, grok-voice-think-fast-2.00,08 $ / Min. (4,80 $ / Std.) Audio, 0,004 $ / Texteingabe
Speech to text0,10 $ / Std. (REST), 0,20 $ / Std. (Streaming)
Text to speech15,00 $ / 1 Mio. Zeichen

xAIs Haltung zur Migration ist, dass für das Upgrade keine Aktion nötig ist, und dass man grok-voice-think-fast-1.0 vor dem 5. August fixieren muss, um bei 1.0 zu bleiben. Beide Aussagen stimmen. Was nicht laut ausgesprochen wird: Der Standardpfad ist der teure, und eine Erhöhung um 60% pro Minute trifft dich, ohne dass du selbst etwas deployst. Wer nennenswertes Volumen fährt, sollte ausrechnen, was das kostet, bevor es eintrifft, nicht danach.

Zwei weitere Zähler laufen mit. Eine bereitgestellte Telefonnummer im Voice Agent Builder kostet zusätzlich 0,01 $ pro Minute. Serverseitige Tools werden pro Aufruf abgerechnet: Websuche und X-Suche zu 5 $ pro 1.000 Aufrufe, Dokumentensammlungssuche zu 2,50 $ pro 1.000, Dateianhang-Suche zu 10 $ pro 1.000. Ein Support-Agent, der bei fast jedem Anruf etwas nachschlägt, kauft diese im Tausenderpack, also gehört das in die Modellrechnung.

Migrationsrechnung

Was der 5. August dich kostet

Wähle deine monatliche Gesprächszeit. Die Raten entsprechen xAIs veröffentlichten Sprachpreisen zuzüglich 0,01 $/Min. für eine bereitgestellte Nummer.

Grob, bei einem durchschnittlichen 4-Minuten-Anruf500 Anrufe / Monat
Fixiert auf 1.0$120$100 Sprache + $20 Telefonie
Automatisch zu 2.0$180$160 Sprache + $20 Telefonie
Differenz: +$60 / Monat (+$720 im Jahr)
Grob, bei einem durchschnittlichen 4-Minuten-Anruf2.500 Anrufe / Monat
Fixiert auf 1.0$600$500 Sprache + $100 Telefonie
Automatisch zu 2.0$900$800 Sprache + $100 Telefonie
Differenz: +$300 / Monat (+$3.600 im Jahr)
Grob, bei einem durchschnittlichen 4-Minuten-Anruf12.500 Anrufe / Monat
Fixiert auf 1.0$3.000$2.500 Sprache + $500 Telefonie
Automatisch zu 2.0$4.500$4.000 Sprache + $500 Telefonie
Differenz: +$1.500 / Monat (+$18.000 im Jahr)
Grob, bei einem durchschnittlichen 4-Minuten-Anruf50.000 Anrufe / Monat
Fixiert auf 1.0$12.000$10.000 Sprache + $2.000 Telefonie
Automatisch zu 2.0$18.000$16.000 Sprache + $2.000 Telefonie
Differenz: +$6.000 / Monat (+$72.000 im Jahr)
Ohne serverseitige Tool-Aufrufe, die separat ab 2,50 $ pro 1.000 Aufrufe berechnet werden.

Eine Einschränkung beim Vergleich mit anderen: xAI veröffentlicht einen festen Minutenpreis, während OpenAI und Google pro Audio-Token abrechnen. Artificial Analysis normiert das als Kosten pro Stunde Eingangsaudio, und auf dieser Basis liegt Think Fast 2.0 bei 4,80 $, GPT-Realtime-2.1 High bei 10,75 $ und Gemini 3.1 Flash High bei 1,75 $. Die Grok-Zahl entspricht genau dem 60-Fachen der veröffentlichten Minutenrate, also ist es eine echte Preistabelle. Die anderen beiden sind Messwerte aus einem einzigen Benchmark-Durchlauf und ändern sich danach, wie gesprächig der jeweilige Agent ist. Wer zwischen ihnen wählt, sollte lieber die Preise der OpenAI Realtime API genau lesen, statt sich auf eine einzelne normierte Spalte zu verlassen.

Transkription ist das leise Upgrade

Die Benchmark-Tabelle bekommt die Aufmerksamkeit, aber ich halte die Arbeit an der Transkription für die nützlichere Änderung, wenn man das auf eine Telefonleitung legt.

xAI hat Tausende kurze Sätze in 24 Sprachen ausgewertet und berichtet, dass Think Fast 2.0 dedizierte Transkriptionsmodelle schlägt: 1,5- bis 2,0-fach bessere Wortfehlerrate als Deepgram Nova 3 und ElevenLabs Scribe v2, und 1,4-fach besser als Think Fast 1.0. Die Behauptung, die mich mehr interessiert, ist die zum Lärm, wo die Lücke zu dedizierter Sprache-zu-Text-Erkennung unter Hintergrundgeräuschen und Telefonie-Komprimierung angeblich auf etwa das 10-Fache wächst.

Das ist die tatsächliche Bedingung von Support-Anrufen. Niemand ruft aus einer Aufnahmekabine beim Support an. Sie rufen aus dem Auto an, aus einem Lager, aus einer Küche mit einem Kind im Hintergrund. Wer schon einmal gesehen hat, wie eine Transkription aus "meine Bestellung stornieren" etwas völlig anderes macht, weiß: Ein falsches Wort ist ein komplett falscher Workflow. Wer mehrsprachigen Support betreibt, sollte sich das Diagramm pro Sprache in der Ankündigung ansehen statt den Durchschnitt, denn die Streuung über diese 24 Sprachen ist groß.

Zwei Session-Parameter sind speziell dafür da, verbleibende Lücken zu schließen, und sie sind es wert, von Anfang an bekannt zu sein. audio.input.transcription.keyterms lenkt die Transkription auf bis zu 100 Begriffe mit je 50 Zeichen, dorthin gehören SKU-Namen und Plannamen. replace ordnet einer Phrase vor der Text-zu-Sprache-Umsetzung eine gesprochene Ersetzung zu, sodass das Audio den Markennamen korrekt ausspricht, während die Transkription die ursprüngliche Schreibweise beibehält. Das Beispiel in der Dokumentation ordnet "Acme Mobile" der Aussprache "Acme Mobull" zu, was ziemlich genau zeigt, wie unglamourös und zugleich notwendig diese Funktion ist.

Was der Aufbau darauf tatsächlich bedeutet

Ich habe die Speech-to-Speech-Dokumentation so gelesen, wie ich jede API lese, die ich vielleicht später unterstützen muss, also auf der Suche nach den Stellen, die später Probleme machen. Ein paar Notizen aus diesem Durchgang.

Die API ist drahtkompatibel mit OpenAIs Realtime API. Man richtet den WebSocket auf wss://api.x.ai/v1/realtime aus, tauscht den Schlüssel, und der Großteil des bestehenden Client-Codes läuft. Das ist eine bewusst niedrig gehaltene Wechselhürde und das stärkste kommerzielle Argument, das xAI hier hat. Perfekt kompatibel ist es nicht: conversation.item.done, rate_limits.updated und einige output_audio_buffer.*-Ereignisse werden nicht ausgelöst, und conversation.item.input_audio_transcription.delta wird in .updated umbenannt, mit kumulativen statt inkrementellen Payloads. Wer darauf etwas aufgebaut hat, hat entsprechende Portierungsarbeit vor sich. Auch die Unterschiede bei Tool-Aufrufen lohnen sich zu lesen.

Es gibt fünf Tool-Typen: function für eigene APIs, file_search über hochgeladene Dokumentensammlungen, web_search, x_search sowie entfernte mcp-Server. Die MCP-Unterstützung würde ich nutzen, denn sie macht bestehende interne Tools erreichbar, ohne einen sprachspezifischen Shim schreiben zu müssen.

Das Reasoning läuft standardmäßig mit Aufwandsstufe high. Mit reasoning.effort auf "none" lässt es sich abschalten. Erwähnenswert, weil eine echte Beschwerde auf Hacker News zur Vorgängergeneration genau das Gegenteil forderte:

Hacker News

"Grok voice model is also a thinking model. I agree that it's far better than the other voice models Just give me a option to have a slower response but better model…"

Drei xAI-spezifische Erweiterungen würde ich jedem ans Herz legen, der eine Support-Leitung baut:

  • force_message spricht eine fest codierte, per TTS synthetisierte Zeile, ohne das Modell einzubeziehen, mit einem interruptible-Flag. So liefert man "dieses Gespräch wird aufgezeichnet" wortgetreu, jedes Mal, was eine Compliance-Anforderung ist, kein nettes Extra.
  • resumption speichert Gesprächsrunden gegen eine conversation_id zwischen und spielt sie beim Wiederverbinden ab. Standardmäßig deaktiviert. Ohne diese Funktion geht bei einem abgebrochenen WebSocket das Gespräch verloren, und mobile Anrufer verlieren die Verbindung ständig.
  • idle_timeout_ms lässt den Server einen schweigenden Anrufer über einen Timer erneut ansprechen, der sich nach jeder Antwort neu aktiviert. Das ist der Unterschied zwischen einem geduldigen Agenten und einer unangenehmen Stille.

Der Migrationsrat aus der Dokumentation ist das Gegenteil dessen, was man erwarten würde: System-Prompt kürzer machen, nicht länger. xAIs Empfehlung lautet, Grok zu bitten, den bestehenden Prompt zu verallgemeinern, statt ihn wörtlich zu übernehmen, und Prompt-Hacks zu entfernen, die geschrieben wurden, um Grenzfälle des Vorgängermodells zu flicken. Ich habe diese Übung bei unseren eigenen Prompts über mehrere Modell-Upgrades hinweg gemacht. Es ist unangenehm und meistens richtig; mitgeschleppte Workarounds sind es, die einen Prompt allmählich unwartbar machen.

Benchmarks sind das eine. Der einzige Einsatz, zu dem eine der beiden Ankündigungen Zahlen nennt, ist die Vertriebs- und Support-Leitung von Starlink, die mit Grok Voice läuft. Die Zahlen, die xAI zu Think Fast 1.0 veröffentlicht hat, lohnt es sich, wörtlich zu zitieren:

  • 20% Konversionsrate. Jede fünfte Verkaufsanfrage kauft den Starlink-Dienst noch während des Telefonats mit Grok.
  • 70% Lösungsquote. Der Großteil der Support-Anfragen wird autonom gelöst, ohne dass ein Mensch eingreift.
  • 28 Tools. Ein Agent, Dutzende einzelne Tools, über Hunderte Support- und Vertriebs-Workflows hinweg.
  • Hardware-Fehlersuche, Hardware-Austausch und Servicegutschriften werden allesamt autonom vergeben.

Das sind starke Zahlen, und sie sind Eigenangaben, was in beide Richtungen wirkt. Starlink und xAI gehören demselben Eigentümer, das ist also der Best-Case-Einsatz mit der größten verfügbaren technischen Aufmerksamkeit. Eine autonome Lösungsquote von 70% ist real, und sie ergibt sich auch daraus, dass ein eigenes Team 28 Tools für eine einzige Geschäftslinie gebaut hat.

Für Think Fast 2.0 konkret sagt xAI, A/B-Tests auf derselben Starlink-Leitung hätten "eine deutliche Steigerung der Verkaufskonversion und der Support-Containment-Rate" gezeigt, ohne für beides eine Zahl zu nennen. Ich hätte gerne die Zahl. Bis es sie gibt, lautet die ehrliche Einschätzung: 2.0 ist bei den Benchmarks besser und im Produktivbetrieb wahrscheinlich auch, aber auf das Wort des Anbieters hin.

Die Resonanz aus der Community ist bislang dünn, was für sich genommen schon etwas darüber aussagt, wer gerade aufmerksam ist. Der Launch-Thread auf Hacker News brachte fünf Punkte und zwei Kommentare:

Hacker News

"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"

Aussagekräftiger ist das Signal von Leuten, die mit der Vorgängergeneration gelebt haben:

Hacker News

"Grok voice is the best voice AI voice assistant and it's not even close. The speed + intelligence tradeoff is just right. While GPT voice is smug and unhumanlike despite trying hard to be human."

Und die abgewogenste Version derselben Einschätzung, der ich am ehesten trauen würde:

Hacker News

"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."

Wer sollte tatsächlich zugreifen

Klares Ja, wenn du eine Telefonleitung mit Volumen betreibst und Latenz der Faktor ist, der dich ausbremst. Unter einer Sekunde bis zum ersten Ton plus der beste veröffentlichte agentische Wert ist gegenüber den Alternativen keine knappe Entscheidung, und die OpenAI-Realtime-Kompatibilität sorgt dafür, dass der Testeinsatz einen Tag kostet, keinen Sprint. Wer Call-Center-Automatisierung von Grund auf aufbaut, sollte es auf die Shortlist setzen.

Klares Ja, wenn du als Entwickler den Stack überspringen willst. Der Voice Agent Builder bündelt Telefonie, Retrieval, Guardrails und Anrufauswertung, mit SIP für Nummern, die du schon besitzt. Das spart real Zeit gegenüber dem Zusammensetzen von vier Anbietern, und die Alternativen verlangen fast alle zusätzlich eine Plattformgebühr. Erwähnenswert ist, dass das Sprachmodell separat von der Textlinie versioniert wird, sodass Releases wie Grok 4.5 es nicht bewegen.

Noch nicht, wenn dein Supportvolumen aus E-Mail und Chat besteht. Das ist der Fehler, den ich Teams immer wieder machen sehe: Sie sehen eine tolle Sprachzahl und beginnen, ein Projekt zur Telefon-Deflection zu planen, während der Großteil ihrer Warteschlange nie jemanden anruft. Sprache ist ein Kanal, keine Strategie. Fang dort an, wo die Tickets tatsächlich sind, und wenn deine Telefonleitung bereits an einen Helpdesk angebunden ist, prüfe erst, was deine Gorgias-Telefonintegration oder ein Äquivalent schon leistet, bevor du einen zweiten Stack hinzufügst.

Noch nicht, wenn du vor dem Livegang Sicherheit nachweisen musst. Es gibt keinen veröffentlichten Weg, Think Fast 2.0 gegen die eigenen historischen Anrufe zu testen, bevor man ihm Traffic zuweist. Anrufaufzeichnung, Transkripte und Guardrails existieren alle erst im Nachhinein, im Builder. Das ist Überprüfung, keine Generalprobe, und dieser Unterschied zählt, wenn der Agent Rückerstattungen auslösen kann. Dieselbe Lücke zeigt sich in der ganzen Kategorie, weshalb das Verhindern falscher KI-Antworten meist ein Prozessproblem ist, kein Modellproblem.

Vorsicht, wenn du gerade auf grok-voice-latest läufst. Sieh dir den Rechner oben an. Bis morgen.

Willst du dasselbe für deine Ticketwarteschlange?

Grok Voice ist gut am Telefon. Das Problem ist: Für die meisten Support-Teams ist das Telefon der kleine Kanal, und die Ticketwarteschlange ist dort, wo das eigentliche Volumen liegt.

Diese Hälfte übernimmt eesel. Es bindet sich an Zendesk, Freshdesk, Gorgias, Front, HubSpot und den Rest an, trainiert mit deinen vergangenen Tickets, Makros und deinem Help Center, statt mit einem Prompt, den du von Grund auf schreiben müsstest, und verfasst oder versendet Antworten direkt im Helpdesk, den deine Mitarbeiter ohnehin schon geöffnet haben. Kein neues Tool, das irgendjemand lernen müsste.

Worauf ich angesichts all dem oben Gesagten über die Lücke zwischen Benchmark und echter Warteschlange hinweisen würde: Bevor man es aktiviert, simuliert eesel den Agenten gegen die eigene Tickethistorie und zeigt, was er geantwortet hätte und wie oft. Das ist der Generalproben-Schritt, den den Sprach-Stacks fehlt. Es gibt ihn, weil ich schon gesehen habe, wie ein selbstsicher klingender Bot falsch geantwortet hat, und ich das lieber an den Tickets des letzten Monats herausfinde als an denen von heute Morgen.

Die Einschätzung einer Kundin dazu, warum dieser Schritt wichtig ist, ein anonymisiertes Zitat von einer CX-Verantwortlichen eines DTC-Nahrungsergänzungsmittel-Unternehmens, mit der wir gesprochen haben:

"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Das ist die Einstellung, keine Einschränkung. Vertrauensbasiertes Routing, Ausschluss nach Tickettyp und eine Simulation vor dem Livegang.

Das eesel-KI-Helpdesk-Dashboard zeigt KI-verfasste Antworten innerhalb der Support-Warteschlange
Das eesel-KI-Helpdesk-Dashboard zeigt KI-verfasste Antworten innerhalb der Support-Warteschlange

Kostenlos zum Testen, und du kannst es in wenigen Minuten auf deinen eigenen Tickets antworten lassen. eesel ausprobieren.

Häufig gestellte Fragen

Was ist Grok Voice Think Fast 2.0?

xAIs Flaggschiff-Modell für Speech-to-Speech, angekündigt am 29. Juli 2026, das auf einem einzigen Modellpfad zuhört, denkt und spricht, statt drei Dienste aneinanderzureihen. Aus diesem einzigen Pfad ergibt sich die Zeit von 0,70 Sekunden bis zum ersten Ton. Am 5. August 2026 wird es zum Modell hinter grok-voice-latest. Wenn es dir um E-Mail und Chat statt um Anrufe geht, passt ein KI-Helpdesk-Agent besser.

Wie viel kostet Grok Voice Think Fast 2.0 pro Minute?

0,08 $ pro Minute Audio, also 4,80 $ pro Stunde, plus 0,004 $ pro Texteingabe. Think Fast 1.0 bleibt bei 0,05 $ pro Minute gelistet, sodass die Preisgestaltung von Grok Voice Think Fast 2.0 einem Sprung von 60% pro Minute entspricht. Eine bereitgestellte Nummer kostet zusätzlich 0,01 $ pro Minute, und Tool-Aufrufe werden separat abgerechnet. Vergleiche das mit deinem breiteren Bild der Kosten für KI-Kundenservice und damit, was ein menschlicher Agent kostet.

Ist Grok Voice Think Fast 2.0 schneller als GPT-Realtime?

Ja, laut der veröffentlichten Messung: 0,70 Sekunden bis zum ersten Ton gegenüber 1,21 Sekunden bei GPT-Realtime-2.1 High. Es ist aber nicht das schnellste Modell im Feld. Deepslate Opal antwortet in 0,44s und Gemini 2.5 Flash Native Audio Dialog in 0,63s, beide im Qualitätsindex weiter hinten. Der Vergleich mit der OpenAI Realtime API deckt die Abwägung aus der anderen Richtung ab, einschließlich WebRTC versus WebSocket als Transportweg.

Muss ich von Think Fast 1.0 aktualisieren?

Nur, wenn du nichts tust. Am 5. August 2026 zeigt grok-voice-latest nicht mehr auf grok-voice-think-fast-1.0, sondern auf grok-voice-think-fast-2.0, deshalb hält dich das Fixieren der alten Version davor dort, wo du bleiben willst. Versionen im Produktivbetrieb zu fixieren ist ohnehin gute Praxis, derselbe Instinkt, der auch hinter dem Testen von KI-Antworten steckt, bevor Kunden sie sehen.

Kann Grok Voice Think Fast 2.0 Kundensupport-Anrufe übernehmen?

Genau dafür ist es ausgelegt. Die Leitung von Starlink läuft mit Grok Voice und 28 Tools, 70% autonomer Lösungsquote und 20% Verkaufskonversion, und das Modell beherrscht Funktionsaufrufe, Dokumentensuche, MCP und Übergabe an Menschen. Die realistische Einordnung findet sich unter ob KI Support-Anrufe beantworten kann, die operative Seite unter wie man Telefon-Support automatisiert und KI-Eskalationsmanagement.

Wie genau ist die Transkription bei Grok Voice Think Fast 2.0?

xAI berichtet von einer 1,4-fach besseren Wortfehlerrate gegenüber Think Fast 1.0 und einer 1,5- bis 2,0-fach besseren Rate gegenüber Deepgram Nova 3 und ElevenLabs Scribe v2 über 24 Sprachen hinweg, mit einem Anstieg auf etwa das 10-Fache bei verrauschtem Audio. Wer mehrsprachigen Support betreibt, sollte das Diagramm pro Sprache statt des Durchschnitts prüfen, denn die Genauigkeit variiert je nach Sprache, und genau die Ausreißer schaden deinem CSAT.

Funktioniert Grok Voice mit Zendesk oder Gorgias?

Nicht nativ. Grok Voice ist ein Modell und ein Builder, jedes Zurückschreiben in den Helpdesk läuft also über ein selbst angebundenes Function-Tool oder einen MCP-Server. Wenn du stattdessen KI direkt im Helpdesk willst, beginne mit Zendesk AI oder Freshdesks Freddy. Auf der Telefonieseite kommt die Zendesk-Talk-Einrichtung der nativen Lösung am nächsten. So oder so: Behandle Sprache als einen weiteren Kanal, der in dieselbe Warteschlange einspeist.

Lohnt sich Grok Voice Think Fast 2.0 gegenüber Think Fast 1.0?

Für eine anspruchsvolle agentische Aufgabe wahrscheinlich schon: 82,9% gegenüber 75,7% insgesamt, dazu fast halbe Latenz und ein Sprung von 17 Punkten bei der Gesprächsdynamik. Für eine simple FAQ-Leitung, bei der 1.0 bereits löst, was du brauchst, kauft dir die Preiserhöhung von 60% eine Genauigkeit, die du vielleicht gar nicht nutzt. Rechne das gegen deine eigene Lösungsquote und den ROI im Call Center, bevor du den Alias für dich entscheiden lässt. Wer die gesamte Modellreihe vergleicht, sollte als Nächstes die xAI-Preise ansehen.

Sources

Häufig gestellte Fragen

Was ist Grok Voice Think Fast 2.0?
Es ist xAIs Flaggschiff-Sprachmodell für Speech-to-Speech, angekündigt am 29. Juli 2026. Es hört zu, denkt nach und spricht auf einem einzigen Modellpfad, statt Sprache-zu-Text, ein LLM und Text-zu-Sprache aneinanderzureihen, und genau daher kommt die Zeit von 0,70 Sekunden bis zum ersten Ton. Am 5. August 2026 ersetzt es Think Fast 1.0 als Modell hinter grok-voice-latest. Wenn es dir eher um E-Mail und Chat als um Telefonanrufe geht, passt ein KI-Helpdesk-Agent besser.
Wie viel kostet Grok Voice Think Fast 2.0 pro Minute?
0,08 $ pro Minute Audio, also 4,80 $ pro Stunde, plus 0,004 $ pro Texteingabe, laut der xAI-Preisseite. Think Fast 1.0 wird weiterhin mit 0,05 $ pro Minute geführt. Eine bereitgestellte Telefonnummer im Voice Agent Builder kostet zusätzlich 0,01 $ pro Minute, und serverseitige Tools werden separat abgerechnet. Vergleiche das mit dem breiteren Bild der Kosten für KI-Kundenservice, bevor du dich festlegst.
Ist Grok Voice Think Fast 2.0 schneller als GPT-Realtime?
Laut Tests von Artificial Analysis: ja. 0,70 Sekunden bis zum ersten Ton gegenüber 1,21 Sekunden bei GPT-Realtime-2.1 High. Es ist aber nicht das schnellste gemessene Modell. Deepslate Opal liegt bei 0,44s und Gemini 2.5 Flash Native Audio Dialog bei 0,63s. Für die andere Seite lohnt sich der Vergleich mit der OpenAI Realtime API.
Muss ich von Grok Voice Think Fast 1.0 aktualisieren?
Nein, aber du musst handeln, um es zu vermeiden. Am 5. August 2026 zeigt grok-voice-latest nicht mehr auf grok-voice-think-fast-1.0, sondern auf grok-voice-think-fast-2.0. Um beim älteren, günstigeren Modell zu bleiben, musst du grok-voice-think-fast-1.0 vor diesem Datum explizit fixieren. Das Fixieren empfiehlt xAI ohnehin für den Produktivbetrieb, dieselbe Disziplin, auf der auch das Verhindern falscher KI-Antworten beruht.
Kann Grok Voice Think Fast 2.0 Kundensupport-Anrufe übernehmen?
Genau dafür ist es gebaut. Die Vertriebs- und Support-Leitung von Starlink läuft mit Grok Voice und 28 Tools, einer autonomen Lösungsquote von 70% und einer Verkaufskonversion von 20% bei eingehenden Anfragen. Das Modell unterstützt Funktionsaufrufe, Dokumentensuche und MCP-Server sowie die Übergabe an Menschen. Lesenswert dazu ist auch ob KI Support-Anrufe überhaupt beantworten kann.
Wie genau ist die Transkription bei Grok Voice Think Fast 2.0?
xAI berichtet von einer 1,4-fach besseren Wortfehlerrate gegenüber Think Fast 1.0 und einer 1,5- bis 2,0-fach besseren Rate gegenüber Deepgram Nova 3 und ElevenLabs Scribe v2, gemessen an Tausenden kurzer Sätze in 24 Sprachen. Der behauptete Abstand wächst bei verrauschtem und telefonie-komprimiertem Audio auf etwa das 10-Fache. Das ist für alle, die mehrsprachigen Support betreiben, wichtiger als die Schlagzeile.
Wie schneidet die Preisgestaltung von Grok Voice Think Fast 2.0 im Vergleich zu anderen Sprach-APIs ab?
Grok veröffentlicht einen festen Minutenpreis; OpenAI und Google rechnen pro Audio-Token ab, sodass sich die tatsächlichen Kosten danach richten, wie viel das Modell spricht. Artificial Analysis hat die Kosten pro Stunde Eingangsaudio gemessen: 4,80 $ für Think Fast 2.0, 10,75 $ für GPT-Realtime-2.1 High und 1,75 $ für Gemini 3.1 Flash High. Unsere Aufschlüsselung zu KI- versus menschlichen Agentenkosten setzt diese Zahlen in Kontext.
Wo hilft Grok Voice Think Fast 2.0 nicht weiter?
Es ist ein Sprachmodell und tut daher nichts für E-Mail- und Chat-Tickets, die nie zu Anrufen werden, und es hat keinen Einblick in deine Helpdesk-Historie. Dafür braucht es einen Agenten, der mit vergangenen Tickets trainiert und vor dem Livegang eine Deflection-Simulation dagegen laufen lässt. Die beiden lassen sich sauber kombinieren: Grok am Telefon, ein Helpdesk-Agent in der Warteschlange.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Strichzeichnung eines Entwicklers und eines Support-Mitarbeiters, die über Sprachwellen sprechen, daneben das Grok-Logo
Trending

Grok Voice Think Fast 2.0 Preise: Was $0.08/Min. kostet

Grok Voice Think Fast 2.0 kostet $0.08 pro Minute Audio, 60% mehr als 1.0. Der grok-voice-latest-Alias wechselt heute darauf, hier also die reale Kostenrechnung pro Anruf.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Illustration von sechs Voice-AI-Agent-Plattformen als Alternativen zu xAIs Grok Voice Agent Builder
Guides

6 Alternativen zum Grok Voice Agent Builder für 2026

ElevenLabs, Retell AI, Vapi, Bland AI, Synthflow und Deepgram im Vergleich zu xAIs Grok Voice Agent Builder bei Preis, Latenz und Compliance.

Alicia Kirana UtomoAlicia Kirana UtomoJul 3, 2026
Illustration eines No-Code-Sprach-KI-Agenten, der einen Anruf auf xAIs Grok-Voice-Stack entgegennimmt
Guides

Grok Voice Agent Builder: ein erster Blick auf xAIs No-Code-Sprach-KI

Ein praktischer Blick auf den Grok Voice Agent Builder: der Speech-to-Speech-Stack, die Preise von 0,05 $/Min, der Zwei-Minuten-Build-Flow und wo er wirklich passt.

Rama Adi NugrahaRama Adi NugrahaJul 2, 2026
Ein Anrufer spricht mit drei verschiedenen Voice-Agent-Optionen, links die Grok-Bildmarke
Alternatives

Die 10 besten Grok Voice Think Fast 2-Alternativen 2026

Grok Voice Think Fast 2.0 ist beim Standard-Alias gerade um 60% teurer geworden. Zehn echte Alternativen mit gemessenen Kosten pro Stunde und ehrlichen Benchmark-Zahlen.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Redaktionelle Illustration mit dem Grok-Logo, Benchmark-Balken und einem Preisschild, die einen Grok 4.5 Test darstellt
Trending

Grok 4.5 im Test: Benchmarks, Preise und das Urteil

xAIs Grok 4.5 startete am 8. Juli mit einem #4-Platz im Intelligence Index und dem besten agentischen Tool-Use-Ergebnis im gesamten Feld. Hier ist der echte Test, mit Benchmarks, Preisen und wer es wirklich nutzen sollte.

Rama Adi NugrahaRama Adi NugrahaJul 9, 2026
Illustration einer Quittung und Preis-Regler für xAIs Grok Voice Agent Builder
Guides

Grok Voice Agent Builder Preise: Was es wirklich kostet

Eine vollständige Aufschlüsselung der Grok Voice Agent Builder Preise: der 0,05 $/Min. Sprachtarif, Telefonie- und Tool-Call-Aufpreise, durchgerechnete Kostenbeispiele und der Vergleich mit OpenAI und ElevenLabs.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 3, 2026
Hero-Banner zum Grok Voice Agent Builder Test, xAIs No-Code-Plattform für Voice-KI-Agents
Guides

Grok Voice Agent Builder im Test: Lohnt sich xAIs Voice-KI?

Mein Test von xAIs Grok Voice Agent Builder: einer No-Code-Plattform für Speech-to-Speech-Voice-Agents. Die Architektur, die Benchmark-Vorbehalte, die Preise und für wen sich das Tool eignet.

Alicia Kirana UtomoAlicia Kirana UtomoJul 3, 2026
Gemini 3.6 Flash Hero-Banner auf blauem Google-Hintergrund
Trending

Gemini 3.6 Flash: was es ist, was es kostet und für wen es sich eignet

Gemini 3.6 Flash ist Googles neues Arbeitspferd-Modell: 17% weniger Output-Tokens, günstigerer Output und ein Kontext von 1M. Hier erfährst du, was es ist und wer es nutzen sollte.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Zwei Personen im Gespräch mit Sprachwellenformen dazwischen und dem Grok-Logo darüber
AI

Grok Voice Think Fast 2.0 im Test: schnell, scharf, gedeckelt

Ein Praxistest von Grok Voice Think Fast 2.0: die Benchmark-Realität, die API-Eigenheiten und das Limit von 10 gleichzeitigen Sessions, das darüber entscheidet, ob du es produktiv nutzen kannst.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten