
Was ich mit "Sprachmodell" tatsächlich meine
Ich verbringe seit ein paar Jahren meine Zeit damit, eesel in Helpdesks zu integrieren, und habe dabei viele Anbieterseiten über KI gelesen, die Kunden antwortet. Sprache ist die eine Kategorie, in der die Architektur-Behauptung real und überprüfbar ist, deshalb lohnt es sich, dabei genau zu sein.
Die meisten Sprach-Stacks sind drei Produkte im Trenchcoat: Sprache zu Text, ein Sprachmodell, dann Text zu Sprache, oft von drei verschiedenen Anbietern. Jeder Übergang bringt Latenz, Kosten und noch eine Sache, die um 2 Uhr nachts ausfallen kann. xAIs eigene Darstellung beim Launch des Voice Agent Builder war, dass genau das zusammengelegt werden sollte, und Think Fast 2.0 ist das Modell, das diese Zusammenlegung vornimmt.

Think-Fast-Modelle tun etwas Bestimmtes, das ich vorher noch nicht produktreif gesehen hatte: Sie denken, während sie schon sprechen. xAI beschreibt das als Denken parallel zum Sprechen, sodass das Nachdenken nicht vor der ersten Silbe steht. In der Praxis feuert ein Tool-Aufruf meist schon, bevor der Agent seinen ersten Satz beendet hat. Das ist der ganze Trick hinter den 0,70 Sekunden, und es erklärt, warum das Modell gleichzeitig schnell und ungewöhnlich gut bei mehrstufigen Aufgaben sein kann, was sich normalerweise gegenseitig ausschließt.
Think Fast 2.0 hat außerdem die Reasoning-Tokens stark reduziert. Laut xAI verbraucht die mediane Antwort das 0,4-Fache der Reasoning-Tokens von Think Fast 1.0, eine Änderung, die man eher bei einem langen Anruf spürt als in einer Demo.
Die Benchmark-Tabelle und die zwei Zeilen, die man leicht übersieht
Hier ist, was xAI am Launch-Tag veröffentlicht hat, mit Quelle Artificial Analysis.
| Benchmark | Think Fast 2.0 | Think Fast 1.0 | GPT-Realtime-2.1 (High) | Gemini 3.1 Flash (High) |
|---|---|---|---|---|
| AA Speech-to-Speech Quality Index | 82,9% | 75,7% | 79,1% | 69,5% |
| Sprach-Reasoning (Big Bench Audio) | 97,2% | 97,1% | 96,0% | 96,6% |
| Gesprächsdynamik (Full Duplex Bench) | 95,1% | 77,8% | 95,7% | 74,3% |
| Agentische Leistung (τ-voice Bench) | 56,5% | 52,1% | 45,7% | 37,7% |
| Zeit bis zum ersten Ton | 0,70s | 1,25s | 1,21s | 2,98s |
Ein paar Dinge würde ich ansprechen, wenn du das über meine Schulter mitlesen würdest.
Erstens: Die für Support wichtigste Zeile ist τ-voice Bench mit 56,5%, und Grok gewinnt sie mit fast 11 Punkten Vorsprung vor dem besten OpenAI-Wert. τ-voice misst Agenten unter realistischen Anrufbedingungen: Lärm, Akzente, Unterbrechungen, Anrufer, die mitten im Satz ihre Meinung ändern. Es ist der bislang naheliegendste veröffentlichte Anhaltspunkt dafür, ob "das Ding einen echten Workflow auf einer echten Telefonleitung ausführen kann". Eine Obergrenze von 56,5% bedeutet aber auch, dass etwa zwei von fünf dieser schwierigen Szenarien immer noch fehlschlagen, eine Zahl, die ich jedem entgegenhalten würde, der volle Automatisierung verspricht.
Zweitens: Die Zeile zur Gesprächsdynamik ist diejenige, die xAI nicht gewinnt. GPT-Realtime-2.1 High liegt mit 95,7% zu 95,1% knapp vorn, und Groks Sprung kommt von 77,8%, war also klar der Fokus dieses Releases. Fairerweise: Das ist ein Zugewinn von 17 Punkten.
Nun zu dem Kontext, den xAIs eigene Tabelle auslässt. Öffnet man das vollständige Artificial-Analysis-Leaderboard, liegt Think Fast 2.0 insgesamt auf Platz zwei, nicht eins. Alibabas Qwen Audio 3.0 Realtime Plus liegt bei 84,1%. Es braucht dafür aber 4,02 Sekunden, um zu sprechen zu beginnen, gegenüber 0,70, was auf einer Telefonleitung den Unterschied zwischen einem Gespräch und toter Luft ausmacht. Ähnlich bei der Latenz: Deepslate Opal antwortet in 0,44s und Gemini 2.5 Flash Native Audio Dialog in 0,63s, beide schneller als Grok, und beide im Index deutlich dahinter. Groks Anspruch ist die Kombination, und bei dieser Kombination ist es das Beste auf dieser Seite.
Der Alias-Wechsel am 5. August, in Dollar
Das ist der Teil, den ich mir tatsächlich in den Kalender eintragen würde.

Laut der xAI-Preisseite sieht die Preistabelle für Sprache so aus:
| Modell oder Modus | Rate |
|---|---|
Speech to speech, grok-voice-think-fast-1.0 | 0,05 $ / Min. (3,00 $ / Std.) Audio, 0,004 $ / Texteingabe |
Speech to speech, grok-voice-think-fast-2.0 | 0,08 $ / Min. (4,80 $ / Std.) Audio, 0,004 $ / Texteingabe |
| Speech to text | 0,10 $ / Std. (REST), 0,20 $ / Std. (Streaming) |
| Text to speech | 15,00 $ / 1 Mio. Zeichen |
xAIs Haltung zur Migration ist, dass für das Upgrade keine Aktion nötig ist, und dass man grok-voice-think-fast-1.0 vor dem 5. August fixieren muss, um bei 1.0 zu bleiben. Beide Aussagen stimmen. Was nicht laut ausgesprochen wird: Der Standardpfad ist der teure, und eine Erhöhung um 60% pro Minute trifft dich, ohne dass du selbst etwas deployst. Wer nennenswertes Volumen fährt, sollte ausrechnen, was das kostet, bevor es eintrifft, nicht danach.
Zwei weitere Zähler laufen mit. Eine bereitgestellte Telefonnummer im Voice Agent Builder kostet zusätzlich 0,01 $ pro Minute. Serverseitige Tools werden pro Aufruf abgerechnet: Websuche und X-Suche zu 5 $ pro 1.000 Aufrufe, Dokumentensammlungssuche zu 2,50 $ pro 1.000, Dateianhang-Suche zu 10 $ pro 1.000. Ein Support-Agent, der bei fast jedem Anruf etwas nachschlägt, kauft diese im Tausenderpack, also gehört das in die Modellrechnung.
Was der 5. August dich kostet
Wähle deine monatliche Gesprächszeit. Die Raten entsprechen xAIs veröffentlichten Sprachpreisen zuzüglich 0,01 $/Min. für eine bereitgestellte Nummer.
Eine Einschränkung beim Vergleich mit anderen: xAI veröffentlicht einen festen Minutenpreis, während OpenAI und Google pro Audio-Token abrechnen. Artificial Analysis normiert das als Kosten pro Stunde Eingangsaudio, und auf dieser Basis liegt Think Fast 2.0 bei 4,80 $, GPT-Realtime-2.1 High bei 10,75 $ und Gemini 3.1 Flash High bei 1,75 $. Die Grok-Zahl entspricht genau dem 60-Fachen der veröffentlichten Minutenrate, also ist es eine echte Preistabelle. Die anderen beiden sind Messwerte aus einem einzigen Benchmark-Durchlauf und ändern sich danach, wie gesprächig der jeweilige Agent ist. Wer zwischen ihnen wählt, sollte lieber die Preise der OpenAI Realtime API genau lesen, statt sich auf eine einzelne normierte Spalte zu verlassen.
Transkription ist das leise Upgrade
Die Benchmark-Tabelle bekommt die Aufmerksamkeit, aber ich halte die Arbeit an der Transkription für die nützlichere Änderung, wenn man das auf eine Telefonleitung legt.
xAI hat Tausende kurze Sätze in 24 Sprachen ausgewertet und berichtet, dass Think Fast 2.0 dedizierte Transkriptionsmodelle schlägt: 1,5- bis 2,0-fach bessere Wortfehlerrate als Deepgram Nova 3 und ElevenLabs Scribe v2, und 1,4-fach besser als Think Fast 1.0. Die Behauptung, die mich mehr interessiert, ist die zum Lärm, wo die Lücke zu dedizierter Sprache-zu-Text-Erkennung unter Hintergrundgeräuschen und Telefonie-Komprimierung angeblich auf etwa das 10-Fache wächst.
Das ist die tatsächliche Bedingung von Support-Anrufen. Niemand ruft aus einer Aufnahmekabine beim Support an. Sie rufen aus dem Auto an, aus einem Lager, aus einer Küche mit einem Kind im Hintergrund. Wer schon einmal gesehen hat, wie eine Transkription aus "meine Bestellung stornieren" etwas völlig anderes macht, weiß: Ein falsches Wort ist ein komplett falscher Workflow. Wer mehrsprachigen Support betreibt, sollte sich das Diagramm pro Sprache in der Ankündigung ansehen statt den Durchschnitt, denn die Streuung über diese 24 Sprachen ist groß.
Zwei Session-Parameter sind speziell dafür da, verbleibende Lücken zu schließen, und sie sind es wert, von Anfang an bekannt zu sein. audio.input.transcription.keyterms lenkt die Transkription auf bis zu 100 Begriffe mit je 50 Zeichen, dorthin gehören SKU-Namen und Plannamen. replace ordnet einer Phrase vor der Text-zu-Sprache-Umsetzung eine gesprochene Ersetzung zu, sodass das Audio den Markennamen korrekt ausspricht, während die Transkription die ursprüngliche Schreibweise beibehält. Das Beispiel in der Dokumentation ordnet "Acme Mobile" der Aussprache "Acme Mobull" zu, was ziemlich genau zeigt, wie unglamourös und zugleich notwendig diese Funktion ist.
Was der Aufbau darauf tatsächlich bedeutet
Ich habe die Speech-to-Speech-Dokumentation so gelesen, wie ich jede API lese, die ich vielleicht später unterstützen muss, also auf der Suche nach den Stellen, die später Probleme machen. Ein paar Notizen aus diesem Durchgang.
Die API ist drahtkompatibel mit OpenAIs Realtime API. Man richtet den WebSocket auf wss://api.x.ai/v1/realtime aus, tauscht den Schlüssel, und der Großteil des bestehenden Client-Codes läuft. Das ist eine bewusst niedrig gehaltene Wechselhürde und das stärkste kommerzielle Argument, das xAI hier hat. Perfekt kompatibel ist es nicht: conversation.item.done, rate_limits.updated und einige output_audio_buffer.*-Ereignisse werden nicht ausgelöst, und conversation.item.input_audio_transcription.delta wird in .updated umbenannt, mit kumulativen statt inkrementellen Payloads. Wer darauf etwas aufgebaut hat, hat entsprechende Portierungsarbeit vor sich. Auch die Unterschiede bei Tool-Aufrufen lohnen sich zu lesen.
Es gibt fünf Tool-Typen: function für eigene APIs, file_search über hochgeladene Dokumentensammlungen, web_search, x_search sowie entfernte mcp-Server. Die MCP-Unterstützung würde ich nutzen, denn sie macht bestehende interne Tools erreichbar, ohne einen sprachspezifischen Shim schreiben zu müssen.
Das Reasoning läuft standardmäßig mit Aufwandsstufe high. Mit reasoning.effort auf "none" lässt es sich abschalten. Erwähnenswert, weil eine echte Beschwerde auf Hacker News zur Vorgängergeneration genau das Gegenteil forderte:
"Grok voice model is also a thinking model. I agree that it's far better than the other voice models Just give me a option to have a slower response but better model…"
Drei xAI-spezifische Erweiterungen würde ich jedem ans Herz legen, der eine Support-Leitung baut:
force_messagespricht eine fest codierte, per TTS synthetisierte Zeile, ohne das Modell einzubeziehen, mit eineminterruptible-Flag. So liefert man "dieses Gespräch wird aufgezeichnet" wortgetreu, jedes Mal, was eine Compliance-Anforderung ist, kein nettes Extra.resumptionspeichert Gesprächsrunden gegen eineconversation_idzwischen und spielt sie beim Wiederverbinden ab. Standardmäßig deaktiviert. Ohne diese Funktion geht bei einem abgebrochenen WebSocket das Gespräch verloren, und mobile Anrufer verlieren die Verbindung ständig.idle_timeout_mslässt den Server einen schweigenden Anrufer über einen Timer erneut ansprechen, der sich nach jeder Antwort neu aktiviert. Das ist der Unterschied zwischen einem geduldigen Agenten und einer unangenehmen Stille.
Der Migrationsrat aus der Dokumentation ist das Gegenteil dessen, was man erwarten würde: System-Prompt kürzer machen, nicht länger. xAIs Empfehlung lautet, Grok zu bitten, den bestehenden Prompt zu verallgemeinern, statt ihn wörtlich zu übernehmen, und Prompt-Hacks zu entfernen, die geschrieben wurden, um Grenzfälle des Vorgängermodells zu flicken. Ich habe diese Übung bei unseren eigenen Prompts über mehrere Modell-Upgrades hinweg gemacht. Es ist unangenehm und meistens richtig; mitgeschleppte Workarounds sind es, die einen Prompt allmählich unwartbar machen.
Funktioniert es im Produktivbetrieb? Starlink ist der einzige echte Beleg
Benchmarks sind das eine. Der einzige Einsatz, zu dem eine der beiden Ankündigungen Zahlen nennt, ist die Vertriebs- und Support-Leitung von Starlink, die mit Grok Voice läuft. Die Zahlen, die xAI zu Think Fast 1.0 veröffentlicht hat, lohnt es sich, wörtlich zu zitieren:
- 20% Konversionsrate. Jede fünfte Verkaufsanfrage kauft den Starlink-Dienst noch während des Telefonats mit Grok.
- 70% Lösungsquote. Der Großteil der Support-Anfragen wird autonom gelöst, ohne dass ein Mensch eingreift.
- 28 Tools. Ein Agent, Dutzende einzelne Tools, über Hunderte Support- und Vertriebs-Workflows hinweg.
- Hardware-Fehlersuche, Hardware-Austausch und Servicegutschriften werden allesamt autonom vergeben.
Das sind starke Zahlen, und sie sind Eigenangaben, was in beide Richtungen wirkt. Starlink und xAI gehören demselben Eigentümer, das ist also der Best-Case-Einsatz mit der größten verfügbaren technischen Aufmerksamkeit. Eine autonome Lösungsquote von 70% ist real, und sie ergibt sich auch daraus, dass ein eigenes Team 28 Tools für eine einzige Geschäftslinie gebaut hat.
Für Think Fast 2.0 konkret sagt xAI, A/B-Tests auf derselben Starlink-Leitung hätten "eine deutliche Steigerung der Verkaufskonversion und der Support-Containment-Rate" gezeigt, ohne für beides eine Zahl zu nennen. Ich hätte gerne die Zahl. Bis es sie gibt, lautet die ehrliche Einschätzung: 2.0 ist bei den Benchmarks besser und im Produktivbetrieb wahrscheinlich auch, aber auf das Wort des Anbieters hin.
Die Resonanz aus der Community ist bislang dünn, was für sich genommen schon etwas darüber aussagt, wer gerade aufmerksam ist. Der Launch-Thread auf Hacker News brachte fünf Punkte und zwei Kommentare:
"Don't know why this post isn't more popular, this is a SOTA voice model, beating dedicated labs like ElevenLabs"
Aussagekräftiger ist das Signal von Leuten, die mit der Vorgängergeneration gelebt haben:
"Grok voice is the best voice AI voice assistant and it's not even close. The speed + intelligence tradeoff is just right. While GPT voice is smug and unhumanlike despite trying hard to be human."
Und die abgewogenste Version derselben Einschätzung, der ich am ehesten trauen würde:
"Grok voice is surprisingly good, actually. It's still a dumber model than the thinking modes of frontier models, but it's less dumb than the voice modes of other providers."
Wer sollte tatsächlich zugreifen
Klares Ja, wenn du eine Telefonleitung mit Volumen betreibst und Latenz der Faktor ist, der dich ausbremst. Unter einer Sekunde bis zum ersten Ton plus der beste veröffentlichte agentische Wert ist gegenüber den Alternativen keine knappe Entscheidung, und die OpenAI-Realtime-Kompatibilität sorgt dafür, dass der Testeinsatz einen Tag kostet, keinen Sprint. Wer Call-Center-Automatisierung von Grund auf aufbaut, sollte es auf die Shortlist setzen.
Klares Ja, wenn du als Entwickler den Stack überspringen willst. Der Voice Agent Builder bündelt Telefonie, Retrieval, Guardrails und Anrufauswertung, mit SIP für Nummern, die du schon besitzt. Das spart real Zeit gegenüber dem Zusammensetzen von vier Anbietern, und die Alternativen verlangen fast alle zusätzlich eine Plattformgebühr. Erwähnenswert ist, dass das Sprachmodell separat von der Textlinie versioniert wird, sodass Releases wie Grok 4.5 es nicht bewegen.
Noch nicht, wenn dein Supportvolumen aus E-Mail und Chat besteht. Das ist der Fehler, den ich Teams immer wieder machen sehe: Sie sehen eine tolle Sprachzahl und beginnen, ein Projekt zur Telefon-Deflection zu planen, während der Großteil ihrer Warteschlange nie jemanden anruft. Sprache ist ein Kanal, keine Strategie. Fang dort an, wo die Tickets tatsächlich sind, und wenn deine Telefonleitung bereits an einen Helpdesk angebunden ist, prüfe erst, was deine Gorgias-Telefonintegration oder ein Äquivalent schon leistet, bevor du einen zweiten Stack hinzufügst.
Noch nicht, wenn du vor dem Livegang Sicherheit nachweisen musst. Es gibt keinen veröffentlichten Weg, Think Fast 2.0 gegen die eigenen historischen Anrufe zu testen, bevor man ihm Traffic zuweist. Anrufaufzeichnung, Transkripte und Guardrails existieren alle erst im Nachhinein, im Builder. Das ist Überprüfung, keine Generalprobe, und dieser Unterschied zählt, wenn der Agent Rückerstattungen auslösen kann. Dieselbe Lücke zeigt sich in der ganzen Kategorie, weshalb das Verhindern falscher KI-Antworten meist ein Prozessproblem ist, kein Modellproblem.
Vorsicht, wenn du gerade auf grok-voice-latest läufst. Sieh dir den Rechner oben an. Bis morgen.
Willst du dasselbe für deine Ticketwarteschlange?
Grok Voice ist gut am Telefon. Das Problem ist: Für die meisten Support-Teams ist das Telefon der kleine Kanal, und die Ticketwarteschlange ist dort, wo das eigentliche Volumen liegt.
Diese Hälfte übernimmt eesel. Es bindet sich an Zendesk, Freshdesk, Gorgias, Front, HubSpot und den Rest an, trainiert mit deinen vergangenen Tickets, Makros und deinem Help Center, statt mit einem Prompt, den du von Grund auf schreiben müsstest, und verfasst oder versendet Antworten direkt im Helpdesk, den deine Mitarbeiter ohnehin schon geöffnet haben. Kein neues Tool, das irgendjemand lernen müsste.
Worauf ich angesichts all dem oben Gesagten über die Lücke zwischen Benchmark und echter Warteschlange hinweisen würde: Bevor man es aktiviert, simuliert eesel den Agenten gegen die eigene Tickethistorie und zeigt, was er geantwortet hätte und wie oft. Das ist der Generalproben-Schritt, den den Sprach-Stacks fehlt. Es gibt ihn, weil ich schon gesehen habe, wie ein selbstsicher klingender Bot falsch geantwortet hat, und ich das lieber an den Tickets des letzten Monats herausfinde als an denen von heute Morgen.
Die Einschätzung einer Kundin dazu, warum dieser Schritt wichtig ist, ein anonymisiertes Zitat von einer CX-Verantwortlichen eines DTC-Nahrungsergänzungsmittel-Unternehmens, mit der wir gesprochen haben:
"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Das ist die Einstellung, keine Einschränkung. Vertrauensbasiertes Routing, Ausschluss nach Tickettyp und eine Simulation vor dem Livegang.

Kostenlos zum Testen, und du kannst es in wenigen Minuten auf deinen eigenen Tickets antworten lassen. eesel ausprobieren.
Häufig gestellte Fragen
Was ist Grok Voice Think Fast 2.0?
xAIs Flaggschiff-Modell für Speech-to-Speech, angekündigt am 29. Juli 2026, das auf einem einzigen Modellpfad zuhört, denkt und spricht, statt drei Dienste aneinanderzureihen. Aus diesem einzigen Pfad ergibt sich die Zeit von 0,70 Sekunden bis zum ersten Ton. Am 5. August 2026 wird es zum Modell hinter grok-voice-latest. Wenn es dir um E-Mail und Chat statt um Anrufe geht, passt ein KI-Helpdesk-Agent besser.
Wie viel kostet Grok Voice Think Fast 2.0 pro Minute?
0,08 $ pro Minute Audio, also 4,80 $ pro Stunde, plus 0,004 $ pro Texteingabe. Think Fast 1.0 bleibt bei 0,05 $ pro Minute gelistet, sodass die Preisgestaltung von Grok Voice Think Fast 2.0 einem Sprung von 60% pro Minute entspricht. Eine bereitgestellte Nummer kostet zusätzlich 0,01 $ pro Minute, und Tool-Aufrufe werden separat abgerechnet. Vergleiche das mit deinem breiteren Bild der Kosten für KI-Kundenservice und damit, was ein menschlicher Agent kostet.
Ist Grok Voice Think Fast 2.0 schneller als GPT-Realtime?
Ja, laut der veröffentlichten Messung: 0,70 Sekunden bis zum ersten Ton gegenüber 1,21 Sekunden bei GPT-Realtime-2.1 High. Es ist aber nicht das schnellste Modell im Feld. Deepslate Opal antwortet in 0,44s und Gemini 2.5 Flash Native Audio Dialog in 0,63s, beide im Qualitätsindex weiter hinten. Der Vergleich mit der OpenAI Realtime API deckt die Abwägung aus der anderen Richtung ab, einschließlich WebRTC versus WebSocket als Transportweg.
Muss ich von Think Fast 1.0 aktualisieren?
Nur, wenn du nichts tust. Am 5. August 2026 zeigt grok-voice-latest nicht mehr auf grok-voice-think-fast-1.0, sondern auf grok-voice-think-fast-2.0, deshalb hält dich das Fixieren der alten Version davor dort, wo du bleiben willst. Versionen im Produktivbetrieb zu fixieren ist ohnehin gute Praxis, derselbe Instinkt, der auch hinter dem Testen von KI-Antworten steckt, bevor Kunden sie sehen.
Kann Grok Voice Think Fast 2.0 Kundensupport-Anrufe übernehmen?
Genau dafür ist es ausgelegt. Die Leitung von Starlink läuft mit Grok Voice und 28 Tools, 70% autonomer Lösungsquote und 20% Verkaufskonversion, und das Modell beherrscht Funktionsaufrufe, Dokumentensuche, MCP und Übergabe an Menschen. Die realistische Einordnung findet sich unter ob KI Support-Anrufe beantworten kann, die operative Seite unter wie man Telefon-Support automatisiert und KI-Eskalationsmanagement.
Wie genau ist die Transkription bei Grok Voice Think Fast 2.0?
xAI berichtet von einer 1,4-fach besseren Wortfehlerrate gegenüber Think Fast 1.0 und einer 1,5- bis 2,0-fach besseren Rate gegenüber Deepgram Nova 3 und ElevenLabs Scribe v2 über 24 Sprachen hinweg, mit einem Anstieg auf etwa das 10-Fache bei verrauschtem Audio. Wer mehrsprachigen Support betreibt, sollte das Diagramm pro Sprache statt des Durchschnitts prüfen, denn die Genauigkeit variiert je nach Sprache, und genau die Ausreißer schaden deinem CSAT.
Funktioniert Grok Voice mit Zendesk oder Gorgias?
Nicht nativ. Grok Voice ist ein Modell und ein Builder, jedes Zurückschreiben in den Helpdesk läuft also über ein selbst angebundenes Function-Tool oder einen MCP-Server. Wenn du stattdessen KI direkt im Helpdesk willst, beginne mit Zendesk AI oder Freshdesks Freddy. Auf der Telefonieseite kommt die Zendesk-Talk-Einrichtung der nativen Lösung am nächsten. So oder so: Behandle Sprache als einen weiteren Kanal, der in dieselbe Warteschlange einspeist.
Lohnt sich Grok Voice Think Fast 2.0 gegenüber Think Fast 1.0?
Für eine anspruchsvolle agentische Aufgabe wahrscheinlich schon: 82,9% gegenüber 75,7% insgesamt, dazu fast halbe Latenz und ein Sprung von 17 Punkten bei der Gesprächsdynamik. Für eine simple FAQ-Leitung, bei der 1.0 bereits löst, was du brauchst, kauft dir die Preiserhöhung von 60% eine Genauigkeit, die du vielleicht gar nicht nutzt. Rechne das gegen deine eigene Lösungsquote und den ROI im Call Center, bevor du den Alias für dich entscheiden lässt. Wer die gesamte Modellreihe vergleicht, sollte als Nächstes die xAI-Preise ansehen.
Sources
- Grok Voice Think Fast 2.0, xAI, July 29, 2026
- Grok Voice Think Fast 1.0, xAI, April 23, 2026
- Introducing the Voice Agent Builder, xAI, July 1, 2026
- 21 New Flagship Grok Voices, xAI, July 6, 2026
- xAI pricing, voice API rates, last updated July 3, 2026
- Speech to Speech API docs, xAI, last updated August 2, 2026
- Speech to Speech models leaderboard, Artificial Analysis
Häufig gestellte Fragen
Was ist Grok Voice Think Fast 2.0?
grok-voice-latest. Wenn es dir eher um E-Mail und Chat als um Telefonanrufe geht, passt ein KI-Helpdesk-Agent besser.Wie viel kostet Grok Voice Think Fast 2.0 pro Minute?
Ist Grok Voice Think Fast 2.0 schneller als GPT-Realtime?
Muss ich von Grok Voice Think Fast 1.0 aktualisieren?
grok-voice-latest nicht mehr auf grok-voice-think-fast-1.0, sondern auf grok-voice-think-fast-2.0. Um beim älteren, günstigeren Modell zu bleiben, musst du grok-voice-think-fast-1.0 vor diesem Datum explizit fixieren. Das Fixieren empfiehlt xAI ohnehin für den Produktivbetrieb, dieselbe Disziplin, auf der auch das Verhindern falscher KI-Antworten beruht.Kann Grok Voice Think Fast 2.0 Kundensupport-Anrufe übernehmen?
Wie genau ist die Transkription bei Grok Voice Think Fast 2.0?
Wie schneidet die Preisgestaltung von Grok Voice Think Fast 2.0 im Vergleich zu anderen Sprach-APIs ab?
Wo hilft Grok Voice Think Fast 2.0 nicht weiter?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








