
Warum Sprache zurück ist, und warum das jetzt wichtig ist
Rund ein Jahrzehnt lang war die gängige Meinung, dass Telefonsupport aussterbe. Das stimmt nicht. Sprache ist auf 40% des Contact-Center-Volumens zurückgekommen und wächst weiter. Chat wiederum hat eine Failover-Rate von 32% zurück zur Sprache. Das Telefon ist also der Ort, an dem die schwierigen Kontakte landen und nicht die einfachen, was ein anderes Problem ist als gewöhnliche Callcenter-Automatisierung. Deshalb hat die ältere Generation von automatisierten Telefonsystemen daran auch nie wirklich etwas geändert.
Dieser Selektionseffekt ist das eigentliche Problem. Ein Hacker-News-Kommentator hat es besser formuliert als jede Vertriebspräsentation, die ich je gesehen habe:
"I admire what you have done, but for a luxury experience, I do not want to talk to an AI that just tells me what is already on the website. If I have gotten to the point where I am calling you, its because I couldn't find an answer to my question on the website in the first place."
Jeder, der Ihnen einen Sprachagenten verkauft, trainiert ihn auf Ihrem Hilfe-Center. Und die Leute, die Sie anrufen, sind per Definition genau die, bei denen Ihr Hilfe-Center bereits versagt hat. Behalten Sie das im Kopf, denn es erklärt die meisten enttäuschenden Rollouts, von denen ich höre.
Wie ich diese ausgewählt habe, und der Benchmark, den niemand zitiert
Am 5. August 2026 habe ich die Preisseite, Dokumentation und das Hilfe-Center jedes Anbieters durchgesehen. Dann habe ich die echten Gesamtkosten pro Minute statt des Richtwerts errechnet und geprüft, was jeder Anbieter in dem Moment tut, in dem der Agent die Aufgabe nicht lösen kann. Wo ein Anbieter keine Preisliste veröffentlicht, sage ich das, statt zu raten.
Diese Liste ist bewusst enger gefasst als mein breiterer Überblick über KI-Sprachunternehmen. Sie nimmt auch einen anderen Blickwinkel ein als der Überblick zur besten KI für Telefonsupport, der nach Anbietertyp sortiert. Hier bestimmt die Messung die Reihenfolge.
Die Messung, die geändert hat, wie ich die ganze Kategorie betrachte, ist τ-Voice, und das ist kein generischer Audio-Benchmark. Ein simulierter Anrufer ruft das Modell mit einem echten Problem an, einer Flugänderung oder einer strittigen Abbuchung, manchmal einem Telekom-Fehler. Der Score misst, ob die Datenbank am Ende im korrekten Endzustand ist. Das heißt, er bewertet genau das, was Sie kaufen.

Die Spitze dieses Leaderboards ist ernüchternd:
| Modell | τ-Voice (gelöste Support-Szenarien) | Sprachverständnis | Zeit bis zum ersten Audio | Kosten pro Stunde Eingangsaudio |
|---|---|---|---|---|
| Grok Voice Think Fast 2.0 High | 56,5% | 97% | 0,70s | $4.80 |
| Qwen Audio 3.0 Realtime Plus | 54,6% | 99% | 4,02s | $4.42 |
| Grok Voice Think Fast 1.0 | 52,1% | 97% | 1,25s | $3.00 |
| GPT-Realtime-2.1 High | 45,7% | 96% | 1,21s | $10.75 |
| GPT-Realtime-2 High | 39,8% | 97% | 1,14s | $4.14 |
| Gemini 3.1 Flash High | 37,7% | 97% | 2,99s | $1.75 |
| Deepslate Opal | 17,5% | 85% | 0,44s | $6.48 |
| GPT Realtime Mini | 15,1% | 64% | 0,81s | $3.04 |
Lesen Sie die zweite und dritte Spalte zusammen. Sprachverständnis ist im Grunde gelöst, denn sechs dieser acht Modelle erreichen 96% oder besser beim Verstehen einer gesprochenen Frage. Dann fallen dieselben Modelle in dem Moment, in dem sie die Aufgabe abschließen müssen, von einer Klippe. Den Anrufer zu verstehen ist nicht mehr der schwierige Teil. Die Aufgabe abzuschließen ist es.
Wollen Sie sehen, wie das in einem echten Arbeitsumfeld statt in einem Benchmark aussieht? Blands eigene Dokumentation veröffentlicht einen Tool-Analyse-Screen, der ehrlicher ist als jede Marketingseite:

408 Tool-Ausführungen, 142 Fehler, eine Fehlerrate von 34,8%. Der größte Übeltäter ist eine Kalendersuche, die 81 Mal mit "start_time must be in the future" fehlschlägt. Nichts davon ist ein Sprachproblem. Der Agent hat den Anrufer perfekt verstanden, und dann ist der Tool-Aufruf gescheitert, und genau dort geht der τ-Voice-Score verloren.
Latenz hat aufgehört, der Flaschenhals zu sein
Die Kategorie verkauft sich immer noch über Millisekunden. Ich verstehe, warum, denn jahrelang war das tatsächlich die Hürde. Nicht mehr, und das Leaderboard zeigt es deutlich genug.

Deepslate Opal antwortet am schnellsten in der gesamten Tabelle, 0,44 Sekunden, und löst 17,5% der Support-Szenarien. Grok Voice Think Fast 2.0 braucht eine Viertelsekunde länger und löst 56,5%. Niemand legt wegen 260 Millisekunden auf. Menschen legen auf, weil der Agent das, worum es beim Anruf ging, nicht erledigen konnte.
Und was Betreiber als tatsächliches Problem melden, ist überhaupt keine Langsamkeit. Es ist, dass der Agent dazwischenredet:
"It's brutal. We're losing ~40% of callers in the first 30 seconds. Current setup: Vapi with GPT-4 Turn-end detection at 800ms (their default) Network latency averaging 120-150ms Processing adds another 200-300ms What I've tried: Increased silence threshold to 1.2s → Bot feels sluggish, people think it's broken Decreased to 500ms → Interruption city, worse than before Added "please wait for customer to finish" to prompt → Literally no effect"
Das ist Barge-in-Handling. Ein Tuning-Problem statt eines Modellproblems, und die bei weitem am meisten unterschätzte Position in einem Sprach-Rollout. Ein Betreiber, der seinen eigenen Stack gebaut hat, bezifferte den Aufschlag mit "200-400ms until you tune turn detection thresholds properly" und sagte den Leuten, sie sollten "plan for two months of 'why is my agent talking over the caller'" einplanen, bevor es produktionsreif ist, in diesem Build-versus-Buy-Thread.
Die vollständigste Schilderung, die ich gefunden habe, kam von jemandem mit 20 Deployments in der Praxis. Sie deckt Barge-in und Übergabe ab, und auch Kosten, alles in einem Beitrag:
"deployed voice agents for about 20 small businesses now, mostly service companies like plumbers, dentists, med spas. here's what i've actually hit in production: biggest issue by far is barge-in handling. customer starts talking while the agent is still speaking and everything goes sideways. most platforms handle this okay in demos but in real calls with background noise, accents, or people who talk fast it breaks constantly. had to build custom silence detection thresholds per client. second is the handoff to human. when the ai can't handle something it needs to transfer cleanly. vapi and retell both struggle here depending on the telephony setup. the call drops, or there's a 3 second gap of silence that makes the caller hang up. we ended up building a warm transfer flow where the agent briefs the human before connecting. [...] cost wise the biggest surprise was how much it costs when calls go long. a 10 minute call can cost $1.50-2.00 when you add up stt + llm + tts + telephony. sounds small but if you're handling 200 calls a day for a client it adds up fast. we had to build hard cutoffs and summarization to keep calls under 4 minutes."
Drei Dinge daraus lohnen sich hervorzuheben. Ein zehnminütiger Anruf kostet 1,50 bis 2,00 US-Dollar insgesamt, und das passt zur Rechnung weiter unten und nicht zu irgendeiner Startseite. Demos verstecken Barge-in-Probleme, weil Demo-Anrufer keine Akzente und keine Hintergrundgeräusche haben. Und die Lösung, sowohl für die Übergabelücke als auch für die Kosten, war, etwas zu bauen, das die Plattform nicht mitbrachte.
Die vier Dinge, nach denen ich tatsächlich bewertet habe
- Übergabe an einen Menschen. Nicht ob es das gibt. Sondern ob sie warm ist, ob eine Zusammenfassung statt eines rohen Transkripts übergeben wird, und ob das Ganze in einem Enterprise-Vertrag steckt. Gutes Eskalationsmanagement ist der Unterschied zwischen einer Deflection und einem verärgerten Anrufer.
- Wissensquellen. Fast jedes Tool hier verarbeitet einen öffentlichen Website-Crawl plus hochgeladene Dateien. Kaum eines davon greift auf Ihre vergangenen Tickets oder ein authentifiziertes Wiki zu. Dieser Unterschied entscheidet darüber, wie es mit den Anrufen umgeht, bei denen Ihr Hilfe-Center schon versagt hat.
- Testen vor dem Start. Eine "Simulation", die von Ihnen selbst geschriebene Szenarien durchläuft, ist eine andere Garantie als eine, die Ihre eigene Anrufhistorie abspielt. Genau ein Anbieter hier macht Letzteres. Für Halluzinationsprävention ist das wichtiger als jede Guardrail-Einstellung.
- Reale Kosten pro Minute, Telefonie inklusive. Nie die Zahl von der Startseite. Es ist auch die Zahl, die über Ihren Callcenter-ROI entscheidet.
Die 9 besten KI-Tools für Sprachsupport im Kundenservice 2026
| Tool | Am besten für | Reale Gesamtrate | Abrechnungseinheit | Übergabe an Menschen | Wissensquellen | Test gegen eigene Anrufe | Parallelität | Sicherheit | Helpdesk-Integrationen |
|---|---|---|---|---|---|---|---|---|---|
| ElevenLabs Agents | Eine vorhersehbare Rate | $0.08/min + Carrier | Pro Minute, im Voraus bezahlt | Ja, transfer_to_number | Dateien, URLs, RAG im kostenlosen Tarif | Nein | 4 bis 40 je Tarif | SOC 2, ISO 42001, PCI DSS L1, BAA im Enterprise-Tarif | Zendesk, Salesforce |
| Retell AI | Support-Teams ohne Entwicklungsteam | ~$0.135/min | Pro Minute, zusammengesetzt | Warm, plus Supervisor-Übernahme | Website-Crawl, Datei-Upload | Nein | 20 kostenlos, dann $8/Leitung/Monat | SOC 2 Type II, HIPAA, DSGVO | HubSpot, Salesforce; Zendesk "demnächst" |
| Vapi | Volle Kontrolle über den Modell-Stack | ~$0.105/min | Pro Minute, zusammengesetzt | Ja, über Telefonie-Anbieter | Nur Datei-Upload, Gemini-Retrieval | Nein | 10 kostenlos, dann $10/Leitung/Monat | HIPAA $2.000/Monat, ZDR $1.000/Monat | Keine vorgefertigten |
| PolyAI | Bestehende CCaaS-Landschaft | Nur auf Anfrage | Pro Minute | Ja | Docs und Integrationen | Nein | Nicht veröffentlicht | SOC 2 Type 2, ISO 27001, PCI DSS, DSGVO, HIPAA als Standard | Zendesk Talk via CCaaS |
| Parloa | Testen gegen die eigene Anrufhistorie | Nur auf Anfrage | Verbrauchsbasiert, nach Aufgabenkomplexität | Ja | Enterprise-Konnektoren | Ja, spielt reale Transkripte ab | Nicht veröffentlicht | ISO 27001, SOC 2 Type 1 und 2, PCI DSS | Zendesk, ServiceNow, Salesforce, Dynamics |
| Sierra | Nur für Lösungen bezahlen | Nur auf Anfrage | Pro gelöstem Gespräch | Ja, kontexterhaltend | Enterprise-Konnektoren | Sprachsimulationen | Nicht veröffentlicht | SOC 2, ISO 27001, ISO 42001, HIPAA, PCI DSS, FedRAMP | Nicht veröffentlicht |
| Bland AI | Hohe Parallelität und Self-Hosting | $0.11 bis $0.14/min | Pro Minute + Plattformgebühr | Nur Enterprise | Dateien, Text, öffentliches Web | Nein | 10 bis 100, Enterprise bis 1 Mio. | 99,9% SLA bei allen Tarifen, BAA im Enterprise-Tarif | Keine |
| Synthflow | Ein Freshworks-natives Rollout | ~$2.500/Monat Mindestpreis | Pro Sekunde, aggregiert | Kalt, warm, warm mit Zusammenfassung | PDFs, URLs, Crawl, Zendesk-Import | Test Center, kostenpflichtig | Vertraglich festgelegt | SOC 2, DSGVO, ISO 27001 | Freshworks (Freshcaller) |
| Grok Voice Agent Builder | Das schnellste fähige Modell | $0.08/min + $0.01 Nummer | Pro Minute, Pay-as-you-go | Über Tool-Aufrufe | Kollektionen, Datei- und Websuche | Nein | 10 Sessions pro Team | Für Voice nicht veröffentlicht | Keine |
Neun Tools und vier verschiedene Abrechnungsarten. Nur eines lässt Sie gegen Ihr eigenes Anrufarchiv testen, und genau diese Spalte würde ich mir merken.
Vor den einzelnen Beschreibungen noch etwas Rechenarbeit. Die beworbenen Raten sind nicht miteinander vergleichbar, und die Lücke ist groß genug, um Ihre Shortlist zu verändern.
1. ElevenLabs Agents
Am besten für: Teams, die die Rechnung bis auf den Cent vorausberechnen müssen, bevor sie sich festlegen.
ElevenLabs ist vor allem für Text-to-Speech bekannt. Die Agents-Plattform ist die Gesprächsebene, die darauf aufsetzt, und sie hat bereits über 4 Mio. Agenten ausgeliefert. Der Grund, warum sie diese Liste anführt, ist unspektakulär: Sie ist der einzige Anbieter hier, bei dem die Preisrechnung aufgeht.

Es lohnt sich, bei diesem Dashboard zu verweilen. Es ist der einzige Ort in diesem Vergleich, an dem ein Anbieter seine eigenen Zahlen unbearbeitet zeigt: 75,1% Gesamterfolgsrate, 3,5 Sterne durchschnittliches CSAT. Ein realistisch wirkendes Deployment also, und keine 95%-Behauptung.
Was es tatsächlich tut
Telefonie über SIP ist bei jedem Tarif enthalten statt gesperrt, was ungewöhnlich ist. Wissensdatenbanken und RAG funktionieren sogar im kostenlosen Tarif. Tool-Aufrufe, Batch-Calling, ein gehosteter MCP-Server für Agenten-Management, eine CLI: alles vorhanden. Benannte Integrationen decken auf der Telefonie-Seite Genesys und Amazon Connect ab. Für Ticketing sind es Zendesk und Salesforce, die einzigen zwei Ticketing-Systeme mit echten Seiten.
Zwei Dinge sollten Sie vor dem Bauen wissen. Die eigenen Seiten widersprechen sich bei den Sprachen: 70+ im Sprachkatalog gegenüber 31, auf die ein Agent tatsächlich konfiguriert werden kann. Zweitens gibt es keine veröffentlichte Round-Trip-Latenz für einen Agenten, nur Komponentenzahlen für Flash v2.5 mit etwa 75ms und Scribe v2 Realtime mit etwa 150ms. Keines davon ist dasselbe wie das, was Ihr Anrufer hört.
Preise
| Tarif | Monatlich | Enthaltene Minuten | Effektiver $/min | Überschreitung | Burst | Gleichzeitige Anrufe |
|---|---|---|---|---|---|---|
| Free | $0 | 15 | n/a | $0.08 | $0.16 | 4 |
| Starter | $6 | 75 | $0.0800 | $0.08 | $0.16 | 6 |
| Creator | $22 (erster Monat $11) | 275 | $0.0800 | $0.08 | $0.16 | 10 |
| Pro | $99 | 1.238 | $0.0800 | $0.08 | $0.16 | 20 |
| Scale | $299 | 3.738 | $0.0800 | $0.08 | $0.16 | 30 |
| Business | $990 | 12.375 | $0.0800 | $0.08 | $0.16 | 40 |
| Enterprise | Individuell | Individuell | Verhandelbar | Verhandelbar | n/a | Erhöht |
Sehen Sie sich diese Effektiv-Spalte an. Jeder Bezahltarif teilt sich exakt auf $0,08. Business kostet $990 für 12.375 Minuten, und 12.375 × $0,08 sind genau $990,00. Die Minutenkontingente wurden also aus dem Preis zurückgerechnet, was bedeutet, dass es bei keinem Tarif einen Mengenrabatt gibt. Textnachrichten kosten $0,003 pro Stück, und Carrier-Telefonie wird zusätzlich "zum Selbstkostenpreis" abgerechnet.
Vorteile
- Die einzigen Kosten pro Minute in diesem Vergleich, die man tatsächlich vorausberechnen kann.
- SIP-Trunking ist nicht Enterprise-gesperrt, also funktioniert Ihr eigener Carrier bereits im $6-Tarif.
- Eine ernstzunehmende Compliance-Liste: ISO 42001, AIUC-1, PCI DSS Level 1.
- Wissensdatenbanken und RAG funktionieren im kostenlosen Tarif, richtiges Testen kostet also nichts.
Nachteile
- Nie ein Mengenrabatt. Bei 50.000 Minuten zahlen Sie denselben Satz wie bei 75.
- Minuten werden im Voraus bezahlt statt Pay-as-you-go, spitzes Volumen bedeutet also, für ungenutzte Reserven zu zahlen.
- Die BAA für HIPAA steckt im Enterprise-Tarif, ebenso SSO und die SLA-Bedingungen.
- Betreiber berichten, dass das
transfer_to_number-Tool die Übergabe nicht abschließt, ausführlich diskutiert in diesem r/ElevenLabs-Thread.
Unsere Einschätzung: Fangen Sie hier an, wenn Ihr Volumen vorhersehbar ist und Sie eine Zahl wollen, die Ihre Finanzabteilung akzeptiert. Der Flat-Rate hat aber zwei Seiten. Über 20.000 Minuten im Monat? Holen Sie ein Enterprise-Angebot ein, bevor Sie sich festlegen, denn hier gibt es keine Rabattkurve, in die Sie hineinwachsen könnten. Ich schlüssele die Tarife weiter auf in meinem Leitfaden zu ElevenLabs-Preisen und behandle die Wechseloptionen in ElevenLabs-Alternativen.
2. Retell AI
Am besten für: Support-Teams, die Anrufanalysen und saubere Eskalation wollen, ohne eine Entwicklerstelle.
Retell AI ist das, das ich einem Support-Manager statt einem Entwickler vorlegen würde. Seine Kostentransparenz geht bis zu einem fast unangenehmen Grad. Es ist auch der einzige Anbieter hier, dessen eigene FAQ die Frage "kann KI Call-Center-Mitarbeiter ersetzen?" mit einem klaren "Nein" beantwortet. Das verdient bei mir mehr Respekt als jede Containment-Behauptung auf dieser Seite.

Beachten Sie das dritte Panel. Die Willkommensnachricht ist auf "User Initiates: AI remains silent until users speak first" eingestellt. Kleine Einstellung, große Wirkung darauf, wie sich die ersten drei Sekunden eines Support-Anrufs anfühlen.
Was es tatsächlich tut
Die Eskalationsebene ist der starke Teil. Warme Übergabe, IVR-Navigation und DTMF-Erfassung sitzen alle unter einem einzigen Call-Transfer-Knoten, während Live-Monitoring einem Supervisor erlaubt, mitzuhören oder den Anruf komplett zu übernehmen. Noch besser: Die KI-Gebühr stoppt im Moment der Übergabe, danach läuft nur noch die Telefonie weiter. Der richtige Anreiz, und fast niemand sonst macht das so.
Post-Call-Analyse, Transkripte, Webhooks und die API sind alle im kostenlosen Pay-as-you-go-Tarif verfügbar, sodass Sie es wirklich testen können. Ein Referenzkunde, Medical Data Systems, veröffentlicht eine Transferrate von 30%. Also rund 70% Containment bei einem realen Deployment.
Die Wissensdatenbank ist ein Website-Crawl plus Datei-Upload. Keine dokumentierte Übernahme Ihrer vergangenen Ticket-Historie, und die Simulation läuft mit von Ihnen selbst geschriebenen Testfällen statt einer Wiedergabe Ihres eigenen Anrufarchivs.
Preise
| Komponente | Rate | Anmerkungen |
|---|---|---|
| Retell-Sprachinfrastruktur | $0.055/min | Unvermeidbar. Speech-to-Text ist hier bereits enthalten. |
| Text-to-Speech | $0.015/min | $0,040/min bei Wahl von ElevenLabs-Stimmen |
| LLM | $0.003 bis $0.32/min | GPT 5 nano am unteren, GPT 5.5 Fast am oberen Ende |
| Telefonie | $0.015/min verwaltet | $0 auf eigenem SIP-Trunk |
| Wissensdatenbank | +$0.005/min | Plus $8/Monat pro Datenbank nach den ersten 10 |
| Guardrails | +$0.005/min | PII-Entfernung ist ein separates +$0,01/min |
| KI-Anruf-QA | $0.10/min | Erste 100 Minuten kostenlos |
| Parallelität | $8/Anruf/Monat | Erste 20 Leitungen enthalten |
Die Richtwertspanne liegt bei $0,07 bis $0,31 pro Minute, mit $10 Gratisguthaben und ohne Plattformgebühr. Retells eigener Rechner setzt standardmäßig $0,115/min an, nullt aber Telefonie und jedes Add-on. Bauen Sie etwas Realistisches für eingehenden Support, GPT 4.1 mit Retells eigener Stimme, eine verwaltete US-Nummer, Wissensdatenbank eingeschaltet, landen Sie bei $0,135/min. Das sind $677 pro Monat bei 5.000 Minuten. Schalten Sie KI-Anruf-QA für den gesamten Traffic ein und es kommen etwa $490 pro Monat dazu, ein Anstieg von 74%.
Vorteile
- Die beste Übergabe-an-Mensch-Geschichte im Vergleich, und der Zähler stoppt im Moment der Übergabe.
- Supervisoren können live mithören oder den Anruf übernehmen.
- Kostentransparenz bis auf einzelne Komponentenraten.
- SOC 2 Type II, HIPAA und DSGVO gelten plattformweit statt tarifabhängig.
Nachteile
- Zendesk ist als "demnächst" markiert statt ausgeliefert. Aktive Konnektoren reichen bis Cal.com, HubSpot und Salesforce, und nirgendwo in der Dokumentation gibt es eine Freshdesk-, Gorgias-, Front- oder Help-Scout-Integration.
- Die Latenzbehauptung von ~600ms wird "unabhängigen Benchmarks" zugeschrieben, die nie genannt oder verlinkt werden.
- Keine der beiden Seiten veröffentlicht eine Sprachenanzahl oder einen Uptime-SLA-Prozentsatz.
- Die Speech-to-Speech-Option kostet $0,345/min, was über Retells eigener genannter Obergrenze von $0,31 liegt.
Unsere Einschätzung: die stärkste Gesamtwahl für ein Support-Team, mit einer großen Einschränkung. Nutzen Sie Zendesk oder Freshdesk, sollten Sie einplanen, die Ticket-Übergabe selbst über Webhooks zu bauen. Schauen Sie sich an, wen Retell in der eigenen Integrations-Präsentation zeigt: CCaaS-Plattformen, Genesys und Five9 und Avaya. Das verrät, für wen es gebaut wurde. Meine Aufschlüsselung zu Retell-AI-Preisen geht Komponente für Komponente durch, wenn Sie Ihre eigene Konfiguration modellieren wollen.
3. Vapi
Am besten für: Entwicklerteams, die jede Komponente im Stack selbst wählen wollen.
Vapi ist Infrastruktur, kein fertiges Produkt. Sie setzen den Transport und die Speech-to-Text-Komponente, das Modell, die Stimme, alles selbst zusammen, und Vapi berechnet $0,05 pro Minute für die Orchestrierung des Ergebnisses. Wenn es Sie reizt, um 3 Uhr morgens Deepgram gegen Assembly zu tauschen, ist das hier die richtige Wahl.

Diese Reihe von Anbieter-Chips ist das ganze Produkt in einem Screenshot. Jeder Chip ist auch eine eigene Position auf Ihrer Rechnung.
Was es tatsächlich tut
Squads und Workflows, Tool-Aufrufe, Observability, eine echte Evaluierungs-Suite. Bring-your-own-SIP über Vapis eigenen Trunk kostet nichts, was ein echter Kostenhebel ist. Zehn gleichzeitige Anrufe sind bereits enthalten, zusätzliche Leitungen kosten $10 im Monat pro Leitung.
Eine feste Deadline, die Sie kennen sollten: Der visuelle Workflows-Builder läuft am 19. August 2026 aus, in zwei Wochen. Vapis genannter Grund ist, dass aktuelle KI nicht zuverlässig als autonome Node-Graph-Agenten agieren kann, und dass Squads "consistently led to better results". Jeder Vapi-Support-Build von vor Mitte 2026 muss also jetzt migriert werden. Vapi weist auch darauf hin, dass die KI-gestützte Migration nicht garantiert korrekt oder vollständig ist.
Preise
| Komponente | Rate | Anmerkungen |
|---|---|---|
| Vapi-Orchestrierung | $0.05/min | Plus $0,005 pro SMS-Chat-Nachricht |
| Transport | Kostenlos bis $0.014/min | Vapi SIP und WebRTC kostenlos; Twilio-Outbound $0,014 |
| Speech-to-Text | $0.000631 bis $0.01733/min | Google am unteren, Speechmatics am oberen Ende |
| Text-to-Speech | $0.002 bis $0.24/min | Inworld am unteren, Tavus am oberen Ende |
| LLM | $0.01 bis $2.12 pro 1 Mio. | 4.1-mini am unteren, 4.5 Preview am oberen Ende |
| HIPAA | $2.000/Monat | Zero Data Retention kostet zusätzlich $1.000/Monat |
Setzen Sie etwas Realistisches zusammen, Vapi plus Twilio Inbound plus Deepgram plus ElevenLabs plus ein günstiges Modell, kommen Sie auf rund $0,105/min. Das sind $0,63 für einen sechsminütigen Anruf. Bemerkenswert außerdem: Vapis eigene Gebühr macht 48% einer realistischen Minute und 91% der günstigsten möglichen aus. Enterprise-Konditionen starten bei 400.000 Minuten im Jahr.
Vorteile
- Volle Kontrolle über jede Komponente, und eine veröffentlichte Preisliste für jede einzelne.
- Transport ist kostenlos auf Vapi SIP oder WebRTC.
- Die günstigste Untergrenze im Vergleich, rund $0,055/min, wenn man stark darauf optimiert.
- Observability- und Evaluierungs-Tooling, das tatsächlich gut ist.
Nachteile
- Tests werden zu Produktionsraten abgerechnet. Direkt aus Vapis eigener FAQ: "Is testing free? No, test calls cost you the same as regular calls."
- Die Wissensdatenbank ist nur Datei-Upload, das Retrieval läuft nur über Gemini, es gibt keinen Hilfe-Center-Crawl, und das empfohlene Limit liegt unter 300KB pro Datei.
- Null Ticketing-Integrationen im Tool-Katalog. Ein Ticket zu lesen oder zu schreiben ist ein
apiRequest, den Sie selbst bauen. - Nach Vapis eigener Methodikseite schließt die "unter 500ms Latenz"-Aussage Endpointing und Transport aus, und dieselbe Seite räumt ein, dass Endpointing einen erheblichen Anteil der Verzögerung ausmachen kann.
Unsere Einschätzung: die richtige Wahl, wenn Sie Entwickler haben und die günstigste Untergrenze wollen. Die falsche, wenn Sie etwas wollen, das nächste Woche Anrufe beantwortet. In jedem Fall: Erledigen Sie die Workflows-Migration vor der Deadline im August. Mehr zur Struktur der Plattform gibt es in meinem Vapi-Review.
4. PolyAI
Am besten für: ein etabliertes Contact Center, das bereits Genesys, Avaya oder Amazon Connect betreibt.
PolyAI verkauft an Contact Center, nicht an Entwickler, und die Integrationsliste ist der Hinweis. Genesys, Avaya, Amazon Connect, Twilio, Five9, NICE, Talkdesk, Cisco, RingCentral, Zendesk Talk: alles unterstützt. Es reiht sich also in eine Landschaft ein, die Sie bereits besitzen, statt Sie zum Ersetzen aufzufordern.

Die Vorlagenliste sagt viel darüber aus, für wen das gedacht ist. "Handle call transfers to a human agent" erscheint als Startvorlage statt als Fortgeschrittenen-Thema. Der richtige Instinkt.
Was es tatsächlich tut
Agent Studio ist die Bauoberfläche, mit einem Self-Serve-Einstiegspunkt unter studio.poly.ai. Die auf der ganzen Website veröffentlichten Deployment-Zeiträume reichen von unter zehn Minuten für Self-Serve bis zu rund acht Wochen für ein Amazon-Connect-Rollout, nehmen Sie die schnelle Zahl also mit Vorsicht. Die Sprachunterstützung liegt bei 42 oder 45, je nachdem, welche PolyAI-Seite Sie gerade lesen.
Die Sicherheitsaufstellung ist hier am besten dokumentiert, und ungewöhnlicherweise nicht tarifabhängig. SOC 2 Type 2, ISO 27001, PCI DSS, DSGVO und HIPAA werden alle als Standard beschrieben und "in die Architektur eingebaut", mit AWS-FTR-Zertifizierung auch auf der Amazon-Connect-Partnerseite. Jedes Bezahl-Deployment beinhaltet zudem ein 99,9%-Uptime-SLA für Telefonleitungen plus eine 24/7/365-Notfall-Support-Linie. Keine Randnotiz, wenn das, was Ihr Telefon beantwortet, um 2 Uhr nachts ausfällt.
Preise
Nicht veröffentlicht. Die Preisseite trägt den Titel "Simple pricing that scales" und verspricht eine transparente Struktur, zeigt dann aber ein Lead-Erfassungsformular gestaffelt nach Jahresanrufvolumen, von unter 10.000 bis über 1.000.000 Anrufen. Keine Dollarzahl erscheint irgendwo auf einer PolyAI-Seite. Auch kein Mindestengagement.
Zumindest ist die Abrechnungseinheit klar, in PolyAIs eigenen Worten: laufende Nutzung "is priced on a per-minute basis, which includes proactive performance improvements, maintenance and 24/7 support."
Vorteile
- Die tiefste CCaaS-Integrationsliste hier, passt also in eine bereits vorhandene Landschaft.
- Sicherheitszertifizierungen auf jeder Ebene statt hinter einem Enterprise-Tarif gesperrt.
- Der Minutenpreis beinhaltet ein 99,9%-Telefonleitungs-SLA und eine 24/7-Notfallleitung.
- Veröffentlichte Kundenergebnisse über eine breite Spanne von Deployments.
Nachteile
- Kein veröffentlichter Preis. Die Preisseite nennt sich selbst transparent und zeigt dann ein Formular.
- Containment-Zahlen streuen je nach Anwendungsfall stark: 70% der Gästeanrufe bei einer britischen Pub-Kette, dann 34% bei Golden-Nugget-Reservierungen und 30% bei einer unbenannten Retail-Bank. Restaurant-Zahlen sind kein fairer Maßstab für eine Support-Warteschlange.
- Die Website widerspricht sich zweimal, bei der Sprachenanzahl und beim Deployment-Zeitraum.
- Jede Kennzahl auf der Website ist ein clientseitig animierter Zähler, was die Zahlen schwer unabhängig zu überprüfen macht.
Unsere Einschätzung: wenn Sie bereits eine CCaaS-Plattform besitzen, ist PolyAI wahrscheinlich Ihr kürzester Weg zu einem funktionierenden Sprachagenten, und das enthaltene SLA rechtfertigt sich. Eine Sache, auf die Sie bestehen sollten: Containment-Zahlen aus einem Support-Deployment, nicht aus einem Reservierungs-Deployment. Die veröffentlichte Spanne zwischen den beiden ist mehr als doppelt so groß. Für Hintergrund zur Kategorie gibt es meinen Einstieg in Conversational AI für den Kundenservice.
5. Parloa
Am besten für: alle, die den Agenten gegen ihre eigene Anrufhistorie getestet sehen wollen, bevor er einen echten Anruf entgegennimmt.
Parloa ist der europäische Enterprise-Anbieter. Es hat im Januar 2026 350 Mio. US-Dollar bei einer Bewertung von 3 Mrd. US-Dollar eingesammelt und über 50 Mio. US-Dollar Jahresumsatz bei 150% Net Revenue Retention überschritten, mit insgesamt über 560 Mio. US-Dollar in unter vier Jahren eingesammeltem Kapital. Zu den Kunden zählen Allianz, Booking.com, IKEA und SAP.
Parloa veröffentlicht nirgendwo Produkt-Screenshots, was folgt ist also eine eigene Architektur-Folie statt ein Interface-Screenshot. Normalerweise werte ich das als Minuspunkt für einen Anbieter. In diesem Fall trifft die Folie zufällig genau den wichtigen Punkt.

Stufe zwei dieses Kreises ist "Testen und Iterieren", gleichrangig mit Deployment und Monitoring. Jeder andere Anbieter hier behandelt Testen als Feature. Parloa hat ein Unternehmen darum herum gebaut.
Was es tatsächlich tut
Die Simulationsumgebung ist der Grund, warum Parloa auf dieser Liste steht. Sie ist auch das einzige Feature in diesem gesamten Vergleich, das ich als echtes Differenzierungsmerkmal bezeichnen würde. Sie lässt tausende simulierte Gespräche über Szenarien, Sprachen, Kanäle und Grenzfälle laufen, und der entscheidende Teil ist, dass sie Ihre echten historischen Transkripte mit synthetischen Tests mischt, statt nur von Hand geschriebene Szenarien durchzuspielen. Sie testet Mehrdeutigkeit und Tool-Aufrufe, Fallback, Markenkonsistenz. Sie isoliert Teilaufgaben und wechselt zwischen Staging und Produktion.
Bewertungen laufen mit LLM-as-Judge und regelbasierten Kriterien beide, bei Aufgabenerfolg und Tonfall, Genauigkeit, API-Verhalten. Dann Root-Cause-Tracing, mit zeilengenauen Fix-Empfehlungen, die direkt in der Plattform angewendet werden. Das ist der Mechanismus, den ich mir bei jedem Anbieter hier wünschen würde. Es ist auch dasselbe Prinzip, das wir bei Text anwenden: ein Bot, der nur mit von Ihnen selbst erfundenen Fragen getestet wurde, lehrt Sie nichts Nützliches.
Integrationen decken Avaya, Five9, Genesys, NICE, Twilio, Verint, Salesforce, Dynamics, ServiceNow, Zendesk und SAP ab, plus SIP. Über 130 Sprachen in über 70 Ländern, wobei keine Liste irgendwo veröffentlicht ist. Die Angabe zur Datenresidenz kommt mit strengerer Formulierung als üblich, dass das Runtime-Routing die Verarbeitung während der Interaktion innerhalb der Jurisdiktion hält und nicht nur im Ruhezustand, aber das Detail steckt hinter einem zugangsbeschränkten Trust Center.
Preise
Nicht veröffentlicht, und die Preis-URL liefert einen 404-Fehler. Das einzige echte Signal ist Parloas eigene FAQ, die ein "consumption-based pricing model that ties costs to task complexity and effort, not flat rates or token counts" beschreibt, angeboten nach Volumen, Anwendungsfällen und Geschäftswert. Kein Minimum veröffentlicht, kein kostenloser Tarif, kein Test.
Vorteile
- Das einzige Tool hier, das Ihre echte Anrufhistorie in der Simulation abspielt.
- Root-Cause-Tracing, mit Fixes, die direkt in der Plattform angewendet werden.
- Eine echte EU-Positionierung, aufgebaut auf Azure, mit Runtime-Routing innerhalb der Jurisdiktion.
- Zertifizierungen sind ISO 27001:2022, SOC 2 Type 1 und Type 2, und PCI DSS.
Nachteile
- Keine veröffentlichten Preise irgendeiner Art. Verbrauch "nach Aufgabenkomplexität" ist zudem die schwierigste Einheit hier, um sie vorauszuberechnen.
- HIPAA, DSGVO und DORA werden mit "aligns with" statt zertifiziert beschrieben. Das ist Parloas eigene Formulierung, und es lohnt sich, sie genau zu lesen.
- Die Kundenprozentzahlen auf der Startseite sind JS-animierte Zähler, die echten Zahlen stehen also auf den Case-Study-Seiten.
- Amazon Connect erscheint auf keiner veröffentlichten Parloa-Integrationsliste, gehen Sie also nicht davon aus.
Unsere Einschätzung: wenn Sie ein Enterprise-Käufer mit nur einer Frage an einen Anbieter sind, fragen Sie, ob dessen Simulation die eigenen Anrufe abspielt. Parloa ist hier der Anbieter, der mit Ja antwortet. Diese eine Fähigkeit ist mehr wert als ein Prozentpunkt Containment auf dem Benchmark eines anderen. Mein Parloa-Review enthält mehr zur Plattform, und Parloa-Preise deckt ab, was über die kommerzielle Seite bekannt ist.
6. Sierra
Am besten für: hochwertigen Support, bei dem eine Bezahlung pro Lösung besser ist als eine pro Minute.
Sierra hat im Mai 2026 950 Mio. US-Dollar bei einer Bewertung über 15 Mrd. US-Dollar eingesammelt und gibt an, mehr als 40% der Fortune-50-Unternehmen zu bedienen. Das Voice-Produkt beherrscht über 55 Sprachen mit Wechsel mitten im Gespräch, Modell-Routing pro Redebeitrag und kontexterhaltender Eskalation. Es nimmt auch Sprachzahlungen entgegen, Karte und ACH über DTMF-Töne, über Level-1-PCI-konforme Infrastruktur.

Das ist ein Demoanruf statt ein Konsolenscreenshot, und das ist das Meiste, was ich Ihnen zeigen kann. Jedes Visual auf Sierras Voice-Seite ist ein Videoposter, ohne einen vollständigen Produktscreenshot irgendwo veröffentlicht.
Sierra verdient auch für etwas anderes als sein Produkt eine Erwähnung. Es veröffentlicht die τ-Voice-Forschung, die diesen gesamten Beitrag neu gerahmt hat. Die eigenen Erkenntnisse: Die Spitze bewegte sich zwischen August 2025 und April 2026 von 30,4% auf 67,3% pass@1, gegenüber einer Text-Reasoning-Obergrenze von nahe 85%. Jeder Anbieter verliert 5 bis 14 Punkte bei realistischem Telefonaudio. Und 79% der ersten kritischen Fehler gehen auf den Agenten selbst zurück. Ein Anbieter, der die Zahlen veröffentlicht, die die eigene Kategorie schwierig aussehen lassen, ist ein gutes Zeichen.
Was es tatsächlich tut
Kommerziell ist Outcome-basierte Preisgestaltung das Besondere. Sierras eigene Formulierung ist "Pay for a job well done", mit der Einheit gekoppelt an "a resolved support conversation, a saved cancellation, an upsell, a cross-sell", und "if the conversation is unresolved, in most cases, there's no charge." Die kürzeste Version, die sie geben: "Sierra gets paid only when we complete a task for you."
Lesen Sie die Einschränkungen aber genau, denn sie sind das, was beim Vertragsabschluss zählt. Eskalationen bleiben "in den meisten Fällen" unberechnet, und die Ausnahmen sind nicht veröffentlicht. Die tatsächliche Rechnung ist gemischt, denn Sierra sagt: "routing or greeter-style interactions may align better with consumption-based pricing, where payment is based on conversation count, regardless of the outcome." Dann gibt es "gelöst", was hier keine einheitliche Definition hat. Die Kriterien werden pro Vertrag vereinbart.
Preise
Es gibt überhaupt keine Preisseite. sierra.ai/pricing liefert einen harten 404-Fehler, und keine Dollarzahl erscheint irgendwo: keine Pro-Outcome-Rate, keine Einrichtungsgebühr, kein Minimum, kein Test. Eine Plattformgebühr wird nie erwähnt. Sie wird auch nie verneint, gehen Sie also nicht davon aus, dass es keine gibt.
Vorteile
- Das Abrechnungsmodell passt zu dem, was Sie tatsächlich wollen, nämlich Lösungen statt Sendezeit.
- Die breiteste Zertifizierungsliste hier: SOC 2, ISO 27001, ISO 42001, HIPAA, DSGVO, EU AI Act und FedRAMP.
- Über 55 Sprachen, und es wechselt mitten im Gespräch.
- Veröffentlicht ehrliche Forschung über die Grenzen der eigenen Kategorie.
Nachteile
- Null veröffentlichte Preise, ein Vergleich mit irgendetwas bedeutet also, zuerst in einen Vertriebszyklus einzusteigen.
- Die Zertifizierungs-Badges tragen kein Audit-Datum, keine SOC-2-Type-I/II-Unterscheidung, kein FedRAMP-Autorisierungslevel.
- Genannte Voice-Kunden enden bei Rocket Mortgage, Guild und Next, und für keinen von ihnen ist eine Containment-, Lösungs- oder Bearbeitungszeitzahl veröffentlicht.
- Keine veröffentlichte Voice-Latenzzahl. Die 200ms-Zahl im τ-Voice-Beitrag ist die Audio-Chunk-Granularität des Benchmarks statt der Agenten-Antwortzeit, zitieren Sie sie also nicht als solche.
Unsere Einschätzung: Outcome-basierte Preise werden attraktiver, je schlechter Ihre Containment-Rate ist, und das ist eine clevere Ausrichtung. Gehen Sie nur mit dem Wissen in die Verhandlung, dass Sie diejenigen sind, die die abrechenbare Einheit definieren. Legen Sie schriftlich fest, welche Eskalationen zu den Ausnahmen von "in den meisten Fällen" zählen. Ich vertiefe das Modell in Sierra-AI-Preisen, und das Wettbewerbsumfeld in Sierra-Alternativen.
7. Bland AI
Am besten für: hohe Parallelität, oder ein Deployment, das in Ihrer eigenen Cloud sitzen muss.
Bland AI veröffentlicht hier die klarste Tarifstufenleiter, plus die höchste Parallelitätsobergrenze mit deutlichem Abstand. Sein Doku-Index nennt Enterprise-Unterstützung für "up to 1 million concurrent calls". Niemand sonst auf dieser Liste kommt in die Nähe dieser Zahl.

Das ist das klarste Bild dafür, was "Testen" in der gesamten Kategorie bedeutet. Das rechte Panel führt einen "Angry Caller"-Test mit 94% und ein "Happy Path"-Gate mit 100% aus. Beides sind von jemandem geschriebene Personas. Nützlich. Immer noch nicht Ihre Anrufhistorie.
Was es tatsächlich tut
Gesprächspfade, Tool- und API-Aufrufe, dann drei veröffentlichte Hosting-Haltungen: Bland Cloud, Ihre eigene VPC auf AWS, GCP oder Azure, oder vollständig On-Premises und Air-Gapped. Keine Dollarzahlen sind mit einer dieser Optionen verknüpft. Auch kein Aufpreis oder Minimum veröffentlicht, da sie alle im Enterprise-Vertrag stecken.
Neu seit meinem letzten Blick: eine echte Latenzzahl. Die Startseite nennt jetzt 400ms gegenüber einem behaupteten "Branchendurchschnitt" von 1.240ms, die Doku spricht von unter 400ms, und die Produktseite zeigt p50-Werte von 380ms und 365ms. Dieser Vergleich mit 1.240ms ist unbelegt. Behandeln Sie ihn als Marketing, nicht als Messung.
Eine Formulierungsfalle. Die Produktseite wirbt mit der Fähigkeit, "back-test against historical calls" durchzuführen, während der dokumentierte Scenarios-Mechanismus ein simulierter Anrufer ist, der einer von Ihnen geschriebenen Persona-Vorgabe folgt. Eine andere Garantie als die Wiedergabe Ihres eigenen Archivs, und es lohnt sich, direkt danach zu fragen.
Preise
| Start | Build | Scale | Enterprise | |
|---|---|---|---|---|
| Sprechzeit | $0.14/min | $0.12/min | $0.11/min | Individuell |
| Plattformgebühr | $0 | $299/Monat | $499/Monat | Vertraglich |
| Übergabezeit | $0.05/min | $0.04/min | $0.03/min | Individuell |
| Gleichzeitige Anrufe | 10 | 50 | 100 | Nach Volumen bemessen |
| Tägliches / stündliches Limit | 100 / 100 | 2.000 / 1.000 | 5.000 / 1.000 | Unbegrenzt |
| Wissensdatenbanken / Stimmen | 10 / 1 | 50 / 5 | 100 / 15 | Unbegrenzt |
| Uptime-SLA | 99,9% | 99,9% | 99,9% | 99,9% |
Die Umschlagpunkte sind gegenintuitiv genug, um sie zu kennen. Build übertrifft Start erst über 14.950 Minuten im Monat, und Scale übertrifft Build erst über 20.000. Unter etwa 15.000 Minuten ist der kostenlose Start-Tarif rechnerisch der günstigste. Sie upgraden hier für Parallelität, nicht für die Rate.
Vorteile
- Ein 99,9%-Uptime-SLA bei jedem Tarif, den kostenlosen eingeschlossen, was niemand sonst hier macht.
- Self-Hosting in der eigenen VPC, oder Air-Gapped On-Premises, ist eine veröffentlichte Option.
- Die Parallelitätsobergrenze ist die höchste im Vergleich.
- Eigenen Trunk mitbringen und die Übergabeminuten-Gebühr entfällt komplett.
Nachteile
- Das Integrationsverzeichnis hat 19 Konnektoren über 7 Kategorien und null Helpdesk- oder Ticketing-Systeme, trotz Produkttexten, die Ticketing-Unterstützung behaupten. Einen Anruf in Zendesk oder Front zu bekommen, bedeutet ein individuelles Tool oder einen selbst gebauten Post-Call-Webhook.
- Warme Übergabe ist nur Enterprise, und die Doku legt diese Sperre offen fest. Self-Serve-Deployments sind nur-kalte-Übergabe, ohne Antwortzitate.
- Zitate und Wissensdatenbank-Lückenberichte, Outcomes, Guardrails, Alerts, SMS, Webchat, die BAA: alles auch nur Enterprise.
- Die Preisseite sagt, Telefonie wird separat zu Durchleitungskosten abgerechnet. Die FAQ auf der Startseite und die Doku sagen, der Minutenpreis deckt es ab. Lassen Sie sich das schriftlich geben.
Unsere Einschätzung: Bland ist eine Voice-Plattform statt ein Support-Produkt, und ihre Vorzeigebeispiele sind umsatzgenerierend statt kostensparend. Wählen Sie es für Parallelität, oder für eine Hosting-Anforderung, bei der Ihr Sicherheitsteam nicht nachgibt. Kaufen Sie es, um Support-Anrufe zu beantworten? Kalkulieren Sie von Anfang an mit dem Enterprise-Tarif, denn die Funktionen, die Sie brauchen, leben alle dort. Und wenn die Ticketbearbeitung das eigentliche Ziel ist, passt eines der Support-Automatisierungs-Tools in meinem breiteren Vergleich besser.
8. Synthflow
Am besten für: einen Freshworks-Betrieb, der seine Sprach-KI in Freshcaller haben will.

Bevor es losgeht, ein Blick auf diese geöffnete Schublade, denn sie ist der nützlichste Screenshot in diesem gesamten Beitrag. Sie zeigt eine echte Wissensdatenbank-Abfrage mitten im Anruf. Der Anrufer sagte "I have but I I would like to know how to use the product", der Agent formte daraus eine Suche, und zurück kamen 7 Ergebnisse in 756ms bei einem besten Ähnlichkeitswert von 0,80, gegenüber einem similarity_threshold von 0. Dieser Schwellenwert ist der Regler, der entscheidet, ob Ihr Agent aus einer schwachen Übereinstimmung antwortet oder zugibt, es nicht zu wissen. Kaum ein Anbieter zeigt Ihnen das.
Alle beschreiben Synthflow immer noch als den einfachen No-Code-Einstieg. Seit diesem Monat ist das überholt. Die Self-Serve-Leiter ist verschwunden, und die Doku bestätigt es: die früheren Pro-, Growth- und Agency-Tarife "are no longer available for new subscriptions and remain supported for existing customers." Was bleibt, ist ein einstufiges, vertriebsgeführtes Enterprise-Produkt.
Was es tatsächlich tut
Übergabe an einen Menschen ist hier die stärkste Support-Funktion, in drei Modi: kalt, warm mit einer Nachricht, warm mit einer Zusammenfassung. Es gibt Menschenerkennung mit einem Timeout von 30 Sekunden bis 30 Minuten, Anrufscreening, einen Geschäftszeitenplan. Die Doku ist auch auf eine Art unverblümt, die ich schätze: "cold transfers cannot recover from failures."
Wissensquellen sind PDFs, eingegebene Dokumente, einzelne URLs, öffentliche Website-Crawls und ein Zendesk-Hilfe-Center-Import. Keine authentifizierten Quellen, keine Übernahme vergangener Tickets, und kein manuelles Dokumenten-Ranking. Bei den Integrationen löst sich die Behauptung "200+" in rund 15 dokumentierte Konnektoren auf, und die eine tiefe Support-Stack-Integration darunter ist Freshworks: Sprach-KI läuft innerhalb von Freshcaller, mit 65% automatisierten routinemäßigen Sprachanfragen. Das ist der Grund, es zu kaufen.
Die Abrechnungsdetails werden weit präziser veröffentlicht als die Raten, eine ungewöhnliche Kombination, aber eine nützliche. Abgerechnet wird pro Sekunde und über Anrufe hinweg aggregiert, sodass 125 Sekunden Anrufe auf 2 abrechenbare Minuten kommen statt auf 4. Eine erfolgreiche Übergabe stoppt den Zähler. Ein no-answer oder ein Voicemail-Auflegen wird pauschal mit 5 Sekunden abgerechnet. Chat rechnet sich zu 5 KI-Nachrichten pro Voice-Minute um. Und Test-Center-Simulationen können abrechenbar sein.
Preise
| Tarif | Monatlich | Enthaltene Minuten | Überschreitung | Gleichzeitige Anrufe |
|---|---|---|---|---|
| Enterprise (der einzige verkaufte Tarif) | Kein Listenpreis; Verträge starten bei $30.000/Jahr, etwa $2.500/Monat | Nicht veröffentlicht, vertragsabhängig | Individuell, je nach Vertrag | "Vertraglich mit Synthflow festgelegt" |
| Pro / Growth / Agency (Legacy) | Für Neukunden geschlossen | Nur im eigenen Konto | Nur im eigenen Konto | In Ihren Kontobedingungen angezeigt |
| Kostenloser Test | Kein Self-Serve-Checkout. Beide CTAs führen zum Vertriebskontakt | n/a | n/a | n/a |
Effektive Kosten pro enthaltener Minute sind bei jedem Tarif nicht berechenbar, da Synthflow nie einen Preis und ein Minutenkontingent in derselben Zeile veröffentlicht. Die einzige belastbare öffentliche Zahl ist dieser $2.500-pro-Monat-Äquivalent-Mindestpreis, dem ein Kontingent gegenübersteht, das niemand außerhalb des Vertrags kennt. Jede noch kursierende Pro-Minute-Zahl geht auf die abgeschaffte Preisleiter zurück.
Vorteile
- Drei unterschiedliche Übergabemodi. Warm mit einer Zusammenfassung ist der, der dem Menschen tatsächlich hilft.
- Pro-Sekunde-Abrechnung, über Anrufe aggregiert, ist die fairste Messung hier.
- Eine erfolgreiche Übergabe stoppt den Zähler.
- Eine tiefe Freshworks-Integration, mit einer veröffentlichten Automatisierungsquote von 65% für routinemäßige Sprachanfragen.
Nachteile
- Dieser $30.000/Jahr-Mindestpreis macht es bei jedem Volumen unter etwa 20.000 Minuten im Monat zur teuersten Option hier.
- Es gibt bei keinem Tarif mehr eine veröffentlichte Parallelitätszahl.
- Ein HIPAA-Widerspruch auf der eigenen Website. Die Startseite behauptet Zertifizierung nach SOC 2, HIPAA, PCI DSS und DSGVO, während die Compliance-Zeile der Enterprise-Doku nur SOC 2, DSGVO und ISO 27001 listet. Gehen Sie nicht von einer BAA aus.
- Latenz ist ein Ziel und keine Messung, formuliert als "we aim for" unter 100ms Round-Trip. Reselling entfällt am 15. September 2026, und EU-Telefonieserver kommen "sehr bald".
Unsere Einschätzung: der No-Code-Ruf passt nicht mehr zur Preisliste, ignorieren Sie also jeden Vergleich, der das immer noch die günstige Einstiegsoption nennt, einschließlich unserer eigenen älteren. Nutzen Sie Freshworks, ist es ein starker, nativer Fit. Andernfalls ist die Freshcaller-Integration das Hauptargument, für das Sie diesen Mindestpreis zahlen würden, und ein allgemeines Tool zur Kundenservice-Automatisierung kostet weit weniger.
9. Grok Voice Agent Builder
Am besten für: das schnellste wirklich fähige Modell, wenn die Session-Limits Sie nicht ausbremsen.
xAIs Grok Voice Agent Builder läuft auf Grok Voice Think Fast 2.0, das die τ-Voice-Tabelle mit 56,5% anführt und in 0,70 Sekunden antwortet. Diese Kombination ist der gesamte Pitch. Auf dem Benchmark hält sie sich.
Es gibt keinen Produktscreenshot in diesem Abschnitt, weil xAI keinen veröffentlicht, und die Dokumentations-URLs des Voice Agent Builders liefern derzeit einen 404-Fehler. Was xAI veröffentlicht, ist eine heute wirksame Preisänderung. Wenn Sie bereits Grok Voice in Produktion nutzen, ist das die folgenreichste Sache auf dieser Seite.

Was es tatsächlich tut
Es ist leitungskompatibel mit der OpenAI-Realtime-API unter wss://api.x.ai/v1/realtime, die Migration eines bestehenden Realtime-Builds ist also meist nur eine URL-Änderung. Tools decken Funktionen, Dateisuche, Websuche, X-Suche und MCP ab. Die Compliance-geformten Erweiterungen sind der nützliche Teil: force_message spricht eine wortgetreue Zeile für Offenlegungen, replace bildet Aussprachen ab, ohne das Transkript zu ändern, keyterms nimmt bis zu 100 Begriffe mit je 50 Zeichen, resumption spielt Redebeiträge bei Wiederverbindung erneut ab. Eine bereitgestellte Telefonnummer kostet zusätzlich $0,01 pro Minute.
Erwähnenswert auf der Genauigkeitsseite: Die Transkription ist 1,4-mal besser bei der Wortfehlerrate als Version 1.0, 1,5- bis 2,0-mal besser als Deepgram Nova 3 und ElevenLabs Scribe v2 über 24 Sprachen, und rund 10-mal besser bei verrauschtem Telefonieaudio. Hintergrundgeräusche und Akzente sind genau das, was Betreiber als Ursache für kaputte Agenten melden, diese Zahl ist also relevanter für Sie als der Benchmark-Richtwert.
Preise
| Position | Rate |
|---|---|
| Grok Voice Think Fast 2.0 | $0.08/min ($4.80/Std.) |
| Grok Voice Think Fast 1.0 | $0.05/min ($3.00/Std.) |
| Text-Eingabe | $0.004 pro Konversationselement |
| Bereitgestellte Telefonnummer | +$0.01/min |
web_search / x_search | $5 pro 1.000 Aufrufe |
file_search (Kollektionen) | $2.50 pro 1.000 |
attachment_search | $10 pro 1.000 |
Heute ist der Tag, an dem das teurer wurde. Am 5. August 2026 leitet der grok-voice-latest-Alias von 1.0 auf 2.0 um, sodass der Standardpfad 60% mehr pro Minute kostet, ohne dass Sie etwas deployen müssen. Die alte Version zu pinnen ist Ihr Opt-out. Diese Umstellung hat auch Groks 37,5%-Preisvorteil gegenüber ElevenLabs beseitigt, denn $0,08 ist exakt ElevenLabs' effektive Rate pro enthaltener Minute. Was bleibt, ist die Abrechnungsform statt der Preis. Grok ist Pay-as-you-go, ElevenLabs-Minuten werden im Voraus bezahlt, Grok gewinnt also weiterhin bei spitzem oder geringem Volumen.
Vorteile
- Spitze der τ-Voice-Tabelle bei der Erledigung von Support-Aufgaben, mit 56,5%.
- Drittschnellste Zeit bis zum ersten Audio mit 0,70 Sekunden, was die beste Kombination aus Geschwindigkeit und Fähigkeit ist.
- Die Abrechnung ist flach pro Minute, gemessene Kosten pro Stunde Eingangsaudio entsprechen also exakt dem Listenpreis.
- Starke Transkription bei Telefonieaudio, rund 10-mal besser unter verrauschten Bedingungen.
Nachteile
- 10 gleichzeitige Sessions pro Team standardmäßig. Für eine Support-Leitung ist das eine harte Obergrenze, und eine Erhöhung erfordert eine Anfrage.
- Kein Mengenrabatt und keine Priority-Tarifstufe bei Voice, es gibt also weder einen Rabatt noch eine Bezahl-Überholspur. Nur
us-east-1, und eine maximale Session-Dauer von 120 Minuten. - Keine Helpdesk-Integrationen. Auch keine veröffentlichten Sicherheitszertifizierungen für das Voice-Produkt.
- Speicher wird separat abgerechnet, wenn der Agent Retrieval durchführt, $0,10/GiB/Tag für Kollektionen.
Unsere Einschätzung: das fähigste Modell hier, verpackt in das am wenigsten support-förmige Produkt. Zehn gleichzeitige Sessions ist die Zahl, die entscheidet. Wenn Ihre Spitze darüber liegt und niemand die Obergrenze angehoben hat, ist das ein Prototyp statt einer produktiven Support-Leitung, egal wie gut der Benchmark aussieht. Ich habe das Modell ausführlich behandelt in Grok Voice Think Fast 2, und die neuen Raten in der zugehörigen Preisaufschlüsselung.
Wohin die andere Hälfte Ihrer Anrufe tatsächlich geht
Jedes der oben genannten Tools wird übergeben. Kein Defekt, nur Rechnung. Das beste Modell löst 56,5% der Support-Szenarien in einem Benchmark, und Betreiber berichten von 15% bis 30% in der Produktion, während die durchschnittliche Netto-First-Level-Lösungsrate über Helpdesks hinweg generell bei rund 74,3% liegt, mit nur 1,4% der Helpdesks über 95%. Irgendetwas erreicht immer einen Menschen. Deshalb ist First Contact Resolution ein besseres Ziel als Containment.

Das Fehlerbild, von dem ich am häufigsten höre, hat nichts mit dem Bot-Gespräch zu tun. Es passiert an der Nahtstelle:
"AHT question nobody wants to answer lol. shipped a billing/tracking bot, decent containment, but AHT on escalated calls went up. agents had to read the transcript, figure out what the bot already tried, re-ask half of it anyway. fixed by forcing a structured handoff summary instead of raw transcript dump (saved more time than the automation itself). CSAT fine on deflected stuff, tanked on anything that bounced back after a failed bot attempt"
Lesen Sie diesen letzten Satzteil zweimal. Containment sah gut aus, die Bearbeitungszeit bei eskalierten Anrufen stieg an, und die Zufriedenheit brach speziell bei den Rückläufern ein. Ein Sprach-Deployment kann also im Dashboard gewinnen und bei genau den Kunden verlieren, die Sie am meisten brauchten. Das ist das Argument dafür, CSAT danach segmentiert zu verfolgen, ob die KI den Kontakt zuerst berührt hat.
Hier die unverblümte Version desselben Punkts, von einem Contact-Center-Betreiber, gefragt, wie viel seines Centers tatsächlich automatisiert ist:
"15% roughly....people quoting any higher are lying or dont understand "fully handled". AI solutions are not mature or too fragmented at the moment to go any higher."
Andere Antworten in diesem Thread setzen die Spanne bei 10% bis 30%, je nach Journey-Design. 15% ist also das pessimistische Ende einer echten Spanne statt eines einzelnen Zynikers. Wie auch immer, es ist nirgendwo nahe an 95%.
Dann gibt es einen Preis, den das Containment-Dashboard überhaupt nicht sehen kann. Was passiert, wenn der Agent laut und selbstbewusst falsch liegt:
"If it's anything like talking to ChatGPT via voice they'd definitely notice. And if it has anything like the failure modes it does, the OP's brother is going to eat into a lot of the cost savings he'd get (vs using a human receptionist or even an outsourced receptionist) dealing with fires like the AI said my car would absolutely be done today."
So sollte man über KI-Halluzinationen auf einer Telefonleitung denken. In Text ist eine falsche Antwort eine Nachricht, die man korrigieren kann. Laut ausgesprochen ist sie ein Versprechen, das der Kunde gehört hat, und die Aufräumarbeit wird ein separater Kontakt, für den Sie auch bezahlen.
Was ich tatsächlich tun würde
Drei Dinge, in dieser Reihenfolge. Keines davon ist "die höchste Containment-Zahl kaufen".
Erstens, das Volumen reduzieren, das nie einen Anruf gebraucht hätte. Bestellstatus, Passwort-Resets, Öffnungszeiten. Das ist Tier-1-Deflection-Arbeit, und in Text ist es pro Interaktion günstiger und genauer beim gleichen Modell. Wobei, wenn der Anrufer bereits an Ihrem Hilfe-Center gescheitert ist, kommt das Reparieren des Hilfe-Centers zuerst. Das ist ein Self-Service-Problem, keines der Sprache.
Zweitens, die Nahtstelle reparieren, bevor Sie die Stimme feinjustieren. Im obigen Zitat schlug eine strukturierte Übergabezusammenfassung die Automatisierung selbst an eingesparter Zeit. Dasselbe Prinzip, das wir bei Chat-Eskalation anwenden: der Mensch, der sie entgegennimmt, braucht eine Zusammenfassung und ein Vertrauenssignal, kein Transkript.
Drittens, davon ausgehen, dass der übergebene Anruf zu einem Ticket wird, denn das passiert meistens. Der Anrufer legt auf und schreibt Ihnen eine E-Mail, oder der Agent schreibt danach Notizen. Ein Detail aus unseren eigenen Kundengesprächen ist mir hier hängen geblieben, von einem Team, das eine gemischte Telefon- und E-Mail-Warteschlange betreibt: Nichts von ihren Anrufen erreichte ihre KI überhaupt, weil Sprachaufnahmen nie ins System gelangten und Mitarbeitende jeden Anruf von Hand zusammenfassten.
"For calls we just write a quick summary in the ticket after, so the AI never really sees any of that."
Support-Leitung bei einem mittelgroßen B2B-SaaS-Unternehmen mit einer gemischten Telefon- und E-Mail-Warteschlange auf Zendesk, etwa 3.000 Tickets im Monat
Das ist die Lücke, die niemand einpreist. Sie kaufen einen Sprachagenten, um das Telefon zu bedienen, und dann wird die Hälfte, die er nicht bewältigen kann, zu Textarbeit, innerhalb eines Systems, das der Sprachagent überhaupt nicht sehen kann.
Testen Sie eesel für die Hälfte, die Ihr Sprachagent übergibt
Lassen Sie mich direkt sein: eesel macht keine Sprache. Es gibt kein eesel-Telefonprodukt. Wenn Sie etwas brauchen, das eine klingelnde Leitung beantwortet, kaufen Sie eines der neun oben.
Was eesel tut, ist die Hälfte, die anschließend in Ihrem Helpdesk landet, und es startet von einem anderen Punkt als jedes Sprach-Tool hier. Schauen Sie sich noch einmal die Vergleichstabelle an. Acht der neun trainieren auf einem Website-Crawl plus hochgeladenen Dateien, und genau eines kann Ihre eigene Gesprächshistorie abspielen. eesels KI-Helpdesk-Agent trainiert auf Ihren vergangenen Tickets, simuliert dann gegen sie, bevor er live irgendetwas beantwortet, sodass Sie seine Genauigkeit auf Ihrem eigenen historischen Volumen sehen statt auf von jemandem erfundenen Szenarien. Dieselbe Disziplin, für die Parloa Enterprise-Geld verlangt, angewendet auf den Text-Kanal.

Wir haben es so gebaut, wegen einer Narbe. Ich habe zugesehen, wie ein selbstbewusst klingender Bot Produktbehauptungen erfunden und an echte Kunden geschickt hat, und deshalb geht hier nichts live, ohne zuerst einen Testlauf über historische Tickets. Es ist auch, warum eine Support-Leitung, die uns evaluiert hat, die Anforderung so formulierte, dass sie einen Agenten wollte, der "only handle tickets it's confident to handle" statt einen, der alles beantwortet.
Ergebnisse statt Versprechen: Gridwise hat im ersten Monat 73% der Tier-1-Anfragen gelöst bekommen. Bei den Kosten hat mein Kollege Riell es klar formuliert, als wir von Flat-Pricing weggewechselt sind, dass ein Team, das $799 pro Monat pauschal bezahlt hätte, jetzt nutzungsbasiert etwa $200 zahlt.
Wenn Sie auf der Suche nach Sprache sind, geht die ehrliche Reihenfolge so. Reduzieren Sie zuerst das wiederkehrende Volumen in Text. Kaufen Sie den Sprachagenten für das, was übrig bleibt. Stellen Sie dann sicher, dass die Tickets, die er erzeugt, dort landen, wo Ihre Historie bereits bekannt ist.
Die Einrichtung dauert Minuten, nicht die zwei bis acht Wochen, die die Enterprise-Sprachanbieter nennen. Sie deckt auch mehr Helpdesks ab als jede Sprachplattform auf dieser Seite, einschließlich Zendesk und Freshdesk, Gorgias und Front. Sie können eesel kostenlos testen.
Häufig gestellte Fragen
Was ist die beste KI für Sprachsupport im Kundenservice 2026?
Wie viel kostet KI-Sprachsupport im Kundenservice pro Minute?
Kann KI Support-Anrufe tatsächlich eigenständig lösen?
Ist Sprach-KI oder Chat-KI besser für den Kundenservice?
Worauf sollte ich bei der Wahl von KI für Sprachsupport im Kundenservice achten?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








