Gemini 3.8 Flash TTS Preise: Was eine Stunde KI-Stimme wirklich kostet

Rama Adi Nugraha
Geschrieben von

Rama Adi Nugraha

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet September 23, 2026

Expertengeprüft
Illustration von Schallwellen und Preisschildern als Symbol für die Gemini 3.8 Flash TTS Preise

Was Gemini 3.8 Flash TTS eigentlich ist

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) ist Googles aktuelles Text-zu-Sprache-Modell, und anders als viele der kursierenden Audio-Modelle ist es stabil statt Preview. Die ID trägt kein -preview-Suffix, und Google führt es als empfohlenen Ersatz für das ältere gemini-3.1-flash-tts-preview auf. Es nimmt Text entgegen und erzeugt Audio, nichts weiter — genau das, was man von einem dedizierten Sprachmodell erwartet.

Das Leistungsspektrum ist großzügig. Du bekommst 30 vorgefertigte Studio-Stimmen (Zephyr, Puck, Kore, Fenrir und Co.), jeweils mit einem Deskriptor wie Bright oder Firm, plus eine Extended Voice Library mit Hunderten weiteren, die du per client.voices.list() abrufen kannst. Es spricht 130 Sprachen mit automatischer Spracherkennung, und du kannst Stil, Akzent, Tempo und Tonfall mit natürlichsprachlichen Prompts steuern oder Inline-Tags wie <laugh> und <sigh> für punktuelle stimmliche Ereignisse einfügen. Außerdem gibt es Voice Design (eine Persona aus einer Textbeschreibung erstellen) und Voice Cloning aus einem Referenzclip.

Das eine Detail, das in der Praxis zuschlägt: Multi-Speaker ist auf zwei Sprecher pro Anfrage begrenzt. Ein Podcast mit drei Personen oder eine Gruppenszene bedeutet, jeden Redebeitrag einzeln zu synthetisieren und das Audio selbst zusammenzuschneiden. Der Output liegt standardmäßig als 24-kHz-Mono-WAV vor, mulaw und alaw stehen für Telefonie zur Verfügung. Das Ganze läuft neben dem reinen Textmodell Gemini 3.8 Flash, und beide werden völlig unterschiedlich abgerechnet — genau dort entsteht die meiste Verwirrung.

Gemini 3.8 Flash TTS Preise: die vollständige Tabelle

Hier sind alle Tarifstufen, in USD pro 1 Mio. Token, zu den Einführungspreisen von 2026. Der Satz für 2027 steht in Klammern, denn wie gleich erklärt wird, verdoppelt sich alles.

StufeText-Input / 1 Mio.Audio-Output / 1 Mio.Hinweise
Standard0,50 $ (1,00 $)9,00 $ (18,00 $)Der Standardsatz
Batch0,25 $ (0,50 $)4,50 $ (9,00 $)~50 % Rabatt, asynchrone Jobs
Flex0,25 $ (0,50 $)4,50 $ (9,00 $)Gleicher Satz, günstigeres Caching
Priority0,90 $ (1,80 $)16,20 $ (32,40 $)~1,8x, latenzkritisch
FreeKostenlosKostenlosStandard/Priority über AI Studio

All das stammt direkt von Googles Gemini-API-Preisseite. Context Caching wird unterstützt und startet bei 0,125 $ pro 1 Mio. Input-Caching-Token auf der Standardstufe, zuzüglich einer Speichergebühr von 0,50 $ pro 1 Mio. pro Stunde. Die Audio-Output-Zahl ist die entscheidende, weil sie sich mit der Menge der erzeugten Sprache skaliert. Der Text-Input ist im Vergleich fast ein Rundungsfehler.

Interessant ist, wo sich die 9,00 $ in Googles eigenem Angebot einordnen. Das Modell ist günstiger als das abgelöste Gemini 2.5 Flash TTS (10 $ Audio-Output) und weniger als halb so teuer wie die Preview-Modelle 2.5 Pro und 3.1 Flash TTS (20 $ Audio-Output). Es gibt außerdem ein günstigeres Geschwistermodell, Flash-Lite TTS, für 6 $ Audio-Output, wenn du mit 101 statt 130 Sprachen leben kannst.

Balkendiagramm zum Vergleich der Audio-Output-Kosten pro 1 Mio. Token über verschiedene Gemini-Text-zu-Sprache-Modelle, 3.8 Flash TTS mit 9 $ hervorgehoben
Balkendiagramm zum Vergleich der Audio-Output-Kosten pro 1 Mio. Token über verschiedene Gemini-Text-zu-Sprache-Modelle, 3.8 Flash TTS mit 9 $ hervorgehoben

Was das konkret kostet

Preise pro Token sind schwer greifbar, also rechnen wir sie in echtes Geld um. Audio wird mit 25 Token pro Sekunde abgerechnet, das ergibt 1.500 Token pro Minute und 90.000 Token pro Stunde. Beim Standardsatz 2026 von 9,00 $ pro 1 Mio. kostet eine Stunde generierte Sprache rund 0,81 $. Rechnet man den eingespeisten Text dazu (eine volle Stunde Erzähltext sind nur rund 12.000 Input-Token), kommt kaum ein Cent hinzu.

Pipeline zeigt, wie 25 Audio-Token pro Sekunde zu 1.500 pro Minute werden, 0,0135 $ pro Minute und rund 0,81 $ pro Stunde zum Standardsatz 2026
Pipeline zeigt, wie 25 Audio-Token pro Sekunde zu 1.500 pro Minute werden, 0,0135 $ pro Minute und rund 0,81 $ pro Stunde zum Standardsatz 2026

Ein paar Beispielrechnungen zum Standardsatz:

  • Eine 30-minütige Podcast-Folge: rund 0,41 $ an Audiokosten.
  • Ein 8-stündiges Hörbuch: rund 6,48 $.
  • 10.000 Support-IVR-Ansagen mit je 15 Sekunden: 3,75 Mio. Audio-Token, also rund 33,75 $.

Führst du eines davon als nächtlichen Batch-Job aus, halbierst du das, womit das Hörbuch näher an 3,24 $ liegt. Bei hohem Volumen und nicht-interaktiver Generierung ist Batch die naheliegende Wahl. Der einzige Ort, an dem der reine Preis nicht die ganze Geschichte erzählt, ist alles, worauf ein Mensch in Echtzeit wartet — dort zahlst du den Priority-Satz und trägst eine Latenz, die du nicht vollständig kontrollieren kannst.

Der Haken: Preise verdoppeln sich am 1. Januar 2027

Das ist der Teil für den Klebezettel. Die Werte 0,50 $ und 9,00 $ sind einführende Aktionspreise. Am 1. Januar 2027 steigt der Standard-Text-Input auf 1,00 $ pro 1 Mio. und der Audio-Output auf 18,00 $ pro 1 Mio. Jede andere Stufe verdoppelt sich im Gleichschritt: Batch- und Flex-Audio-Output auf 9,00 $, Priority-Audio-Output auf 32,40 $.

Vorher-Nachher-Vergleich: Gemini 3.8 Flash TTS Standardsätze verdoppeln sich von 9 $ auf 18 $ Audio-Output und von 0,50 $ auf 1,00 $ Text-Input am 1. Januar 2027
Vorher-Nachher-Vergleich: Gemini 3.8 Flash TTS Standardsätze verdoppeln sich von 9 $ auf 18 $ Audio-Output und von 0,50 $ auf 1,00 $ Text-Input am 1. Januar 2027

Aus der 0,81-$-Audiostunde werden 2027 also rund 1,62 $, und das 8-stündige Hörbuch steigt von 6,48 $ auf 12,96 $. Es ist derselbe Schritt, den Google schon bei den Textmodellen gemacht hat, und fair, solange man ihn kommen sieht. Wenn du über dieses Jahr hinaus budgetierst, verdopple die Zahlen aus diesem Beitrag und plane von dort aus. Das ist auch ein Anstoß, jetzt Caching- und Batch-Ersparnisse zu sichern, wo es geht.

Der Vergleich mit ElevenLabs, OpenAI und dem Rest

Sprachmodelle zu vergleichen ist wirklich knifflig, weil die Anbieter nicht gleich abrechnen. Amazon, Azure und Deepgram berechnen pro Zeichen Eingabetext. OpenAI und Google berechnen pro Audio-Output-Token, was sich mit der Länge der generierten Sprache skaliert, nicht mit dem Skript. ElevenLabs verkauft Abo-Credits. Um alle auf eine Achse zu bringen, habe ich alles auf geschätzte Kosten pro Stunde Sprache umgerechnet, mit Amazons eigenem Richtwert, dass 1 Mio. Zeichen rund 23 Stunden Audio entsprechen. Die Pro-Stunde-Werte sind Schätzungen, keine Vertragskonditionen, weil sie sich mit dem Sprechtempo verschieben.

AnbieterFlaggschiff-ModellNativer Preis~ $/Stunde AudioKostenlose Stufe
Gemini 3.8 Flash TTSgemini-3.8-flash-tts9 $ / 1 Mio. Audio-Token~0,81 $Kostenlos in AI Studio
Amazon Polly (Neural)Neural16 $ / 1 Mio. Zeichen~0,70 $1 Mio. Zeichen/Monat (12 Monate)
Azure AI SpeechNeural / HD Flash15 $ / 1 Mio. Zeichen~0,65 $0,5 Mio. Zeichen/Monat
OpenAIgpt-4o-mini-tts12 $ / 1 Mio. Audio-Token~0,90 $Keine
Amazon Polly (Generative)Generative30 $ / 1 Mio. Zeichen~1,30 $100k Zeichen/Monat
DeepgramAura-230 $ / 1 Mio. Zeichen~1,30 $200 $ Guthaben
ElevenLabsEleven v3 / Flash~5c/min (Business)~3,00 $10k Credits/Monat

Das Überraschendste dabei: Gemini 3.8 Flash TTS ist wie eine handelsübliche neuronale Stimme bepreist, obwohl es eines der ausdrucksstärkeren generativen Modelle ist. Die günstigeren Zeilen von Amazon und Azure sind ihre älteren neuronalen Stimmen; ihre generative Qualitätsstufe (Polly Generative) liegt bei 1,30 $ pro Stunde, und Deepgrams Flaggschiff landet an derselben Stelle. ElevenLabs, weiterhin der Referenzpunkt für Sprachqualität, kostet pro Stunde etwa das Vierfache. Wenn Kosten pro Stunde dein entscheidendes Kriterium sind und du ausdrucksstarken Output willst, ist Gemini gerade kaum zu schlagen — zumindest bis der Reset 2027 den Preis auf rund 1,62 $ anhebt.

Für die OpenAI-Seite dieses Vergleichs gehen meine Beiträge zur OpenAI Realtime API und den gpt-realtime-mini Preisen tiefer darauf ein, wo tokenbasierte Sprachabrechnung sinnvoll ist.

Ist die Stimme überhaupt gut?

Der Preis zählt nur, wenn der Output brauchbar ist, und hier werden die ersten Reaktionen gemischter. Der Rollout sorgte für etwas Unmut bei der Qualität. Ein Entwickler auf Hacker News brachte es unverblümt auf den Punkt:

Hacker News

"I don't know, I guess their roll out is a bit sloppy. It's a bit of a shame, though, since the voices which are available all sound like generic Gemini voices to me. Nothing stands out."

Das ist die Meinung einer einzelnen Person, und Stimmpräferenz ist subjektiv, aber es passt zu einem Muster: Googles TTS ist günstig und breit aufgestellt, während ElevenLabs beim Test "klingt diese bestimmte Stimme herausragend" für viele Menschen weiterhin gewinnt. Manche Nutzer bleiben vorerst bei dem, was sie kennen:

Hacker News

"For on the go, I've been using ElevenReader. Technically not free but their free tier has been plenty for me."

Die ehrliche Einschätzung lautet also: Wenn du günstige, mehrsprachige, gut genug klingende Erzählung im großen Maßstab brauchst, ist Gemini 3.8 Flash TTS ein hervorragendes Angebot. Wenn eine einzelne, unverwechselbare, markenprägende Stimme das Produkt ist, teste sie sorgfältig gegen ElevenLabs, und geh nicht davon aus, dass die Preislücke automatisch zu deinen Gunsten für Qualität steht.

Wo ein günstiges Sprachmodell passt — und wo nicht

Hier die Neurahmung, mit der ich einen Käufer entlassen würde. Ein TTS-Modell ist Infrastruktur. Es ist eine fantastische, günstige Möglichkeit, einer App eine Stimme zu geben: eine Hörbuch-Pipeline, ein Erzähler im Produkt, eine Barrierefreiheits-Ebene, IVR-Ansagen. Dafür sind 0,81 $ pro Stunde ein wirklich guter Deal.

Aber sobald der Anwendungsfall Kundenservice ist, ist das Modell der einfache 10-Prozent-Teil des Problems. Der harte Teil ist alles darum herum: die richtige Antwort aus deiner Wissensdatenbank ziehen, die Tools aufrufen, die ein Ticket wirklich lösen, und vor dem ersten Kundenkontakt an deinem echten Verlauf getestet werden. Das ist der Unterschied zwischen Infrastruktur und einem Mitarbeiter. Gemini TTS ist Ersteres. Es kennt deine Rückerstattungsrichtlinie nicht und kann kein Ticket priorisieren, und all das selbst zusammenzubauen ist ein Projekt, kein API-Aufruf.

Das ist der Rahmen, in dem wir täglich arbeiten. Wir setzen KI seit Jahren auf lebende Support-Warteschlangen, und was eine Demo von einem echten Rollout unterscheidet, ist nie das Modell, sondern immer die Verrohrung und das Testen. Deshalb ist ein KI-Helpdesk-Agent ein ganz anderer Kauf als ein Sprach-Endpunkt, auch wenn bei beiden "KI" draufsteht. Wenn du generell die Rechnung Mensch gegen Automatisierung abwägst, ist unsere Analyse zu den Kosten von KI-Agent vs. menschlichem Agenten ein besserer Ausgangspunkt als ein Preis pro Token.

eesel testen

eesel ist eine KI-Mitarbeiter-Plattform, und im aktuellen Angebot ist ein einsatzbereiter KI-Helpdesk-Agent, der sich deiner bestehenden Support-Warteschlange anschließt. Während Gemini TTS ein Modell ist, um das du selbst herumbauen musst, kommt eesel bereits mit dem Wissen, sich mit deinem Helpdesk zu verbinden, aus deinen vergangenen Tickets zu lernen und gegen echte historische Gespräche simuliert zu werden, damit du seine Lösungsquote kennst, bevor es live geht.

eesel AI Onboarding-Bildschirm zeigt einen KI-Mitarbeiter, der mit einem Helpdesk verbunden ist und bereit ist, Antworten zu entwerfen
eesel AI Onboarding-Bildschirm zeigt einen KI-Mitarbeiter, der mit einem Helpdesk verbunden ist und bereit ist, Antworten zu entwerfen

Wenn du lieber im Terminal arbeitest, steuert die eesel CLI denselben Mitarbeiter und Workspace programmatisch. Du kannst sie manuell bedienen, in Skripte einbauen oder einen Coding-Agenten wie Claude Code oder Cursor sie headless ausführen lassen — die KI, die du kaufst, ist so sowohl im Dashboard als auch über die API verfügbar, genau wie du auf ein Modell wie Gemini TTS zugreifen würdest. Du kannst eesel kostenlos testen und es zuerst mit deinen eigenen Tickets simulieren.

Häufig gestellte Fragen

Wie viel kostet Gemini 3.8 Flash TTS?
Gemini 3.8 Flash TTS kostet auf der Standard-Bezahlstufe 0,50 $ pro 1 Mio. Text-Input-Token und 9,00 $ pro 1 Mio. Audio-Output-Token, gültig bis 31. Dezember 2026. Da Audio mit 25 Token pro Sekunde abgerechnet wird, ergibt das rund 0,81 $ für eine volle Stunde generierte Sprache. Ab dem 1. Januar 2027 verdoppeln sich beide Sätze. Für die breitere Übersicht siehe meinen Leitfaden zu Google Gemini 3 Preisen.
Gibt es eine kostenlose Stufe für Gemini 3.8 Flash TTS?
Ja. Input und Output sind auf der Standard- und Priority-Stufe über Google AI Studio kostenlos, während die Batch- und Flex-Stufen nur kostenpflichtig sind. Die kostenlose Stufe eignet sich gut zum Testen von Stimmen, aber Google nutzt Inhalte der kostenlosen Stufe zur Produktverbesserung, also lies die Bedingungen, bevor du etwas Sensibles durchlaufen lässt. Die Sprachfunktionen in der Gemini-App für Endnutzer benötigen ein Google AI-Abonnement.
Wie schneiden die Gemini 3.8 Flash TTS Preise im Vergleich zu ElevenLabs ab?
Auf die Audiodauer normiert kostet Gemini 3.8 Flash TTS rund 0,81 $ pro Stunde Sprache, während ElevenLabs latenzarmes TTS ab etwa 5 Cent pro Minute (rund 3 $ pro Stunde) im Business-Plan bewirbt. Gemini ist pro Stunde deutlich günstiger, aber ElevenLabs führt weiterhin bei Stimmenvielfalt und der Reife des Voice-Clonings. Der Haken bei jedem rohen Modell: Preis pro Stunde ist nicht dasselbe wie Preis pro gelöstem Kundenservice-Gespräch.
Warum verdoppelt sich der Gemini 3.8 Flash TTS Preis im Januar 2027?
Die Sätze von 0,50 $ und 9,00 $ sind Einführungspreise, nach demselben Muster, das Google schon bei früheren Gemini-Modellen genutzt hat. Am 1. Januar 2027 steigt der Standard-Input auf 1,00 $ pro 1 Mio. und der Audio-Output auf 18,00 $ pro 1 Mio., und die Multiplikatoren für Batch, Flex und Priority verdoppeln sich gleichzeitig. Wenn du ein Budget für 2027 planst, verdopple die heutigen Zahlen. Das Pendant beim Textmodell findest du in meiner Analyse zu den Gemini 3.8 Flash Preisen.
Ist Gemini 3.8 Flash TTS gut genug für Sprachsupport im Kundenservice?
Es ist günstig und ausdrucksstark, aber ein Sprachmodell übernimmt nur das Sprechen. Support-Voice braucht außerdem Retrieval, Tools und Tests, bevor es mit einem echten Anrufer in Kontakt kommt — genau dort scheitern die meisten Projekte. Das ist die Aufgabe eines KI-Helpdesk-Agenten, nicht eines TTS-Endpunkts. Wenn du speziell die Sprachebene brauchst, kombiniere sie mit etwas wie Zendesk Voice AI oder einem eigens gebauten Stack.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Illustration von Schallwellen und Preisschildern als Symbol für die Gemini 3.8 Flash TTS Preise
Trending

Gemini 3.8 Flash TTS Preise: Was eine Stunde KI-Stimme wirklich kostet

Gemini 3.8 Flash TTS kostet 9 $ pro 1 Mio. Audio-Token, also rund 0,81 $ pro Stunde Sprache. Hier sind alle Tarifstufen, der Haken für 2027 und der Vergleich mit ElevenLabs und OpenAI.

Rama Adi NugrahaRama Adi NugrahaSep 24, 2026
Illustration von Schallwellen, einem Bedienfeld für Stimmendesign und einem Play-Button für Gemini 3.8 Flash TTS
Trending

Gemini 3.8 Flash TTS im Test: Lohnt sich Googles neues Sprachmodell?

Ein praktischer Gemini 3.8 Flash TTS Test: Wie es wirklich klingt, was sich steuern lässt, wo es preislich ElevenLabs schlägt und der eine Benchmark, bei dem Google nicht vorne lag.

Alicia Kirana UtomoAlicia Kirana UtomoSep 24, 2026
Illustration eines Teams, das Gemini 3.8 Flash testet, mit einer Geschwindigkeitsanzeige, einer Rakete und einem Häkchen als Fazit
Trending

Gemini 3.8 Flash im Test: schnell, wortreich – aber nicht das Upgrade, das die Nummer suggeriert

Ein praxisnaher Gemini 3.8 Flash Test: was das Modell gut kann, wo es schwächelt, der 13-Sekunden-Haken, den niemand erwähnt hat, und ob sich der Wechsel von 3.7 Flash lohnt.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Illustration von zwei Personen, die Diagramme und Tachometer um einen Gemini-Funken herum betrachten und damit die Preise von Gemini 3.8 Flash darstellen
Trending

Gemini 3.8 Flash Preise: jeder Tarif, die versteckten Kosten und der Haken

Gemini 3.8 Flash kostet 0,75 $/3,75 $ pro 1 Million Token – genau so viel wie 3.7 Flash. Aber der Listenpreis verschleiert eine Verbositäts-Steuer, und beide Zahlen verdoppeln sich am 1. Januar 2027.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Illustration eines schnellen Roboters, der an einem Laptop programmiert, während eine Person zuschaut – Sinnbild für Gemini 3.8 Flash
Trending

Gemini 3.8 Flash: was es ist, ehrliche Benchmarks und meine Bewertung

Google hat Gemini 3.8 Flash am 2. September 2026 veröffentlicht, drei Wochen nach 3.7. Gleicher Preis, bessere Werte und eine Zeile im Kleingedruckten, die die Antwort ändert.

Alicia Kirana UtomoAlicia Kirana UtomoSep 3, 2026
DeepSeek V4 Flash Preise: was dir wirklich in Rechnung gestellt wird
Trending

DeepSeek V4 Flash Preise: was dir wirklich in Rechnung gestellt wird

DeepSeek V4 Flash listet mit $0.14 Eingabe und $0.28 Ausgabe pro Million Tokens. Echte Nutzer haben Mischraten unter einem Cent gepostet. Hier ist, was entscheidet, welche davon dich trifft.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ein Tester blickt auf eine Bewertungskarte mit zwei Aufwand-Reglern, beschriftet mit niedrig und maximal, neben dem DeepSeek-Wal
Trending

DeepSeek V4 Flash im Test: ein Modell, zwei Persönlichkeiten

Ein DeepSeek V4 Flash Test, der auf den Zahlen beruht, die beide Scoreboards veröffentlichen. Der billige Lauf und der clevere Lauf sind dieselben Gewichte, und das verändert das Urteil.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
DeepSeek V4 Flash: Specs, Preise und wofür es wirklich taugt
Trending

DeepSeek V4 Flash: Specs, Preise und wofür es wirklich taugt

DeepSeek V4 Flash kostet $0,14 pro Million Input-Tokens und $0,28 pro Million Output-Tokens und übertrifft dabei DeepSeeks eigenes teureres Modell. Das steht nicht auf der Preistabelle.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration zum Vergleich von DeepSeek V4 Flash und Kimi K3 von Moonshot AI
Trending

DeepSeek V4 Flash vs Kimi K3: Welches solltest du nutzen?

Ein Modell kostet pro Aufgabe 29-mal mehr als das andere. Ich habe jede veröffentlichte Zahl zu beiden durchgesehen, und das Interessante ist die mittlere Option, die niemand kaufen sollte.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten