
En bref
Gemini 3.8 Flash TTS coûte 0,50 $ par million de tokens de texte en entrée et 9,00 $ par million de tokens audio en sortie sur le palier payant standard, jusqu'au 31 décembre 2026. L'audio est facturé à 25 tokens par seconde, donc une heure complète de parole générée revient à environ 0,81 $. Il existe aussi un palier réellement gratuit sur Google AI Studio.
Deux choses à retenir. D'abord, les deux tarifs doublent le 1er janvier 2027, donc tout budget construit aujourd'hui sur ces chiffres doit être doublé pour l'année prochaine. Ensuite, à environ 0,81 $ l'heure, c'est l'un des modèles vocaux expressifs les moins chers du marché, très en dessous d'ElevenLabs et des paliers génératifs premium d'Amazon et de Deepgram.
Le piège est celui qui s'applique à tout modèle brut : un audio bon marché n'est pas la même chose qu'un produit qui fonctionne. Un endpoint TTS parle ; il ne connaît pas votre base de connaissances, n'appelle pas vos outils et n'a pas été testé au préalable sur de vraies conversations. Si vous pointez un modèle vocal vers le service client, cet écart est tout ce qui compte, et c'est exactement ce qu'un agent de helpdesk IA existe pour combler.
Ce qu'est vraiment Gemini 3.8 Flash TTS
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) est le modèle de synthèse vocale actuel de Google et, contrairement à beaucoup de modèles audio en circulation, il est stable plutôt qu'en preview. L'id ne porte pas le suffixe -preview, et Google le présente comme le remplaçant recommandé de l'ancien gemini-3.1-flash-tts-preview. Il prend du texte en entrée et produit de l'audio, rien de plus, exactement ce qu'on attend d'un modèle vocal dédié.
La fiche technique est généreuse. Vous avez 30 voix de studio prêtes à l'emploi (Zephyr, Puck, Kore, Fenrir et consorts), chacune avec un descripteur comme Bright ou Firm, plus une Extended Voice Library de plusieurs centaines d'autres accessibles via client.voices.list(). Il parle 130 langues avec détection automatique de l'entrée, et vous pouvez orienter le style, l'accent, le rythme et le ton avec des prompts en langage naturel, ou insérer des balises inline comme <laugh> et <sigh> pour des événements vocaux ponctuels. Il propose aussi la conception de voix (construire une persona à partir d'une description textuelle) et le clonage vocal à partir d'un extrait de référence.
Le point de la spécification qui gêne vraiment en production : le multi-locuteur est limité à deux locuteurs par requête. Un podcast à trois personnes ou une scène de groupe signifie synthétiser chaque tour de parole séparément et assembler l'audio vous-même. La sortie par défaut est en WAV mono 24 kHz, avec mulaw et alaw disponibles pour la téléphonie. Cela cohabite avec le modèle texte seul Gemini 3.8 Flash, et les deux sont facturés de manière totalement différente, ce qui est la source de la plupart des confusions.
Tarifs de Gemini 3.8 Flash TTS : le tableau complet
Voici tous les paliers, en USD pour 1M de tokens, aux tarifs promotionnels 2026. Le tarif 2027 est entre parenthèses car, comme on va le voir, tout double.
| Palier | Texte en entrée / 1M | Audio en sortie / 1M | Remarques |
|---|---|---|---|
| Standard | 0,50 $ (1,00 $) | 9,00 $ (18,00 $) | Le tarif par défaut |
| Batch | 0,25 $ (0,50 $) | 4,50 $ (9,00 $) | ~50 % de réduction, tâches asynchrones |
| Flex | 0,25 $ (0,50 $) | 4,50 $ (9,00 $) | Même tarif, cache moins cher |
| Priority | 0,90 $ (1,80 $) | 16,20 $ (32,40 $) | ~1,8x, sensible à la latence |
| Free | Gratuit | Gratuit | Standard/priority via AI Studio |
Tout ceci vient directement de la page de tarifs de l'API Gemini de Google. La mise en cache de contexte est prise en charge et démarre à 0,125 $ par million de tokens de cache en entrée sur le palier standard, plus des frais de stockage de 0,50 $ par million par heure. Le chiffre de sortie audio est celui qui compte, car c'est lui qui évolue avec la quantité de parole générée. Le texte en entrée est presque une erreur d'arrondi en comparaison.
Ce qui est discrètement intéressant, c'est où se situent ces 9,00 $ dans la propre gamme de Google. C'est moins cher que le Gemini 2.5 Flash TTS qu'il remplace (10 $ en sortie audio), et moins de la moitié du prix des modèles preview 2.5 Pro et 3.1 Flash TTS (20 $ en sortie audio). Il existe aussi un petit frère moins cher, Flash-Lite TTS, à 6 $ en sortie audio si vous pouvez vous contenter de 101 langues au lieu de 130.

Ce que cela vous coûte réellement
Le prix au token est difficile à se représenter, alors transformons-le en argent réel. L'audio est facturé à 25 tokens par seconde, ce qui donne 1 500 tokens par minute et 90 000 tokens par heure. Au tarif standard 2026 de 9,00 $ par million, une heure de parole générée revient à environ 0,81 $. Ajoutez le texte que vous avez fourni en entrée (une heure complète de narration ne représente qu'environ 12 000 tokens d'entrée) et cela ajoute bien moins d'un centime.

Quelques exemples chiffrés au tarif standard :
- Un épisode de podcast de 30 minutes : environ 0,41 $ d'audio.
- Un livre audio de 8 heures : environ 6,48 $.
- 10 000 messages SVI de support de 15 secondes chacun : 3,75M de tokens audio, soit environ 33,75 $.
Exécutez l'un de ces cas en tâche batch de nuit et vous divisez le coût par deux, ce qui ramène le livre audio à environ 3,24 $. Pour une génération à fort volume et non interactive, le batch est le choix évident. Le seul endroit où l'étiquette de prix ne raconte pas toute l'histoire, c'est tout ce qu'un humain attend en temps réel, où vous payez le tarif priority et subissez une latence que vous ne contrôlez pas totalement.
Le piège : les prix doublent le 1er janvier 2027
C'est la partie à noter sur un post-it. Les chiffres de 0,50 $ et 9,00 $ sont des tarifs promotionnels de lancement. Le 1er janvier 2027, le texte en entrée standard passe à 1,00 $ par million et la sortie audio à 18,00 $ par million. Tous les autres paliers doublent au même rythme : la sortie audio batch et flex passe à 9,00 $, la sortie audio priority à 32,40 $.

Ainsi, cette heure d'audio à 0,81 $ passe à environ 1,62 $ en 2027, et le livre audio de 8 heures passe de 6,48 $ à 12,96 $. C'est le même mouvement que Google a appliqué sur les modèles texte, et c'est un mouvement raisonnable tant qu'on le voit venir. Si vous budgétisez au-delà de cette année, doublez les chiffres de cet article et planifiez à partir de là. Cela pousse aussi à sécuriser dès maintenant tout ce que vous pouvez comme économies de cache et de batch.
Comparaison avec ElevenLabs, OpenAI et le reste
Comparer des modèles vocaux est vraiment délicat, car les fournisseurs ne facturent pas de la même manière. Amazon, Azure et Deepgram facturent au caractère de texte en entrée. OpenAI et Google facturent au token audio en sortie, qui évolue avec la durée de la parole générée, pas avec le script. ElevenLabs vend des crédits d'abonnement. Pour tout ramener sur un même axe, j'ai converti chaque offre en coût estimé par heure de parole, en utilisant le repère d'Amazon lui-même selon lequel 1M de caractères équivaut à environ 23 heures d'audio. Considérez les chiffres à l'heure comme des estimations, pas comme des conditions contractuelles, car ils varient avec le rythme d'élocution.
| Fournisseur | Modèle phare | Prix natif | ~ $/heure d'audio | Palier gratuit |
|---|---|---|---|---|
| Gemini 3.8 Flash TTS | gemini-3.8-flash-tts | 9 $ / 1M tokens audio | ~0,81 $ | Gratuit sur AI Studio |
| Amazon Polly (Neural) | Neural | 16 $ / 1M caractères | ~0,70 $ | 1M caractères/mois (12 mois) |
| Azure AI Speech | Neural / HD Flash | 15 $ / 1M caractères | ~0,65 $ | 0,5M caractères/mois |
| OpenAI | gpt-4o-mini-tts | 12 $ / 1M tokens audio | ~0,90 $ | Aucun |
| Amazon Polly (Generative) | Generative | 30 $ / 1M caractères | ~1,30 $ | 100k caractères/mois |
| Deepgram | Aura-2 | 30 $ / 1M caractères | ~1,30 $ | 200 $ de crédit |
| ElevenLabs | Eleven v3 / Flash | ~5c/min (Business) | ~3,00 $ | 10k crédits/mois |
Ce qui m'a surpris : Gemini 3.8 Flash TTS est tarifé comme une voix neuronale banale alors qu'il s'agit de l'un des modèles génératifs expressifs. Les lignes les moins chères d'Amazon et d'Azure sont leurs anciennes voix neuronales ; leur palier de qualité générative (Polly Generative) est à 1,30 $ l'heure, et le modèle phare de Deepgram se retrouve au même niveau. ElevenLabs, toujours la référence en qualité vocale, coûte environ quatre fois plus cher à l'heure. Si le coût à l'heure est votre facteur décisif et que vous voulez tout de même un rendu expressif, Gemini est difficile à battre en ce moment, du moins jusqu'à ce que le réajustement de 2027 le fasse grimper à environ 1,62 $.
Pour le volet OpenAI de cette comparaison, mes articles sur l'API realtime d'OpenAI et les tarifs de gpt-realtime-mini approfondissent les cas où la voix facturée au token fait sens.
La voix est-elle vraiment bonne ?
Le prix ne compte que si le résultat est utilisable, et c'est là que les premiers retours deviennent plus partagés. Le déploiement a suscité un certain mécontentement sur la qualité. Un développeur sur Hacker News l'a dit sans détour :
"I don't know, I guess their roll out is a bit sloppy. It's a bit of a shame, though, since the voices which are available all sound like generic Gemini voices to me. Nothing stands out."
C'est l'avis d'une seule personne, et la préférence vocale est subjective, mais cela colle à un schéma récurrent : le TTS de Google est bon marché et large, tandis qu'ElevenLabs continue de remporter, pour beaucoup, le test « est-ce que cette voix précise sonne remarquable ». Certains utilisateurs restent pour l'instant fidèles à ce qu'ils connaissent :
"For on the go, I've been using ElevenReader. Technically not free but their free tier has been plenty for me."
La lecture honnête est donc la suivante. Si vous avez besoin d'une narration bon marché, multilingue et suffisamment bonne à grande échelle, Gemini 3.8 Flash TTS offre un excellent rapport qualité-prix. Si une voix unique, distinctive, qui incarne la marque, est le produit lui-même, testez-la soigneusement face à ElevenLabs avant de vous engager, et ne présumez pas que l'écart de prix signifie un écart de qualité en votre faveur.
Où un modèle vocal bon marché trouve sa place, et où non
Voici le recadrage que j'aimerais qu'un acheteur retienne. Un modèle TTS est une infrastructure. C'est un moyen fantastique et bon marché de donner une voix à une application : un pipeline de livres audio, un narrateur intégré au produit, une couche d'accessibilité, des invites SVI. Pour cela, 0,81 $ de l'heure est une très bonne affaire.
Mais dès que le cas d'usage devient le service client, le modèle représente les 10 % faciles du problème. La partie difficile, c'est tout ce qui l'entoure : extraire la bonne réponse de votre base de connaissances, appeler les outils qui résolvent vraiment un ticket, et être testé sur votre historique réel avant de parler à un client pour la première fois. C'est la différence entre une infrastructure et un employé. Gemini TTS est la première. Il ne connaîtra pas votre politique de remboursement ni ne triera un ticket, et assembler tout cela vous-même est un projet, pas un appel d'API.
C'est le cadre dans lequel nous travaillons chaque jour. Cela fait des années que nous déployons de l'IA sur des files de support en production, et ce qui sépare une démo d'un vrai déploiement n'est jamais le modèle, c'est toujours la plomberie et les tests. C'est pourquoi un agent de helpdesk IA est un achat très différent d'un endpoint vocal, même quand les deux affichent « IA » sur l'étiquette. Si vous évaluez de façon générale le calcul humain contre automatisation, notre comparatif coût d'un agent IA face à un agent humain est un meilleur point de départ qu'un simple tarif au token.
Essayer eesel
eesel est une plateforme de coéquipiers IA, et l'offre actuelle inclut un agent de helpdesk IA prêt à travailler qui rejoint votre file de support existante. Là où Gemini TTS est un modèle autour duquel il faut construire, eesel arrive en sachant déjà se connecter à votre helpdesk, apprendre de vos tickets passés, et être simulé sur de vraies conversations historiques pour que vous connaissiez son taux de résolution avant sa mise en production.

Si vous aimez travailler dans un terminal, la CLI eesel pilote le même coéquipier et le même espace de travail de manière programmatique. Vous pouvez l'utiliser manuellement, l'intégrer dans des scripts, ou laisser un agent de code comme Claude Code ou Cursor l'exécuter en mode headless, de sorte que l'IA que vous achetez est disponible à la fois dans le tableau de bord et via l'API, tout comme vous accéderiez à un modèle tel que Gemini TTS. Vous pouvez essayer eesel gratuitement et le simuler d'abord sur vos propres tickets.
Questions fréquentes
Combien coûte Gemini 3.8 Flash TTS ?
Existe-t-il un palier gratuit pour Gemini 3.8 Flash TTS ?
Pourquoi le prix de Gemini 3.8 Flash TTS double-t-il en janvier 2027 ?
Gemini 3.8 Flash TTS est-il assez bon pour la voix en service client ?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








Comment les tarifs de Gemini 3.8 Flash TTS se comparent-ils à ElevenLabs ?