Prix de Gemini 3.8 Flash TTS : ce que coûte vraiment une heure de voix IA

Rama Adi Nugraha
Écrit par

Rama Adi Nugraha

Katelin Teen
Relu par

Katelin Teen

Dernière modification September 23, 2026

Vérifié par un expert
Illustration d'ondes sonores et d'étiquettes de prix représentant les prix de Gemini 3.8 Flash TTS

En bref

Gemini 3.8 Flash TTS coûte 0,50 $ par million de tokens de texte en entrée et 9,00 $ par million de tokens audio en sortie sur le palier payant standard, jusqu'au 31 décembre 2026. L'audio est facturé à 25 tokens par seconde, donc une heure complète de parole générée revient à environ 0,81 $. Il existe aussi un palier réellement gratuit sur Google AI Studio.

Deux choses à retenir. D'abord, les deux tarifs doublent le 1er janvier 2027, donc tout budget construit sur les chiffres d'aujourd'hui doit être doublé pour l'année prochaine. Ensuite, à environ 0,81 $ l'heure, c'est l'un des modèles vocaux expressifs les moins chers du marché, bien en dessous d'ElevenLabs et des paliers génératifs premium d'Amazon et de Deepgram.

Le piège est celui qui s'applique à tout modèle brut : un audio bon marché n'équivaut pas à un produit fonctionnel. Un endpoint TTS parle ; il ne connaît pas votre base de connaissances, n'appelle pas vos outils et n'a pas été testé au préalable sur de vraies conversations. Si vous placez un modèle vocal face au service client, cet écart est déterminant, et c'est précisément ce qu'un agent de support IA existe pour combler.

Ce qu'est vraiment Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) est l'actuel modèle de synthèse vocale de Google, et contrairement à beaucoup de modèles audio qui circulent, il est stable plutôt qu'en préversion. L'identifiant ne porte pas de suffixe -preview, et Google le présente comme le remplaçant recommandé de l'ancien gemini-3.1-flash-tts-preview. Il prend du texte en entrée et produit de l'audio en sortie, rien de plus, exactement ce qu'on attend d'un modèle vocal dédié.

La fiche technique est généreuse. Vous disposez de 30 voix de studio prédéfinies (Zephyr, Puck, Kore, Fenrir et d'autres), chacune avec un descripteur comme Bright ou Firm, plus une Extended Voice Library de centaines d'autres accessibles via client.voices.list(). Il parle 130 langues avec détection automatique de l'entrée, et vous pouvez orienter le style, l'accent, le rythme et le ton avec des prompts en langage naturel, ou insérer des balises en ligne comme <laugh> et <sigh> pour des événements vocaux ponctuels. Il propose aussi la création de voix (construire une persona à partir d'une description textuelle) et le clonage vocal à partir d'un extrait de référence.

Le détail technique qui pose problème en production : le multi-locuteur est limité à deux locuteurs par requête. Un podcast à trois voix ou une scène de groupe implique de synthétiser chaque tour de parole séparément et d'assembler l'audio soi-même. La sortie par défaut est en WAV mono 24 kHz, avec mulaw et alaw disponibles pour la téléphonie. Cela coexiste avec le modèle texte seul Gemini 3.8 Flash, et les deux sont facturés de façon totalement différente, ce qui est à l'origine de la plupart des confusions.

Prix de Gemini 3.8 Flash TTS : le tableau complet

Voici chaque palier, en USD par million de tokens, aux tarifs promotionnels de 2026. Le tarif 2027 est entre parenthèses car, comme on le verra, tout double.

PalierTexte en entrée / 1MAudio en sortie / 1MRemarques
Standard0,50 $ (1,00 $)9,00 $ (18,00 $)Le tarif par défaut
Batch0,25 $ (0,50 $)4,50 $ (9,00 $)~50 % de réduction, tâches asynchrones
Flex0,25 $ (0,50 $)4,50 $ (9,00 $)Même tarif, cache moins cher
Priority0,90 $ (1,80 $)16,20 $ (32,40 $)~1,8x, sensible à la latence
FreeGratuitGratuitStandard/priority via AI Studio

Tout cela provient directement de la page de tarifs de l'API Gemini de Google. La mise en cache du contexte est prise en charge et démarre à 0,125 $ par million de tokens de cache en entrée sur le palier standard, plus des frais de stockage de 0,50 $ par million par heure. Le chiffre de sortie audio est celui qui compte, car c'est celui qui évolue avec la quantité de parole générée. Le texte en entrée est presque une erreur d'arrondi en comparaison.

Ce qui est discrètement intéressant, c'est où se situent ces 9,00 $ dans la propre gamme de Google. C'est moins cher que le Gemini 2.5 Flash TTS qu'il remplace (10 $ en sortie audio), et moins de la moitié du prix des modèles en préversion 2.5 Pro et 3.1 Flash TTS (20 $ en sortie audio). Il existe aussi un cousin moins cher, Flash-Lite TTS, à 6 $ en sortie audio si vous pouvez vous contenter de 101 langues au lieu de 130.

Graphique en barres comparant le coût de sortie audio par million de tokens entre les modèles de synthèse vocale Gemini, avec 3.8 Flash TTS mis en évidence à 9 $
Graphique en barres comparant le coût de sortie audio par million de tokens entre les modèles de synthèse vocale Gemini, avec 3.8 Flash TTS mis en évidence à 9 $

Ce que cela coûte réellement

Le prix par token est difficile à ressentir concrètement, alors convertissons-le en argent réel. L'audio est facturé à 25 tokens par seconde, ce qui donne 1 500 tokens par minute et 90 000 tokens par heure. Au tarif standard 2026 de 9,00 $ par million, une heure de parole générée coûte environ 0,81 $. En ajoutant le texte fourni en entrée (une heure complète de narration ne représente qu'environ 12 000 tokens d'entrée), on ajoute bien moins d'un centime.

Schéma montrant comment 25 tokens audio par seconde deviennent 1 500 par minute, 0,0135 $ par minute, et environ 0,81 $ par heure au tarif standard 2026
Schéma montrant comment 25 tokens audio par seconde deviennent 1 500 par minute, 0,0135 $ par minute, et environ 0,81 $ par heure au tarif standard 2026

Quelques exemples concrets au tarif standard :

  • Un épisode de podcast de 30 minutes : environ 0,41 $ d'audio.
  • Un livre audio de 8 heures : environ 6,48 $.
  • 10 000 messages SVI de support de 15 secondes chacun : 3,75 millions de tokens audio, soit environ 33,75 $.

En exécutant l'un de ces cas comme un job batch nocturne, vous divisez le coût par deux, ce qui rapproche le livre audio de 3,24 $. Pour une génération à fort volume et non interactive, le batch est le choix évident. Le seul endroit où le prix affiché ne raconte pas toute l'histoire, c'est tout ce qu'un humain attend en temps réel, où vous payez le tarif priority et supportez une latence que vous ne maîtrisez pas totalement.

Le piège : les prix doublent le 1er janvier 2027

Voici la partie à noter sur un post-it. Les chiffres de 0,50 $ et 9,00 $ sont des tarifs promotionnels de lancement. Le 1er janvier 2027, le texte en entrée standard passe à 1,00 $ par million et la sortie audio à 18,00 $ par million. Tous les autres paliers doublent au même rythme : sortie audio batch et flex à 9,00 $, sortie audio priority à 32,40 $.

Comparaison avant/après montrant les tarifs standard de Gemini 3.8 Flash TTS doublant de 9 $ à 18 $ en sortie audio et de 0,50 $ à 1,00 $ en texte en entrée le 1er janvier 2027
Comparaison avant/après montrant les tarifs standard de Gemini 3.8 Flash TTS doublant de 9 $ à 18 $ en sortie audio et de 0,50 $ à 1,00 $ en texte en entrée le 1er janvier 2027

Cette heure d'audio à 0,81 $ passe donc à environ 1,62 $ en 2027, et le livre audio de 8 heures passe de 6,48 $ à 12,96 $. C'est exactement le même mouvement que Google a opéré sur les modèles texte, et c'est un mouvement raisonnable tant qu'on l'anticipe. Si vous budgétez au-delà de cette année, doublez les chiffres de cet article et planifiez à partir de là. C'est aussi une incitation à sécuriser dès maintenant toutes les économies de cache et de batch possibles.

Comparaison avec ElevenLabs, OpenAI et le reste

Comparer des modèles vocaux est vraiment délicat, car les fournisseurs ne facturent pas de la même façon. Amazon, Azure et Deepgram facturent au caractère de texte en entrée. OpenAI et Google facturent au token audio en sortie, qui évolue avec la durée de la parole générée, pas avec le script. ElevenLabs vend des crédits d'abonnement. Pour tout ramener sur un même axe, j'ai converti l'ensemble en coût estimé par heure de parole, en utilisant le repère propre d'Amazon selon lequel 1 million de caractères représentent environ 23 heures d'audio. Considérez les chiffres à l'heure comme des estimations, pas comme des conditions contractuelles, car ils varient avec le débit de parole.

FournisseurModèle pharePrix natif~ $/heure d'audioPalier gratuit
Gemini 3.8 Flash TTSgemini-3.8-flash-tts9 $ / 1M tokens audio~0,81 $Gratuit sur AI Studio
Amazon Polly (Neural)Neural16 $ / 1M caractères~0,70 $1M caractères/mois (12 mois)
Azure AI SpeechNeural / HD Flash15 $ / 1M caractères~0,65 $0,5M caractères/mois
OpenAIgpt-4o-mini-tts12 $ / 1M tokens audio~0,90 $Aucun
Amazon Polly (Generative)Generative30 $ / 1M caractères~1,30 $100k caractères/mois
DeepgramAura-230 $ / 1M caractères~1,30 $200 $ de crédit
ElevenLabsEleven v3 / Flash~5c/min (Business)~3,00 $10k crédits/mois

Ce qui m'a le plus surpris : Gemini 3.8 Flash TTS est tarifé comme une voix neuronale banale, alors qu'il fait partie des modèles génératifs les plus expressifs. Les lignes les moins chères d'Amazon et d'Azure correspondent à leurs anciennes voix neuronales ; leur palier de qualité générative (Polly Generative) est à 1,30 $ l'heure, et le modèle phare de Deepgram atterrit au même niveau. ElevenLabs, toujours la référence en matière de qualité vocale, coûte environ quatre fois plus cher à l'heure. Si le coût à l'heure est votre critère décisif et que vous voulez une sortie expressive, Gemini est difficile à battre en ce moment, du moins jusqu'à ce que le réajustement de 2027 le fasse monter à environ 1,62 $.

Pour le volet OpenAI de cette comparaison, mes articles sur l'API Realtime d'OpenAI et les prix de gpt-realtime-mini approfondissent les cas où la voix facturée au token a du sens.

La voix est-elle vraiment bonne ?

Le prix ne compte que si le résultat est exploitable, et c'est là que les premières réactions sont plus partagées. Le déploiement a suscité quelques critiques sur la qualité. Un développeur sur Hacker News l'a dit sans détour :

Hacker News

"I don't know, I guess their roll out is a bit sloppy. It's a bit of a shame, though, since the voices which are available all sound like generic Gemini voices to me. Nothing stands out."

C'est l'avis d'une seule personne, et la préférence vocale est subjective, mais cela correspond à une tendance : le TTS de Google est bon marché et large, tandis qu'ElevenLabs continue de remporter, pour beaucoup, le test du « cette voix précise sonne-t-elle remarquablement bien ». Certains utilisateurs s'en tiennent pour l'instant à ce qu'ils connaissent :

Hacker News

"For on the go, I've been using ElevenReader. Technically not free but their free tier has been plenty for me."

La lecture honnête est donc celle-ci. Si vous avez besoin d'une narration bon marché, multilingue et suffisamment bonne à grande échelle, Gemini 3.8 Flash TTS offre un excellent rapport qualité-prix. Si une voix unique, distinctive et qui incarne la marque est le produit lui-même, testez-la soigneusement face à ElevenLabs, et ne présumez pas que l'écart de prix se traduit par un écart de qualité en votre faveur.

Où un modèle vocal bon marché a sa place, et où il ne l'a pas

Voici le recadrage que j'aimerais qu'un acheteur retienne. Un modèle TTS est une infrastructure. C'est un moyen fantastique et bon marché de donner une voix à une application : un pipeline de livres audio, un narrateur intégré au produit, une couche d'accessibilité, des messages SVI. Pour cela, 0,81 $ l'heure est une excellente affaire.

Mais dès que le cas d'usage devient le service client, le modèle n'est que les 10 % faciles du problème. La partie difficile, c'est tout ce qui l'entoure : extraire la bonne réponse de votre base de connaissances, appeler les outils qui résolvent vraiment un ticket, et être testé sur votre historique réel avant de s'adresser à un client. C'est la différence entre une infrastructure et un employé. Gemini TTS relève de la première catégorie. Il ne connaîtra pas votre politique de remboursement et ne pourra pas trier un ticket, et assembler tout cela soi-même est un projet, pas un simple appel d'API.

C'est le cadre dans lequel nous travaillons chaque jour. Cela fait des années que nous mettons de l'IA sur des files de support réelles, et ce qui sépare une démo d'un déploiement réussi n'est jamais le modèle, c'est toujours la plomberie et les tests. C'est pourquoi un agent de support IA est un achat très différent d'un endpoint vocal, même quand les deux affichent « IA » sur l'étiquette. Si vous évaluez plus généralement le calcul humain contre automatisation, notre analyse du coût d'un agent IA face à un agent humain constitue un meilleur point de départ qu'un tarif au token.

Essayer eesel

eesel est une plateforme de coéquipiers IA, et l'effectif actuel inclut un agent de support IA prêt à l'emploi qui rejoint votre file de support existante. Là où Gemini TTS est un modèle autour duquel vous devez tout construire, eesel arrive en sachant déjà se connecter à votre helpdesk, apprendre de vos tickets passés, et être simulé sur de vraies conversations historiques afin que vous connaissiez son taux de résolution avant sa mise en production.

Écran d'onboarding d'eesel AI montrant un coéquipier IA connecté à un helpdesk et prêt à rédiger des réponses
Écran d'onboarding d'eesel AI montrant un coéquipier IA connecté à un helpdesk et prêt à rédiger des réponses

Si vous préférez travailler dans un terminal, la CLI eesel pilote ce même coéquipier et cet espace de travail de façon programmatique. Vous pouvez l'utiliser manuellement, l'intégrer dans des scripts, ou laisser un agent de codage comme Claude Code ou Cursor l'exécuter sans interface, de sorte que l'IA que vous achetez soit disponible à la fois depuis le tableau de bord et via l'API, tout comme vous le feriez avec un modèle comme Gemini TTS. Vous pouvez essayer eesel gratuitement et le simuler d'abord sur vos propres tickets.

Questions fréquentes

Combien coûte Gemini 3.8 Flash TTS ?
Les prix de Gemini 3.8 Flash TTS sont de 0,50 $ par million de tokens de texte en entrée et 9,00 $ par million de tokens audio en sortie sur le palier payant standard, jusqu'au 31 décembre 2026. L'audio étant facturé à 25 tokens par seconde, cela représente environ 0,81 $ pour une heure complète de parole générée. À partir du 1er janvier 2027, les deux tarifs doublent. Pour une vue d'ensemble plus large, voir mon guide des prix de Google Gemini 3.
Existe-t-il un palier gratuit pour Gemini 3.8 Flash TTS ?
Oui. L'entrée et la sortie sont gratuites sur les paliers standard et priority via Google AI Studio, même si les paliers batch et flex sont uniquement payants. Le palier gratuit convient bien pour tester des voix, mais Google utilise le contenu du palier gratuit pour améliorer ses produits, donc lisez les conditions avant d'y faire passer quoi que ce soit de sensible. Les fonctionnalités vocales grand public de l'application Gemini nécessitent un abonnement Google AI.
Comment les prix de Gemini 3.8 Flash TTS se comparent-ils à ElevenLabs ?
Rapporté à la durée audio, Gemini 3.8 Flash TTS tourne autour de 0,81 $ l'heure de parole, tandis qu'ElevenLabs annonce du TTS à faible latence à partir d'environ 5 centimes la minute (environ 3 $ l'heure) sur son plan Business. Gemini est bien moins cher à l'heure, mais ElevenLabs garde l'avantage sur la variété des voix et la maturité du clonage vocal. Le piège avec n'importe quel modèle brut, c'est que le prix à l'heure n'équivaut pas au prix par conversation de service client résolue.
Pourquoi le prix de Gemini 3.8 Flash TTS double-t-il en janvier 2027 ?
Les tarifs de 0,50 $ et 9,00 $ sont promotionnels, le même schéma que Google a utilisé sur les précédents modèles Gemini. Le 1er janvier 2027, l'entrée standard passe à 1,00 $ par million et la sortie audio à 18,00 $ par million, et les multiplicateurs batch, flex et priority doublent en même temps. Si vous dimensionnez un budget pour 2027, doublez les chiffres d'aujourd'hui. Pour l'équivalent côté modèle texte, voir mon analyse des prix de Gemini 3.8 Flash.
Gemini 3.8 Flash TTS est-il assez bon pour la voix du service client ?
Il est bon marché et expressif, mais un modèle vocal ne gère que la parole. La voix côté support a aussi besoin de recherche d'information, d'outils et de tests avant d'entrer en contact avec un appelant réel, et c'est là que la plupart des projets échouent vraiment. C'est le travail d'un agent de support IA, pas d'un simple endpoint TTS. Si vous voulez spécifiquement la couche vocale, associez-la à quelque chose comme Zendesk voice AI ou à une stack conçue sur mesure.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Illustration d'ondes sonores et d'étiquettes de prix représentant les tarifs de Gemini 3.8 Flash TTS
Trending

Tarifs de Gemini 3.8 Flash TTS : ce que coûte vraiment une heure de voix IA

Gemini 3.8 Flash TTS coûte 9 $ par million de tokens audio, soit environ 0,81 $ pour une heure de parole. Voici tous les paliers, le piège de 2027, et la comparaison avec ElevenLabs et OpenAI.

Rama Adi NugrahaRama Adi NugrahaSep 24, 2026
Illustration d'ondes sonores, d'un panneau de contrôle de conception vocale et d'un bouton de lecture représentant Gemini 3.8 Flash TTS
Trending

Avis sur Gemini 3.8 Flash TTS : le nouveau modèle vocal de Google en vaut-il la peine ?

Un avis concret sur Gemini 3.8 Flash TTS : à quoi il ressemble vraiment, ce qu'on peut contrôler, où il bat ElevenLabs sur le prix, et le seul benchmark où Google n'était pas en tête.

Alicia Kirana UtomoAlicia Kirana UtomoSep 24, 2026
Illustration d'une équipe évaluant Gemini 3.8 Flash, avec un indicateur de vitesse, une fusée et une coche de verdict
Trending

Avis sur Gemini 3.8 Flash : rapide, verbeux et pas la mise à niveau que le numéro suggère

Un avis pratique sur Gemini 3.8 Flash : ce qu'il fait bien, où il pêche, le piège des 13 secondes que personne n'a mentionné, et si ça vaut le coup de passer de 3.7 Flash.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Illustration de deux personnes consultant des graphiques et des compteurs de vitesse autour d'une étincelle Gemini, représentant les tarifs de Gemini 3.8 Flash
Trending

Tarifs de Gemini 3.8 Flash : chaque tarif, le coût caché et le piège

Gemini 3.8 Flash coûte 0,75 $/3,75 $ par million de tokens, exactement comme 3.7 Flash. Mais le prix affiché cache une taxe de verbosité, et les deux montants doublent le 1er janvier 2027.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Illustration d'un robot rapide en train de coder sur un ordinateur portable pendant qu'une personne l'observe, représentant Gemini 3.8 Flash
Trending

Gemini 3.8 Flash : ce que c'est, des benchmarks honnêtes et mon avis

Google a lancé Gemini 3.8 Flash le 2 septembre 2026, trois semaines après 3.7. Même prix, meilleurs scores, et une ligne en petits caractères qui change la réponse.

Alicia Kirana UtomoAlicia Kirana UtomoSep 3, 2026
DeepSeek V4 Flash : specs, prix et à quoi il sert vraiment
Trending

DeepSeek V4 Flash : specs, prix et à quoi il sert vraiment

DeepSeek V4 Flash coûte $0,14 en entrée et $0,28 en sortie par million de tokens, et surpasse le modèle haut de gamme, plus cher, de DeepSeek. Voici ce que la grille tarifaire ne dit pas.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration mettant en balance le Qwen 3.8 Max d'Alibaba et DeepSeek V4 Flash
Trending

Qwen 3.8 Max vs DeepSeek V4 Flash : prix, specs, vrai verdict

Un modèle coûte 21 fois plus cher par token de sortie que l'autre. C'est le point le moins intéressant de cette comparaison, et voici ce que les specs décident réellement.

Alicia Kirana UtomoAlicia Kirana UtomoAug 3, 2026
Texte alternatif de l'image
Guides

Gemini 3 Pro vs Claude Opus 4.6 : une comparaison pratique

Ce guide propose un regard direct et pratique sur Gemini 3 Pro et Claude Opus 4.6. Nous irons au-delà du battage médiatique pour nous concentrer sur les différences concrètes qui comptent lorsque vous mettez ces outils au travail.

Stevia PutriStevia PutriFeb 6, 2026
Tarifs DeepSeek V4 Flash : ce que vous paierez réellement
Trending

Tarifs DeepSeek V4 Flash : ce que vous paierez réellement

DeepSeek V4 Flash affiche $0.14 en entrée et $0.28 en sortie par million de tokens. Des utilisateurs réels ont publié des taux mixtes sous le cent. Voici ce qui décide lequel des deux vous attend.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement