Tarifs de Gemini 3.8 Flash TTS : ce que coûte vraiment une heure de voix IA

Rama Adi Nugraha
Écrit par

Rama Adi Nugraha

Katelin Teen
Relu par

Katelin Teen

Dernière modification September 23, 2026

Vérifié par un expert
Illustration d'ondes sonores et d'étiquettes de prix représentant les tarifs de Gemini 3.8 Flash TTS

En bref

Gemini 3.8 Flash TTS coûte 0,50 $ par million de tokens de texte en entrée et 9,00 $ par million de tokens audio en sortie sur le palier payant standard, jusqu'au 31 décembre 2026. L'audio est facturé à 25 tokens par seconde, donc une heure complète de parole générée revient à environ 0,81 $. Il existe aussi un palier réellement gratuit sur Google AI Studio.

Deux choses à retenir. D'abord, les deux tarifs doublent le 1er janvier 2027, donc tout budget construit aujourd'hui sur ces chiffres doit être doublé pour l'année prochaine. Ensuite, à environ 0,81 $ l'heure, c'est l'un des modèles vocaux expressifs les moins chers du marché, très en dessous d'ElevenLabs et des paliers génératifs premium d'Amazon et de Deepgram.

Le piège est celui qui s'applique à tout modèle brut : un audio bon marché n'est pas la même chose qu'un produit qui fonctionne. Un endpoint TTS parle ; il ne connaît pas votre base de connaissances, n'appelle pas vos outils et n'a pas été testé au préalable sur de vraies conversations. Si vous pointez un modèle vocal vers le service client, cet écart est tout ce qui compte, et c'est exactement ce qu'un agent de helpdesk IA existe pour combler.

Ce qu'est vraiment Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) est le modèle de synthèse vocale actuel de Google et, contrairement à beaucoup de modèles audio en circulation, il est stable plutôt qu'en preview. L'id ne porte pas le suffixe -preview, et Google le présente comme le remplaçant recommandé de l'ancien gemini-3.1-flash-tts-preview. Il prend du texte en entrée et produit de l'audio, rien de plus, exactement ce qu'on attend d'un modèle vocal dédié.

La fiche technique est généreuse. Vous avez 30 voix de studio prêtes à l'emploi (Zephyr, Puck, Kore, Fenrir et consorts), chacune avec un descripteur comme Bright ou Firm, plus une Extended Voice Library de plusieurs centaines d'autres accessibles via client.voices.list(). Il parle 130 langues avec détection automatique de l'entrée, et vous pouvez orienter le style, l'accent, le rythme et le ton avec des prompts en langage naturel, ou insérer des balises inline comme <laugh> et <sigh> pour des événements vocaux ponctuels. Il propose aussi la conception de voix (construire une persona à partir d'une description textuelle) et le clonage vocal à partir d'un extrait de référence.

Le point de la spécification qui gêne vraiment en production : le multi-locuteur est limité à deux locuteurs par requête. Un podcast à trois personnes ou une scène de groupe signifie synthétiser chaque tour de parole séparément et assembler l'audio vous-même. La sortie par défaut est en WAV mono 24 kHz, avec mulaw et alaw disponibles pour la téléphonie. Cela cohabite avec le modèle texte seul Gemini 3.8 Flash, et les deux sont facturés de manière totalement différente, ce qui est la source de la plupart des confusions.

Tarifs de Gemini 3.8 Flash TTS : le tableau complet

Voici tous les paliers, en USD pour 1M de tokens, aux tarifs promotionnels 2026. Le tarif 2027 est entre parenthèses car, comme on va le voir, tout double.

PalierTexte en entrée / 1MAudio en sortie / 1MRemarques
Standard0,50 $ (1,00 $)9,00 $ (18,00 $)Le tarif par défaut
Batch0,25 $ (0,50 $)4,50 $ (9,00 $)~50 % de réduction, tâches asynchrones
Flex0,25 $ (0,50 $)4,50 $ (9,00 $)Même tarif, cache moins cher
Priority0,90 $ (1,80 $)16,20 $ (32,40 $)~1,8x, sensible à la latence
FreeGratuitGratuitStandard/priority via AI Studio

Tout ceci vient directement de la page de tarifs de l'API Gemini de Google. La mise en cache de contexte est prise en charge et démarre à 0,125 $ par million de tokens de cache en entrée sur le palier standard, plus des frais de stockage de 0,50 $ par million par heure. Le chiffre de sortie audio est celui qui compte, car c'est lui qui évolue avec la quantité de parole générée. Le texte en entrée est presque une erreur d'arrondi en comparaison.

Ce qui est discrètement intéressant, c'est où se situent ces 9,00 $ dans la propre gamme de Google. C'est moins cher que le Gemini 2.5 Flash TTS qu'il remplace (10 $ en sortie audio), et moins de la moitié du prix des modèles preview 2.5 Pro et 3.1 Flash TTS (20 $ en sortie audio). Il existe aussi un petit frère moins cher, Flash-Lite TTS, à 6 $ en sortie audio si vous pouvez vous contenter de 101 langues au lieu de 130.

Graphique en barres comparant le coût de sortie audio par million de tokens entre les modèles de synthèse vocale Gemini, avec 3.8 Flash TTS à 9 $ mis en évidence
Graphique en barres comparant le coût de sortie audio par million de tokens entre les modèles de synthèse vocale Gemini, avec 3.8 Flash TTS à 9 $ mis en évidence

Ce que cela vous coûte réellement

Le prix au token est difficile à se représenter, alors transformons-le en argent réel. L'audio est facturé à 25 tokens par seconde, ce qui donne 1 500 tokens par minute et 90 000 tokens par heure. Au tarif standard 2026 de 9,00 $ par million, une heure de parole générée revient à environ 0,81 $. Ajoutez le texte que vous avez fourni en entrée (une heure complète de narration ne représente qu'environ 12 000 tokens d'entrée) et cela ajoute bien moins d'un centime.

Pipeline montrant comment 25 tokens audio par seconde deviennent 1 500 par minute, 0,0135 $ par minute, et environ 0,81 $ par heure au tarif standard 2026
Pipeline montrant comment 25 tokens audio par seconde deviennent 1 500 par minute, 0,0135 $ par minute, et environ 0,81 $ par heure au tarif standard 2026

Quelques exemples chiffrés au tarif standard :

  • Un épisode de podcast de 30 minutes : environ 0,41 $ d'audio.
  • Un livre audio de 8 heures : environ 6,48 $.
  • 10 000 messages SVI de support de 15 secondes chacun : 3,75M de tokens audio, soit environ 33,75 $.

Exécutez l'un de ces cas en tâche batch de nuit et vous divisez le coût par deux, ce qui ramène le livre audio à environ 3,24 $. Pour une génération à fort volume et non interactive, le batch est le choix évident. Le seul endroit où l'étiquette de prix ne raconte pas toute l'histoire, c'est tout ce qu'un humain attend en temps réel, où vous payez le tarif priority et subissez une latence que vous ne contrôlez pas totalement.

Le piège : les prix doublent le 1er janvier 2027

C'est la partie à noter sur un post-it. Les chiffres de 0,50 $ et 9,00 $ sont des tarifs promotionnels de lancement. Le 1er janvier 2027, le texte en entrée standard passe à 1,00 $ par million et la sortie audio à 18,00 $ par million. Tous les autres paliers doublent au même rythme : la sortie audio batch et flex passe à 9,00 $, la sortie audio priority à 32,40 $.

Comparaison avant/après montrant les tarifs standard de Gemini 3.8 Flash TTS doubler de 9 $ à 18 $ en sortie audio et de 0,50 $ à 1,00 $ en texte d'entrée le 1er janvier 2027
Comparaison avant/après montrant les tarifs standard de Gemini 3.8 Flash TTS doubler de 9 $ à 18 $ en sortie audio et de 0,50 $ à 1,00 $ en texte d'entrée le 1er janvier 2027

Ainsi, cette heure d'audio à 0,81 $ passe à environ 1,62 $ en 2027, et le livre audio de 8 heures passe de 6,48 $ à 12,96 $. C'est le même mouvement que Google a appliqué sur les modèles texte, et c'est un mouvement raisonnable tant qu'on le voit venir. Si vous budgétisez au-delà de cette année, doublez les chiffres de cet article et planifiez à partir de là. Cela pousse aussi à sécuriser dès maintenant tout ce que vous pouvez comme économies de cache et de batch.

Comparaison avec ElevenLabs, OpenAI et le reste

Comparer des modèles vocaux est vraiment délicat, car les fournisseurs ne facturent pas de la même manière. Amazon, Azure et Deepgram facturent au caractère de texte en entrée. OpenAI et Google facturent au token audio en sortie, qui évolue avec la durée de la parole générée, pas avec le script. ElevenLabs vend des crédits d'abonnement. Pour tout ramener sur un même axe, j'ai converti chaque offre en coût estimé par heure de parole, en utilisant le repère d'Amazon lui-même selon lequel 1M de caractères équivaut à environ 23 heures d'audio. Considérez les chiffres à l'heure comme des estimations, pas comme des conditions contractuelles, car ils varient avec le rythme d'élocution.

FournisseurModèle pharePrix natif~ $/heure d'audioPalier gratuit
Gemini 3.8 Flash TTSgemini-3.8-flash-tts9 $ / 1M tokens audio~0,81 $Gratuit sur AI Studio
Amazon Polly (Neural)Neural16 $ / 1M caractères~0,70 $1M caractères/mois (12 mois)
Azure AI SpeechNeural / HD Flash15 $ / 1M caractères~0,65 $0,5M caractères/mois
OpenAIgpt-4o-mini-tts12 $ / 1M tokens audio~0,90 $Aucun
Amazon Polly (Generative)Generative30 $ / 1M caractères~1,30 $100k caractères/mois
DeepgramAura-230 $ / 1M caractères~1,30 $200 $ de crédit
ElevenLabsEleven v3 / Flash~5c/min (Business)~3,00 $10k crédits/mois

Ce qui m'a surpris : Gemini 3.8 Flash TTS est tarifé comme une voix neuronale banale alors qu'il s'agit de l'un des modèles génératifs expressifs. Les lignes les moins chères d'Amazon et d'Azure sont leurs anciennes voix neuronales ; leur palier de qualité générative (Polly Generative) est à 1,30 $ l'heure, et le modèle phare de Deepgram se retrouve au même niveau. ElevenLabs, toujours la référence en qualité vocale, coûte environ quatre fois plus cher à l'heure. Si le coût à l'heure est votre facteur décisif et que vous voulez tout de même un rendu expressif, Gemini est difficile à battre en ce moment, du moins jusqu'à ce que le réajustement de 2027 le fasse grimper à environ 1,62 $.

Pour le volet OpenAI de cette comparaison, mes articles sur l'API realtime d'OpenAI et les tarifs de gpt-realtime-mini approfondissent les cas où la voix facturée au token fait sens.

La voix est-elle vraiment bonne ?

Le prix ne compte que si le résultat est utilisable, et c'est là que les premiers retours deviennent plus partagés. Le déploiement a suscité un certain mécontentement sur la qualité. Un développeur sur Hacker News l'a dit sans détour :

Hacker News

"I don't know, I guess their roll out is a bit sloppy. It's a bit of a shame, though, since the voices which are available all sound like generic Gemini voices to me. Nothing stands out."

C'est l'avis d'une seule personne, et la préférence vocale est subjective, mais cela colle à un schéma récurrent : le TTS de Google est bon marché et large, tandis qu'ElevenLabs continue de remporter, pour beaucoup, le test « est-ce que cette voix précise sonne remarquable ». Certains utilisateurs restent pour l'instant fidèles à ce qu'ils connaissent :

Hacker News

"For on the go, I've been using ElevenReader. Technically not free but their free tier has been plenty for me."

La lecture honnête est donc la suivante. Si vous avez besoin d'une narration bon marché, multilingue et suffisamment bonne à grande échelle, Gemini 3.8 Flash TTS offre un excellent rapport qualité-prix. Si une voix unique, distinctive, qui incarne la marque, est le produit lui-même, testez-la soigneusement face à ElevenLabs avant de vous engager, et ne présumez pas que l'écart de prix signifie un écart de qualité en votre faveur.

Où un modèle vocal bon marché trouve sa place, et où non

Voici le recadrage que j'aimerais qu'un acheteur retienne. Un modèle TTS est une infrastructure. C'est un moyen fantastique et bon marché de donner une voix à une application : un pipeline de livres audio, un narrateur intégré au produit, une couche d'accessibilité, des invites SVI. Pour cela, 0,81 $ de l'heure est une très bonne affaire.

Mais dès que le cas d'usage devient le service client, le modèle représente les 10 % faciles du problème. La partie difficile, c'est tout ce qui l'entoure : extraire la bonne réponse de votre base de connaissances, appeler les outils qui résolvent vraiment un ticket, et être testé sur votre historique réel avant de parler à un client pour la première fois. C'est la différence entre une infrastructure et un employé. Gemini TTS est la première. Il ne connaîtra pas votre politique de remboursement ni ne triera un ticket, et assembler tout cela vous-même est un projet, pas un appel d'API.

C'est le cadre dans lequel nous travaillons chaque jour. Cela fait des années que nous déployons de l'IA sur des files de support en production, et ce qui sépare une démo d'un vrai déploiement n'est jamais le modèle, c'est toujours la plomberie et les tests. C'est pourquoi un agent de helpdesk IA est un achat très différent d'un endpoint vocal, même quand les deux affichent « IA » sur l'étiquette. Si vous évaluez de façon générale le calcul humain contre automatisation, notre comparatif coût d'un agent IA face à un agent humain est un meilleur point de départ qu'un simple tarif au token.

Essayer eesel

eesel est une plateforme de coéquipiers IA, et l'offre actuelle inclut un agent de helpdesk IA prêt à travailler qui rejoint votre file de support existante. Là où Gemini TTS est un modèle autour duquel il faut construire, eesel arrive en sachant déjà se connecter à votre helpdesk, apprendre de vos tickets passés, et être simulé sur de vraies conversations historiques pour que vous connaissiez son taux de résolution avant sa mise en production.

Écran d'onboarding d'eesel AI montrant un coéquipier IA connecté à un helpdesk et prêt à rédiger des réponses
Écran d'onboarding d'eesel AI montrant un coéquipier IA connecté à un helpdesk et prêt à rédiger des réponses

Si vous aimez travailler dans un terminal, la CLI eesel pilote le même coéquipier et le même espace de travail de manière programmatique. Vous pouvez l'utiliser manuellement, l'intégrer dans des scripts, ou laisser un agent de code comme Claude Code ou Cursor l'exécuter en mode headless, de sorte que l'IA que vous achetez est disponible à la fois dans le tableau de bord et via l'API, tout comme vous accéderiez à un modèle tel que Gemini TTS. Vous pouvez essayer eesel gratuitement et le simuler d'abord sur vos propres tickets.

Questions fréquentes

Combien coûte Gemini 3.8 Flash TTS ?
Les tarifs de Gemini 3.8 Flash TTS sont de 0,50 $ par million de tokens de texte en entrée et 9,00 $ par million de tokens audio en sortie sur le palier payant standard, jusqu'au 31 décembre 2026. Comme l'audio est facturé à 25 tokens par seconde, cela revient à environ 0,81 $ pour une heure complète de parole générée. À partir du 1er janvier 2027, les deux tarifs doublent. Pour une vue d'ensemble plus large, voir mon guide des tarifs de Google Gemini 3.
Existe-t-il un palier gratuit pour Gemini 3.8 Flash TTS ?
Oui. L'entrée et la sortie sont gratuites sur les paliers standard et priority via Google AI Studio, même si les paliers batch et flex sont payants uniquement. Le palier gratuit convient bien pour tester des voix, mais Google utilise le contenu du palier gratuit pour améliorer ses produits, donc lisez les conditions avant d'y faire passer quoi que ce soit de sensible. Les fonctions vocales grand public de l'application Gemini nécessitent un abonnement Google AI.
Comment les tarifs de Gemini 3.8 Flash TTS se comparent-ils à ElevenLabs ?
Ramené à la durée audio, Gemini 3.8 Flash TTS coûte environ 0,81 $ par heure de parole, tandis qu'ElevenLabs annonce un TTS à faible latence à partir d'environ 5 cents la minute (soit environ 3 $ l'heure) sur son plan Business. Gemini est bien moins cher à l'heure, mais ElevenLabs reste en tête sur la variété des voix et la maturité du clonage vocal. Le piège de tout modèle brut, c'est que le prix à l'heure n'est pas le même que le prix par conversation de service client résolue.
Pourquoi le prix de Gemini 3.8 Flash TTS double-t-il en janvier 2027 ?
Les tarifs de 0,50 $ et 9,00 $ sont promotionnels, selon le même schéma que Google a utilisé sur les précédents modèles Gemini. Le 1er janvier 2027, l'entrée standard passe à 1,00 $ par million et la sortie audio à 18,00 $ par million, et les multiplicateurs batch, flex et priority doublent en même temps. Si vous dimensionnez un budget pour 2027, doublez les chiffres d'aujourd'hui. Pour la version côté modèle texte de cette même falaise tarifaire, voir mon analyse des tarifs de Gemini 3.8 Flash.
Gemini 3.8 Flash TTS est-il assez bon pour la voix en service client ?
Il est bon marché et expressif, mais un modèle vocal ne gère que la partie parole. La voix en support a aussi besoin de recherche d'information, d'outils et de tests avant de toucher un appelant réel, et c'est là que la plupart des projets échouent vraiment. C'est le travail d'un agent de helpdesk IA, pas d'un simple endpoint TTS. Si vous cherchez spécifiquement la couche vocale, associez-la à quelque chose comme Zendesk voice AI ou une stack conçue sur mesure.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Illustration d'ondes sonores et d'étiquettes de prix représentant les prix de Gemini 3.8 Flash TTS
Trending

Prix de Gemini 3.8 Flash TTS : ce que coûte vraiment une heure de voix IA

Gemini 3.8 Flash TTS coûte 9 $ pour 1 million de tokens audio, soit environ 0,81 $ l'heure de parole. Voici tous les paliers tarifaires, le piège de 2027, et la comparaison avec ElevenLabs et OpenAI.

Rama Adi NugrahaRama Adi NugrahaSep 24, 2026
Illustration d'ondes sonores, d'un panneau de contrôle de conception vocale et d'un bouton de lecture représentant Gemini 3.8 Flash TTS
Trending

Avis sur Gemini 3.8 Flash TTS : le nouveau modèle vocal de Google en vaut-il la peine ?

Un avis concret sur Gemini 3.8 Flash TTS : à quoi il ressemble vraiment, ce qu'on peut contrôler, où il bat ElevenLabs sur le prix, et le seul benchmark où Google n'était pas en tête.

Alicia Kirana UtomoAlicia Kirana UtomoSep 24, 2026
Illustration d'une équipe évaluant Gemini 3.8 Flash, avec un indicateur de vitesse, une fusée et une coche de verdict
Trending

Avis sur Gemini 3.8 Flash : rapide, verbeux et pas la mise à niveau que le numéro suggère

Un avis pratique sur Gemini 3.8 Flash : ce qu'il fait bien, où il pêche, le piège des 13 secondes que personne n'a mentionné, et si ça vaut le coup de passer de 3.7 Flash.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Illustration de deux personnes consultant des graphiques et des compteurs de vitesse autour d'une étincelle Gemini, représentant les tarifs de Gemini 3.8 Flash
Trending

Tarifs de Gemini 3.8 Flash : chaque tarif, le coût caché et le piège

Gemini 3.8 Flash coûte 0,75 $/3,75 $ par million de tokens, exactement comme 3.7 Flash. Mais le prix affiché cache une taxe de verbosité, et les deux montants doublent le 1er janvier 2027.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Illustration d'un robot rapide en train de coder sur un ordinateur portable pendant qu'une personne l'observe, représentant Gemini 3.8 Flash
Trending

Gemini 3.8 Flash : ce que c'est, des benchmarks honnêtes et mon avis

Google a lancé Gemini 3.8 Flash le 2 septembre 2026, trois semaines après 3.7. Même prix, meilleurs scores, et une ligne en petits caractères qui change la réponse.

Alicia Kirana UtomoAlicia Kirana UtomoSep 3, 2026
Texte alternatif de l'image
Guides

Gemini 3 Pro vs Claude Opus 4.6 : une comparaison pratique

Ce guide propose un regard direct et pratique sur Gemini 3 Pro et Claude Opus 4.6. Nous irons au-delà du battage médiatique pour nous concentrer sur les différences concrètes qui comptent lorsque vous mettez ces outils au travail.

Stevia PutriStevia PutriFeb 6, 2026
Tarifs DeepSeek V4 Flash : ce que vous paierez réellement
Trending

Tarifs DeepSeek V4 Flash : ce que vous paierez réellement

DeepSeek V4 Flash affiche $0.14 en entrée et $0.28 en sortie par million de tokens. Des utilisateurs réels ont publié des taux mixtes sous le cent. Voici ce qui décide lequel des deux vous attend.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Un testeur regardant une fiche de verdict avec deux cadrans d'effort étiquetés bas et max, à côté de la baleine DeepSeek
Trending

Avis sur DeepSeek V4 Flash : un modèle, deux personnalités

Un avis sur DeepSeek V4 Flash construit sur les chiffres publiés par les deux classements. L'exécution bon marché et l'exécution intelligente sont les mêmes poids, et cela change le verdict.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
DeepSeek V4 Flash : specs, prix et à quoi il sert vraiment
Trending

DeepSeek V4 Flash : specs, prix et à quoi il sert vraiment

DeepSeek V4 Flash coûte $0,14 en entrée et $0,28 en sortie par million de tokens, et surpasse le modèle haut de gamme, plus cher, de DeepSeek. Voici ce que la grille tarifaire ne dit pas.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement