
Gemini 3.8 Flash TTSとは実際何か
Gemini 3.8 Flash TTS(gemini-3.8-flash-tts)は、Googleの現行のテキスト読み上げモデルで、出回っている多くの音声モデルと異なり、プレビューではなく安定版です。IDに-previewサフィックスは付いておらず、Googleは古いgemini-3.1-flash-tts-previewの推奨後継として位置づけています。テキストを受け取り音声を出力するだけで、他には何もしません。これはまさに専用音声モデルに求められることです。
スペックは充実しています。30種類のプリビルトスタジオボイス(Zephyr、Puck、Kore、Fenrirなど)があり、それぞれBrightやFirmといったディスクリプタが付いています。さらにclient.voices.list()で取得できる、数百種類のExtended Voice Libraryもあります。130言語を自動検出で話し、自然言語プロンプトでスタイル、アクセント、ペース、トーンを調整したり、<laugh>や<sigh>のようなインラインタグでピンポイントの音声イベントを挿入したりできます。テキスト説明からペルソナを構築するボイスデザインや、参照クリップからのボイスクローニングも備えています。
本番運用で問題になる仕様が一つあります。マルチスピーカーは1リクエストあたり2話者までに制限されています。3人のポッドキャストやグループシーンでは、各発話を個別に合成し、自分で音声をつなぎ合わせる必要があります。出力はデフォルトで24kHzモノラルWAVで、電話用にmulawとalawも利用できます。これはテキスト専用のGemini 3.8 Flashモデルと並行して存在し、両者の課金体系はまったく異なります。混乱の大半はここから生まれます。
Gemini 3.8 Flash TTS 料金:完全な表
以下は、2026年のプロモーションレートでの、100万トークンあたりのUSD建て全ティアです。すべてが2倍になることは後述するため、2027年のレートはカッコ内に示しています。
| ティア | テキスト入力 / 100万 | 音声出力 / 100万 | 備考 |
|---|---|---|---|
| 標準 | 0.50ドル(1.00ドル) | 9.00ドル(18.00ドル) | デフォルトレート |
| Batch | 0.25ドル(0.50ドル) | 4.50ドル(9.00ドル) | 約50%割引、非同期ジョブ |
| Flex | 0.25ドル(0.50ドル) | 4.50ドル(9.00ドル) | レートは同じ、キャッシュが安価 |
| Priority | 0.90ドル(1.80ドル) | 16.20ドル(32.40ドル) | 約1.8倍、低遅延重視 |
| Free | 無料 | 無料 | AI Studio経由の標準/priority |
これらはすべてGoogleのGemini API料金ページから直接引用しています。コンテキストキャッシュにも対応しており、標準ティアで入力キャッシュ100万トークンあたり0.125ドルから、さらに1時間あたり100万トークンあたり0.50ドルのストレージ料金がかかります。重要なのは音声出力の数字で、これは生成する音声量に比例してスケールします。テキスト入力は、それに比べればほぼ誤差の範囲です。
興味深いのは、この9.00ドルという価格がGoogle自身のラインナップのどこに位置するかです。これは後継元であるGemini 2.5 Flash TTS(音声出力10ドル)より安く、2.5 ProとGemini 3.1 Flash TTSのプレビューモデル(音声出力20ドル)の半額以下です。101言語で妥協できるなら、音声出力6ドルのより安価な兄弟モデル、Flash-Lite TTSもあります。

実際にかかるコスト
トークン単価は実感しづらいので、実際の金額に変換してみましょう。音声は1秒あたり25トークンで課金されるため、1分あたり1,500トークン、1時間あたり90,000トークンになります。2026年の標準レート、100万トークンあたり9.00ドルで計算すると、生成音声1時間分はおよそ0.81ドルです。入力したテキスト分を足しても(ナレーション1時間分でも入力トークンはわずか約12,000)、追加コストは1セント未満です。

標準レートでの具体例をいくつか挙げます。
- 30分のポッドキャストエピソード: 音声コストは約0.41ドル。
- 8時間のオーディオブック: 約6.48ドル。
- サポート用IVRメッセージ10,000件(それぞれ15秒):音声トークン375万個、約33.75ドル。
これらを夜間のバッチジョブとして実行すれば半額になり、オーディオブックは3.24ドルに近づきます。大量かつ非対話的な生成には、バッチが明らかに有利な選択肢です。単純な価格表が実態を語りきれないのは、人がリアルタイムで待つあらゆる場面で、その場合priorityレートを支払い、完全には制御できない遅延を負うことになります。
落とし穴:価格は2027年1月1日に2倍になる
これは付箋に書き留めておくべき部分です。0.50ドルと9.00ドルという数字は導入プロモーション価格です。2027年1月1日には、標準のテキスト入力は100万トークンあたり1.00ドルに、音声出力は100万トークンあたり18.00ドルになります。他のすべてのティアも同時に2倍になります。batchとflexの音声出力は9.00ドルに、priorityの音声出力は32.40ドルになります。

つまり、0.81ドルだった音声1時間分は2027年には約1.62ドルになり、8時間のオーディオブックは6.48ドルから12.96ドルに上がります。これはGoogleがテキストモデルで既に行ったのと同じ動きであり、事前に予測できていれば公正な話です。今年より先の予算を組んでいるなら、この記事の数字を2倍にして計画を立ててください。これは、今のうちにキャッシュとバッチの節約分を確保しておくべきだという後押しでもあります。
ElevenLabs、OpenAI、その他との比較
音声モデルの比較は本当に厄介です。ベンダーごとに課金方法が違うからです。Amazon、Azure、Deepgramは入力テキストの文字数で課金します。OpenAIとGoogleは音声出力トークンで課金し、これは台本の長さではなく生成音声の長さに比例します。ElevenLabsはサブスクリプションクレジットを販売しています。すべてを一つの軸に揃えるために、Amazon自身の基準である100万文字は約23時間の音声に相当するという数字を使い、すべてを音声1時間あたりの推定コストに換算しました。1時間あたりの数字は話す速度によって変動するため、契約条件ではなく目安として扱ってください。
| ベンダー | フラッグシップモデル | ネイティブ価格 | 音声1時間あたり~ドル | 無料ティア |
|---|---|---|---|---|
| Gemini 3.8 Flash TTS | gemini-3.8-flash-tts | 音声トークン100万個あたり9ドル | ~0.81ドル | AI Studioで無料 |
| Amazon Polly(Neural) | Neural | 文字100万あたり16ドル | ~0.70ドル | 月100万文字(12か月) |
| Azure AI Speech | Neural / HD Flash | 文字100万あたり15ドル | ~0.65ドル | 月0.5万文字 |
| OpenAI | gpt-4o-mini-tts | 音声トークン100万個あたり12ドル | ~0.90ドル | なし |
| Amazon Polly(Generative) | Generative | 文字100万あたり30ドル | ~1.30ドル | 月10万文字 |
| Deepgram | Aura-2 | 文字100万あたり30ドル | ~1.30ドル | 200ドル分のクレジット |
| ElevenLabs | Eleven v3 / Flash | 約5セント/分(Business) | ~3.00ドル | 月1万クレジット |
意外だったのは、Gemini 3.8 Flash TTSがコモディティ的なニューラル音声のような価格でありながら、実際にはより表現力の高い生成モデルの一つだという点です。AmazonとAzureの安いほうの行は、旧世代のニューラル音声です。生成品質ティア(Polly Generative)は1時間あたり1.30ドルで、Deepgramのフラッグシップも同じ水準に落ち着きます。依然として音声品質の基準点であるElevenLabsは、1時間あたりでおよそ4倍の価格です。1時間あたりのコストが決め手で、かつ表現力のある出力が欲しいなら、少なくとも2027年のリセットで約1.62ドルに引き上げられるまでは、今のGeminiはほぼ最強です。
この比較のOpenAI側については、私が書いたOpenAI Realtime APIとgpt-realtime-miniの料金の記事が、トークン課金の音声が意味を持つ場面をさらに掘り下げています。
声の品質は実際どうなのか
価格が意味を持つのは出力が使い物になる場合だけで、ここで初期の反応はより賛否が分かれています。ロールアウトは品質面で多少の不満を招きました。あるHacker Newsの開発者は率直にこう述べています。
"I don't know, I guess their roll out is a bit sloppy. It's a bit of a shame, though, since the voices which are available all sound like generic Gemini voices to me. Nothing stands out."
これは一人の耳の評価であり、声の好みは主観的ですが、ある傾向とは一致します。GoogleのTTSは安価で幅広い一方、多くの人にとって「この特定の声が際立って聞こえるか」というテストでは、ElevenLabsが依然として勝っています。とりあえず慣れたものを使い続けているユーザーもいます。
"For on the go, I've been using ElevenReader. Technically not free but their free tier has been plenty for me."
つまり正直な結論はこうです。安価で多言語対応の、十分な品質のナレーションを大規模に必要としているなら、Gemini 3.8 Flash TTSはコストパフォーマンスに優れた選択です。単一の、際立った、ブランドを象徴する声こそが製品であるなら、ElevenLabsと慎重に比較検討してください。価格差が品質差につながっているとは限りません。
安価な音声モデルが適する場面、適さない場面
ここで、買い手に持ち帰ってほしい捉え直しを示します。TTSモデルはインフラです。アプリに声を与える、素晴らしく安価な方法です。オーディオブックのパイプライン、製品内のナレーター、アクセシビリティレイヤー、IVRプロンプトなど。こうした用途には、1時間あたり0.81ドルは本当に良い取引です。
しかし、ユースケースがカスタマーサポートになった瞬間、モデルは問題の簡単な10%にすぎなくなります。難しいのはその周辺すべてです。ナレッジベースから正しい回答を引き出すこと、チケットを実際に解決するツールを呼び出すこと、顧客に話しかける前に実際の対応履歴でテストされることです。これがインフラと従業員の違いです。Gemini TTSは前者です。返金ポリシーを知らず、チケットのトリアージもできません。これらをすべて自分で組み立てるのはプロジェクトであり、単なるAPI呼び出しではありません。
これは私たちが日々取り組んでいる枠組みです。私たちは何年もかけて、実際のサポートキューにAIを投入してきました。デモと本番投入を分けるものは、決してモデルそのものではなく、常に配線とテストです。だからこそAIヘルプデスクエージェントは、どちらも「AI」を謳っていても、音声エンドポイントとはまったく異なる買い物なのです。人間と自動化のどちらを選ぶかという計算を一般論として検討しているなら、私たちのAIエージェント対人間エージェントのコストの分析が、トークン単価よりも良い出発点になります。
eeselを試す
eeselはAIチームメイトのプラットフォームで、現在のラインナップには、既存のサポートキューに参加できる、すぐに使えるAIヘルプデスクエージェントが含まれています。Gemini TTSが自分で構築する必要のあるモデルであるのに対し、eeselは最初から、あなたのヘルプデスクへの接続方法を知っており、過去のチケットから学習し、実際の過去の会話に対してシミュレーションされます。そのため、本番投入前に解決率を把握できます。

ターミナルでの作業を好むなら、eesel CLIが同じチームメイトとワークスペースをプログラムから操作します。手動で操作することも、スクリプトに組み込むことも、Claude CodeやCursorのようなコーディングエージェントにヘッドレスで実行させることもできます。つまり、購入したAIは、Gemini TTSのようなモデルにアクセスするのと同じように、ダッシュボードとAPIの両方から利用可能です。eeselを無料で試して、まずは自分のチケットに対してシミュレーションしてみてください。
よくある質問
Gemini 3.8 Flash TTSの料金はいくらですか?
Gemini 3.8 Flash TTSに無料ティアはありますか?
Gemini 3.8 Flash TTSの料金はElevenLabsと比べてどうですか?
なぜGemini 3.8 Flash TTSの料金は2027年1月に2倍になるのですか?
Gemini 3.8 Flash TTSはカスタマーサポートの音声用として十分な性能ですか?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








