
Gemini 3.8 Flash TTSとは実際どんなものか
Gemini 3.8 Flash TTS(gemini-3.8-flash-tts)はGoogleの現行のテキスト読み上げモデルであり、出回っている多くの音声モデルと違い、プレビューではなく安定版だ。IDに-previewサフィックスは付いておらず、Googleは旧gemini-3.1-flash-tts-previewの推奨後継として位置づけている。テキストを受け取り音声だけを出力する、まさに専用の音声モデルに求められる動作をする。
スペックは充実している。30種類の作り込まれたスタジオボイス(Zephyr、Puck、Kore、Fenrirなど)があり、それぞれBrightやFirmといった説明が付いている。さらにclient.voices.list()で呼び出せる数百のExtended Voice Libraryもある。自動検出入力で130言語を話し、自然言語プロンプトでスタイル、アクセント、テンポ、トーンを制御したり、<laugh>や<sigh>のようなインラインタグでピンポイントの発声イベントを挿入したりできる。テキスト説明からペルソナを作るボイスデザインや、参照クリップからのボイスクローニングも備えている。
本番運用で効いてくる仕様が1つある。マルチスピーカーは1リクエストあたり2話者までに制限されている。3人のポッドキャストやグループシーンでは、各発話を個別に合成し、音声を自分でつなぎ合わせる必要がある。出力はデフォルトで24kHzモノラルWAVで、電話用にmulawとalawも利用できる。これはテキスト専用のGemini 3.8 Flashモデルと並存しており、両者はまったく異なる方法で課金されるため、混乱の大半はここから生まれる。
Gemini 3.8 Flash TTSの料金:全体の一覧表
以下は2026年のプロモーション価格における、100万トークンあたりのUSD建て全ティアだ。2027年の料金は括弧内に示した。後述のとおり、すべてが倍になるためだ。
| ティア | テキスト入力/100万 | 音声出力/100万 | 備考 |
|---|---|---|---|
| Standard | 0.50ドル(1.00ドル) | 9.00ドル(18.00ドル) | デフォルトの料金 |
| Batch | 0.25ドル(0.50ドル) | 4.50ドル(9.00ドル) | 約50%オフ、非同期ジョブ |
| Flex | 0.25ドル(0.50ドル) | 4.50ドル(9.00ドル) | 料金は同じ、キャッシュが安い |
| Priority | 0.90ドル(1.80ドル) | 16.20ドル(32.40ドル) | 約1.8倍、低遅延重視 |
| Free | 無料 | 無料 | AI Studio経由のstandard/priority |
これらはすべてGoogleのGemini API料金ページから直接引用している。コンテキストキャッシュもサポートされており、standardティアでは入力キャッシュ100万トークンあたり0.125ドルから、加えて1時間あたり100万トークンあたり0.50ドルのストレージ料金がかかる。重要なのは音声出力の数字で、これは生成する音声量に応じてスケールするからだ。それに比べればテキスト入力はほぼ誤差の範囲だ。
密かに興味深いのは、9.00ドルという価格がGoogle自身のラインナップの中でどこに位置するかだ。これは後継元であるGemini 2.5 Flash TTS(音声出力10ドル)より安く、2.5 Proや3.1 Flash TTSプレビューモデル(音声出力20ドル)の半額以下だ。さらに安価な兄弟モデルFlash-Lite TTSもあり、130言語ではなく101言語で構わないなら音声出力6ドルだ。

実際にいくらかかるのか
トークン単価は実感しづらいので、実際の金額に変換してみよう。音声は1秒あたり25トークンで課金され、1分あたり1,500トークン、1時間あたり90,000トークンになる。2026年の標準料金である100万あたり9.00ドルでは、生成された音声1時間はおよそ0.81ドルだ。投入したテキスト分(1時間のナレーション全体でも入力トークンは約12,000程度)を加えても、1セント未満しか増えない。

標準料金でのいくつかの試算:
- 30分のポッドキャストエピソード: 音声で約0.41ドル。
- 8時間のオーディオブック: 約6.48ドル。
- 1件15秒の10,000件のサポートIVRメッセージ: 音声トークン375万で約33.75ドル。
これらを夜間のバッチジョブとして実行すれば半額になり、オーディオブックは約3.24ドルに近づく。大量かつ非対話的な生成には、バッチが明らかな選択肢だ。価格表が全てを物語らない唯一の場面は、人間がリアルタイムで待つケースで、そこではpriority料金を支払い、完全には制御できない遅延を受け入れることになる。
落とし穴:2027年1月1日に価格が倍になる
これは付箋に書き留めておくべき部分だ。0.50ドルと9.00ドルという数字はプロモーション導入価格だ。2027年1月1日に、standardのテキスト入力は100万あたり1.00ドルに、音声出力は100万あたり18.00ドルになる。他のティアもすべて同じペースで倍になる:batchとflexの音声出力は9.00ドルに、priorityの音声出力は32.40ドルになる。

つまり、あの0.81ドルの音声1時間は2027年には約1.62ドルになり、8時間のオーディオブックは6.48ドルから12.96ドルに上がる。これはGoogleがテキストモデルで既に行ったのと同じ動きであり、事前に見えている限りは妥当なものだ。今年より先の予算を組むなら、この記事の数字を2倍にしてそこから計画してほしい。これは今のうちにできるだけキャッシュとバッチの節約を確保しておく後押しにもなる。
ElevenLabs、OpenAIなど他社との比較
音声モデルの比較は本当に厄介だ。ベンダーの課金方法が揃っていないからだ。Amazon、Azure、Deepgramは入力テキストの文字数で課金する。OpenAIとGoogleは音声出力トークンで課金し、これは台本の長さではなく生成された音声の長さに応じてスケールする。ElevenLabsはサブスクリプションクレジットを販売している。全てを1つの軸に乗せるため、Amazon自身の目安である100万文字が約23時間の音声に相当するという基準を使い、すべてを音声1時間あたりの推定コストに換算した。1時間あたりの数字は話す速度によって変動するため、契約条件ではなく目安として扱ってほしい。
| ベンダー | 主力モデル | ネイティブ価格 | ~ $/音声1時間 | 無料ティア |
|---|---|---|---|---|
| Gemini 3.8 Flash TTS | gemini-3.8-flash-tts | 9ドル/100万音声トークン | ~0.81ドル | AI Studioで無料 |
| Amazon Polly(Neural) | Neural | 16ドル/100万文字 | ~0.70ドル | 100万文字/月(12ヶ月) |
| Azure AI Speech | Neural / HD Flash | 15ドル/100万文字 | ~0.65ドル | 50万文字/月 |
| OpenAI | gpt-4o-mini-tts | 12ドル/100万音声トークン | ~0.90ドル | なし |
| Amazon Polly(Generative) | Generative | 30ドル/100万文字 | ~1.30ドル | 10万文字/月 |
| Deepgram | Aura-2 | 30ドル/100万文字 | ~1.30ドル | 200ドル分のクレジット |
| ElevenLabs | Eleven v3 / Flash | 約5セント/分(Business) | ~3.00ドル | 月1万クレジット |
驚かされたのはこの点だ。Gemini 3.8 Flash TTSは、表現力豊かな生成モデルの1つでありながら、ありふれたニューラル音声のような価格が付いている。AmazonとAzureの安い行は旧世代のニューラル音声であり、それぞれの生成品質ティア(Polly Generative)は1時間あたり1.30ドル、Deepgramの主力モデルも同じ水準に落ち着く。依然として音声品質の基準点であるElevenLabsは、1時間あたりの価格がおよそ4倍だ。1時間あたりのコストが決め手で、なおかつ表現力豊かな出力が欲しいなら、Geminiは今のところなかなか勝てない相手だ。少なくとも2027年のリセットで約1.62ドルに押し上げられるまでは。
OpenAI側の詳しい比較については、OpenAI Realtime APIとgpt-realtime-miniの料金に関する記事で、トークン課金の音声がどこで意味を持つかをより深く掘り下げている。
音声の質は実際どうなのか
価格が意味を持つのは出力が使い物になる場合だけであり、ここで初期の反応がより分かれている。ロールアウトには品質面での不満の声もあった。あるHacker Newsの開発者は率直にこう言っている。
"I don't know, I guess their roll out is a bit sloppy. It's a bit of a shame, though, since the voices which are available all sound like generic Gemini voices to me. Nothing stands out."
これは1人の意見に過ぎず、音声の好みは主観的なものだが、あるパターンと一致している。GoogleのTTSは安価で幅広い一方、「この特定の声が際立って聞こえるか」というテストでは、多くの人にとって依然としてElevenLabsに軍配が上がる。今のところ慣れ親しんだものを使い続けているユーザーもいる。
"For on the go, I've been using ElevenReader. Technically not free but their free tier has been plenty for me."
つまり、率直な見立てはこうなる。大規模に安価で多言語、そこそこ良いナレーションが必要なら、Gemini 3.8 Flash TTSは非常に優れたコストパフォーマンスだ。一方、唯一無二でブランドを象徴するような声こそが製品そのものであるなら、確約する前にElevenLabsと慎重に比較試聴すべきであり、価格差が自分に有利な品質差を意味すると決めつけるべきではない。
安価な音声モデルが合う場面、合わない場面
ここで、購入者に持ち帰ってほしい捉え直しを示しておこう。TTSモデルはインフラだ。オーディオブックのパイプライン、プロダクト内のナレーター、アクセシビリティレイヤー、IVRプロンプトなど、アプリに声を与える手段として非常に優秀で安価だ。こうした用途には、1時間あたり0.81ドルは本当にお買い得だ。
しかし、ユースケースがカスタマーサポートになった途端、モデルは問題全体のうち簡単な10%に過ぎなくなる。難しいのはその周りにある全てだ。ナレッジベースから正しい答えを引き出すこと、チケットを実際に解決するツールを呼び出すこと、顧客に話しかける前に実際の履歴でテストされること。これがインフラと従業員の違いだ。Gemini TTSは前者にすぎない。返金ポリシーを知らず、チケットのトリアージもできず、それら全てを自分でつなぎ合わせるのはAPIコール1つではなく、1つのプロジェクトだ。
これは私たちが日々取り組んでいる枠組みだ。私たちは長年、稼働中のサポートキューにAIを組み込んできており、デモと実際の導入を分けるのは常にモデルではなく、配線とテストだ。だからこそAIヘルプデスクエージェントは、たとえ両方とも「AI」を謳っていても、音声エンドポイントとはまったく別の買い物になる。人間と自動化のどちらが得かを一般的に検討しているなら、トークン単価よりもAIエージェント対人間のエージェントのコストの記事の方が良い出発点になる。
eeselを試す
eeselはAIチームメイトのプラットフォームであり、現在のラインナップにはすぐに働けるAIヘルプデスクエージェントがあり、既存のサポートキューに加わってくれる。Gemini TTSが周りを自分で構築する必要のあるモデルであるのに対し、eeselはあなたのヘルプデスクへの接続方法、過去のチケットからの学習方法をすでに知った状態で届き、本番導入前に実際の過去の会話に対してシミュレーションされるため、解決率を事前に把握できる。

ターミナルでの作業が好きなら、eesel CLIが同じチームメイトとワークスペースをプログラムから操作できる。手動で操作することも、スクリプトに組み込むことも、Claude CodeやCursorのようなコーディングエージェントにヘッドレスで実行させることもでき、Gemini TTSのようなモデルにアクセスするのと同じように、購入したAIをダッシュボードとAPIの両方から利用できるようになる。eeselを無料で試して、まず自分のチケットに対してシミュレーションしてみるとよい。
よくある質問
Gemini 3.8 Flash TTSの料金はいくらですか?
Gemini 3.8 Flash TTSに無料ティアはありますか?
Gemini 3.8 Flash TTSの料金はElevenLabsと比べてどうですか?
なぜGemini 3.8 Flash TTSの価格は2027年1月に倍になるのですか?
Gemini 3.8 Flash TTSはカスタマーサポート音声に十分な品質ですか?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








