Gemini 3.8 Flash TTSの料金:AI音声1時間の実際のコスト

Rama Adi Nugraha
執筆者

Rama Adi Nugraha

Katelin Teen
レビュー者

Katelin Teen

最終更新 September 23, 2026

専門家による検証済み
Gemini 3.8 Flash TTSの料金を表す、音波と値札のイラスト

Gemini 3.8 Flash TTSとは実際何か

Gemini 3.8 Flash TTS(gemini-3.8-flash-tts)は、Googleの現行のテキスト読み上げモデルで、出回っている多くの音声モデルと異なり、プレビューではなく安定版です。IDに-previewサフィックスは付いておらず、Googleは古いgemini-3.1-flash-tts-previewの推奨後継として位置づけています。テキストを受け取り音声を出力するだけで、他には何もしません。これはまさに専用音声モデルに求められることです。

スペックは充実しています。30種類のプリビルトスタジオボイス(Zephyr、Puck、Kore、Fenrirなど)があり、それぞれBrightやFirmといったディスクリプタが付いています。さらにclient.voices.list()で取得できる、数百種類のExtended Voice Libraryもあります。130言語を自動検出で話し、自然言語プロンプトでスタイル、アクセント、ペース、トーンを調整したり、<laugh>や<sigh>のようなインラインタグでピンポイントの音声イベントを挿入したりできます。テキスト説明からペルソナを構築するボイスデザインや、参照クリップからのボイスクローニングも備えています。

本番運用で問題になる仕様が一つあります。マルチスピーカーは1リクエストあたり2話者までに制限されています。3人のポッドキャストやグループシーンでは、各発話を個別に合成し、自分で音声をつなぎ合わせる必要があります。出力はデフォルトで24kHzモノラルWAVで、電話用にmulawとalawも利用できます。これはテキスト専用のGemini 3.8 Flashモデルと並行して存在し、両者の課金体系はまったく異なります。混乱の大半はここから生まれます。

Gemini 3.8 Flash TTS 料金:完全な表

以下は、2026年のプロモーションレートでの、100万トークンあたりのUSD建て全ティアです。すべてが2倍になることは後述するため、2027年のレートはカッコ内に示しています。

ティアテキスト入力 / 100万音声出力 / 100万備考
標準0.50ドル(1.00ドル)9.00ドル(18.00ドル)デフォルトレート
Batch0.25ドル(0.50ドル)4.50ドル(9.00ドル)約50%割引、非同期ジョブ
Flex0.25ドル(0.50ドル)4.50ドル(9.00ドル)レートは同じ、キャッシュが安価
Priority0.90ドル(1.80ドル)16.20ドル(32.40ドル)約1.8倍、低遅延重視
Free無料無料AI Studio経由の標準/priority

これらはすべてGoogleのGemini API料金ページから直接引用しています。コンテキストキャッシュにも対応しており、標準ティアで入力キャッシュ100万トークンあたり0.125ドルから、さらに1時間あたり100万トークンあたり0.50ドルのストレージ料金がかかります。重要なのは音声出力の数字で、これは生成する音声量に比例してスケールします。テキスト入力は、それに比べればほぼ誤差の範囲です。

興味深いのは、この9.00ドルという価格がGoogle自身のラインナップのどこに位置するかです。これは後継元であるGemini 2.5 Flash TTS(音声出力10ドル)より安く、2.5 ProとGemini 3.1 Flash TTSのプレビューモデル(音声出力20ドル)の半額以下です。101言語で妥協できるなら、音声出力6ドルのより安価な兄弟モデル、Flash-Lite TTSもあります。

Geminiのテキスト読み上げモデル間で、100万トークンあたりの音声出力コストを比較した棒グラフ。3.8 Flash TTSの9ドルがハイライトされている
Geminiのテキスト読み上げモデル間で、100万トークンあたりの音声出力コストを比較した棒グラフ。3.8 Flash TTSの9ドルがハイライトされている

実際にかかるコスト

トークン単価は実感しづらいので、実際の金額に変換してみましょう。音声は1秒あたり25トークンで課金されるため、1分あたり1,500トークン、1時間あたり90,000トークンになります。2026年の標準レート、100万トークンあたり9.00ドルで計算すると、生成音声1時間分はおよそ0.81ドルです。入力したテキスト分を足しても(ナレーション1時間分でも入力トークンはわずか約12,000)、追加コストは1セント未満です。

25の音声トークン毎秒が、1分あたり1,500トークン、1分あたり0.0135ドル、2026年の標準レートで1時間あたり約0.81ドルになる過程を示すパイプライン図
25の音声トークン毎秒が、1分あたり1,500トークン、1分あたり0.0135ドル、2026年の標準レートで1時間あたり約0.81ドルになる過程を示すパイプライン図

標準レートでの具体例をいくつか挙げます。

  • 30分のポッドキャストエピソード: 音声コストは約0.41ドル。
  • 8時間のオーディオブック: 約6.48ドル。
  • サポート用IVRメッセージ10,000件(それぞれ15秒):音声トークン375万個、約33.75ドル。

これらを夜間のバッチジョブとして実行すれば半額になり、オーディオブックは3.24ドルに近づきます。大量かつ非対話的な生成には、バッチが明らかに有利な選択肢です。単純な価格表が実態を語りきれないのは、人がリアルタイムで待つあらゆる場面で、その場合priorityレートを支払い、完全には制御できない遅延を負うことになります。

落とし穴:価格は2027年1月1日に2倍になる

これは付箋に書き留めておくべき部分です。0.50ドルと9.00ドルという数字は導入プロモーション価格です。2027年1月1日には、標準のテキスト入力は100万トークンあたり1.00ドルに、音声出力は100万トークンあたり18.00ドルになります。他のすべてのティアも同時に2倍になります。batchとflexの音声出力は9.00ドルに、priorityの音声出力は32.40ドルになります。

Gemini 3.8 Flash TTSの標準レートが、2027年1月1日に音声出力9ドルから18ドルへ、テキスト入力0.50ドルから1.00ドルへ2倍になることを示すビフォーアフター比較図
Gemini 3.8 Flash TTSの標準レートが、2027年1月1日に音声出力9ドルから18ドルへ、テキスト入力0.50ドルから1.00ドルへ2倍になることを示すビフォーアフター比較図

つまり、0.81ドルだった音声1時間分は2027年には約1.62ドルになり、8時間のオーディオブックは6.48ドルから12.96ドルに上がります。これはGoogleがテキストモデルで既に行ったのと同じ動きであり、事前に予測できていれば公正な話です。今年より先の予算を組んでいるなら、この記事の数字を2倍にして計画を立ててください。これは、今のうちにキャッシュとバッチの節約分を確保しておくべきだという後押しでもあります。

ElevenLabs、OpenAI、その他との比較

音声モデルの比較は本当に厄介です。ベンダーごとに課金方法が違うからです。Amazon、Azure、Deepgramは入力テキストの文字数で課金します。OpenAIとGoogleは音声出力トークンで課金し、これは台本の長さではなく生成音声の長さに比例します。ElevenLabsはサブスクリプションクレジットを販売しています。すべてを一つの軸に揃えるために、Amazon自身の基準である100万文字は約23時間の音声に相当するという数字を使い、すべてを音声1時間あたりの推定コストに換算しました。1時間あたりの数字は話す速度によって変動するため、契約条件ではなく目安として扱ってください。

ベンダーフラッグシップモデルネイティブ価格音声1時間あたり~ドル無料ティア
Gemini 3.8 Flash TTSgemini-3.8-flash-tts音声トークン100万個あたり9ドル~0.81ドルAI Studioで無料
Amazon Polly(Neural)Neural文字100万あたり16ドル~0.70ドル月100万文字(12か月)
Azure AI SpeechNeural / HD Flash文字100万あたり15ドル~0.65ドル月0.5万文字
OpenAIgpt-4o-mini-tts音声トークン100万個あたり12ドル~0.90ドルなし
Amazon Polly(Generative)Generative文字100万あたり30ドル~1.30ドル月10万文字
DeepgramAura-2文字100万あたり30ドル~1.30ドル200ドル分のクレジット
ElevenLabsEleven v3 / Flash約5セント/分(Business)~3.00ドル月1万クレジット

意外だったのは、Gemini 3.8 Flash TTSがコモディティ的なニューラル音声のような価格でありながら、実際にはより表現力の高い生成モデルの一つだという点です。AmazonとAzureの安いほうの行は、旧世代のニューラル音声です。生成品質ティア(Polly Generative)は1時間あたり1.30ドルで、Deepgramのフラッグシップも同じ水準に落ち着きます。依然として音声品質の基準点であるElevenLabsは、1時間あたりでおよそ4倍の価格です。1時間あたりのコストが決め手で、かつ表現力のある出力が欲しいなら、少なくとも2027年のリセットで約1.62ドルに引き上げられるまでは、今のGeminiはほぼ最強です。

この比較のOpenAI側については、私が書いたOpenAI Realtime APIとgpt-realtime-miniの料金の記事が、トークン課金の音声が意味を持つ場面をさらに掘り下げています。

声の品質は実際どうなのか

価格が意味を持つのは出力が使い物になる場合だけで、ここで初期の反応はより賛否が分かれています。ロールアウトは品質面で多少の不満を招きました。あるHacker Newsの開発者は率直にこう述べています。

Hacker News

"I don't know, I guess their roll out is a bit sloppy. It's a bit of a shame, though, since the voices which are available all sound like generic Gemini voices to me. Nothing stands out."

これは一人の耳の評価であり、声の好みは主観的ですが、ある傾向とは一致します。GoogleのTTSは安価で幅広い一方、多くの人にとって「この特定の声が際立って聞こえるか」というテストでは、ElevenLabsが依然として勝っています。とりあえず慣れたものを使い続けているユーザーもいます。

Hacker News

"For on the go, I've been using ElevenReader. Technically not free but their free tier has been plenty for me."

つまり正直な結論はこうです。安価で多言語対応の、十分な品質のナレーションを大規模に必要としているなら、Gemini 3.8 Flash TTSはコストパフォーマンスに優れた選択です。単一の、際立った、ブランドを象徴する声こそが製品であるなら、ElevenLabsと慎重に比較検討してください。価格差が品質差につながっているとは限りません。

安価な音声モデルが適する場面、適さない場面

ここで、買い手に持ち帰ってほしい捉え直しを示します。TTSモデルはインフラです。アプリに声を与える、素晴らしく安価な方法です。オーディオブックのパイプライン、製品内のナレーター、アクセシビリティレイヤー、IVRプロンプトなど。こうした用途には、1時間あたり0.81ドルは本当に良い取引です。

しかし、ユースケースがカスタマーサポートになった瞬間、モデルは問題の簡単な10%にすぎなくなります。難しいのはその周辺すべてです。ナレッジベースから正しい回答を引き出すこと、チケットを実際に解決するツールを呼び出すこと、顧客に話しかける前に実際の対応履歴でテストされることです。これがインフラと従業員の違いです。Gemini TTSは前者です。返金ポリシーを知らず、チケットのトリアージもできません。これらをすべて自分で組み立てるのはプロジェクトであり、単なるAPI呼び出しではありません。

これは私たちが日々取り組んでいる枠組みです。私たちは何年もかけて、実際のサポートキューにAIを投入してきました。デモと本番投入を分けるものは、決してモデルそのものではなく、常に配線とテストです。だからこそAIヘルプデスクエージェントは、どちらも「AI」を謳っていても、音声エンドポイントとはまったく異なる買い物なのです。人間と自動化のどちらを選ぶかという計算を一般論として検討しているなら、私たちのAIエージェント対人間エージェントのコストの分析が、トークン単価よりも良い出発点になります。

eeselを試す

eeselはAIチームメイトのプラットフォームで、現在のラインナップには、既存のサポートキューに参加できる、すぐに使えるAIヘルプデスクエージェントが含まれています。Gemini TTSが自分で構築する必要のあるモデルであるのに対し、eeselは最初から、あなたのヘルプデスクへの接続方法を知っており、過去のチケットから学習し、実際の過去の会話に対してシミュレーションされます。そのため、本番投入前に解決率を把握できます。

eesel AIのオンボーディング画面。AIチームメイトがヘルプデスクに接続され、返信の下書きを作成する準備ができている様子
eesel AIのオンボーディング画面。AIチームメイトがヘルプデスクに接続され、返信の下書きを作成する準備ができている様子

ターミナルでの作業を好むなら、eesel CLIが同じチームメイトとワークスペースをプログラムから操作します。手動で操作することも、スクリプトに組み込むことも、Claude CodeやCursorのようなコーディングエージェントにヘッドレスで実行させることもできます。つまり、購入したAIは、Gemini TTSのようなモデルにアクセスするのと同じように、ダッシュボードとAPIの両方から利用可能です。eeselを無料で試して、まずは自分のチケットに対してシミュレーションしてみてください。

よくある質問

Gemini 3.8 Flash TTSの料金はいくらですか?
Gemini 3.8 Flash TTSの料金は、標準の有料ティアで、テキスト入力100万トークンあたり0.50ドル、音声出力100万トークンあたり9.00ドルです(2026年12月31日まで)。音声は1秒あたり25トークンで課金されるため、生成音声1時間あたり約0.81ドルになります。2027年1月1日からは両方のレートが2倍になります。より広い範囲については、私のGoogle Gemini 3 料金ガイドをご覧ください。
Gemini 3.8 Flash TTSに無料ティアはありますか?
はい。Google AI Studio経由なら、標準ティアとpriorityティアの入出力は無料です。ただし、batchティアとflexティアは有料のみです。無料ティアは音声のテストには十分ですが、Googleは無料ティアのコンテンツを製品改善に利用するため、機密情報を扱う前に利用規約を確認してください。Geminiアプリの消費者向け音声機能にはGoogle AIサブスクリプションが必要です。
Gemini 3.8 Flash TTSの料金はElevenLabsと比べてどうですか?
音声の長さで正規化すると、Gemini 3.8 Flash TTSは音声1時間あたり約0.81ドルですが、ElevenLabsはBusinessプランで低遅延TTSを1分あたり約5セント(1時間あたり約3ドル)から提供しています。Geminiは1時間あたりで見るとはるかに安いですが、ElevenLabsは声のバリエーションと音声クローンの成熟度で依然としてリードしています。どのモデルにも共通する落とし穴は、1時間あたりの価格が、解決したカスタマーサービスの会話1件あたりの価格と同じではないという点です。
なぜGemini 3.8 Flash TTSの料金は2027年1月に2倍になるのですか?
0.50ドルと9.00ドルというレートはプロモーション価格で、Googleが以前のGeminiモデルで使ってきたのと同じパターンです。2027年1月1日には、標準のテキスト入力は100万トークンあたり1.00ドルに、音声出力は100万トークンあたり18.00ドルになります。batch、flex、priorityの倍率も同時に2倍になります。2027年の予算を見積もるなら、今日の数字を2倍にしてください。テキストモデル版の同様の崖については、私のGemini 3.8 Flash 料金の解説をご覧ください。
Gemini 3.8 Flash TTSはカスタマーサポートの音声用として十分な性能ですか?
安価で表現力がありますが、音声モデルが担うのは発話部分だけです。サポート用の音声には、実際の通話者に届く前の検索、ツール連携、テストも必要で、ほとんどのプロジェクトが実際に破綻するのはここです。それはTTSエンドポイントではなく、AIヘルプデスクエージェントの仕事です。音声レイヤーだけが必要なら、Zendesk voice AIのようなものや、専用に構築したスタックと組み合わせてください。

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Gemini 3.8 Flash TTSの料金を表す、音波と価格タグのイラスト
Trending

Gemini 3.8 Flash TTSの料金:AI音声1時間の実際のコスト

Gemini 3.8 Flash TTSは音声トークン100万あたり9ドル、音声1時間あたり約0.81ドル。全ティア、2027年の落とし穴、ElevenLabsやOpenAIとの比較まで解説する。

Rama Adi NugrahaRama Adi NugrahaSep 24, 2026
Gemini 3.8 Flash TTSを表す、音波、音声デザインのコントロールパネル、再生ボタンのイラスト
Trending

Gemini 3.8 Flash TTSレビュー:Googleの新音声モデルは使う価値があるか

Gemini 3.8 Flash TTSの実践レビュー。実際の音質、制御できる範囲、ElevenLabsより料金で優れる点、そしてGoogleが首位を取れなかった唯一のベンチマークを解説する。

Alicia Kirana UtomoAlicia Kirana UtomoSep 24, 2026
Gemini 3.8 Flashをレビューするチームのイラスト。速度計、ロケット、結論を示すチェックマーク付き
Trending

Gemini 3.8 Flashレビュー: 高速だが冗長、番号が示すほどのアップグレードではない

Gemini 3.8 Flashの実践レビュー: 得意な点、弱点、誰も触れなかった13秒の落とし穴、そして3.7 Flashから切り替える価値があるかどうか。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Geminiのスパークを囲んでグラフとスピードメーターを確認する2人のイラスト、Gemini 3.8 Flashの料金を表現
Trending

Gemini 3.8 Flashの料金:全レート・隠れたコスト・その落とし穴

Gemini 3.8 Flashは100万トークンあたり$0.75/$3.75で、3.7 Flashと全く同じ価格です。しかし表示価格には冗長性という隠れたコストがあり、両方の数字は2027年1月1日に2倍になります。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
Gemini 3.8 Flashを表す、人が見守る中ノートパソコンで高速にコーディングするロボットのイラスト
Trending

Gemini 3.8 Flashとは何か、正直なベンチマークと私のレビュー

Googleは2026年9月2日、3.7からわずか3週間後にGemini 3.8 Flashをリリースした。価格は同じ、スコアは向上、そして答えを変える一文の注意書きがある。

Alicia Kirana UtomoAlicia Kirana UtomoSep 3, 2026
DeepSeek V4 Flashの料金:実際の請求額はどうなるか
Trending

DeepSeek V4 Flashの料金:実際の請求額はどうなるか

DeepSeek V4 Flashの公式価格は100万トークンあたり入力$0.14、出力$0.28。実際のユーザーは1セント未満の混合レートを報告している。どちらになるかを決める要因を解説する。

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
低とマックスというラベルの付いた2つのエフォートダイヤルとDeepSeekのクジラの横で、判定スコアカードを見ているレビュアー
Trending

DeepSeek V4 Flashレビュー: 1つのモデル、2つの人格

両方のスコアボードが公開する数値に基づくDeepSeek V4 Flashレビュー。安価な実行と賢い実行は同じ重みファイルであり、それが評価を変えてしまう。

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
DeepSeek V4 Flashのスペックと価格、実際の使い道
Trending

DeepSeek V4 Flashのスペックと価格、実際の使い道

DeepSeek V4 Flashは100万トークンあたり入力$0.14、出力$0.28で、DeepSeek自身の高価な上位モデルより高いスコアを記録している。価格表からは見えてこないポイントを解説する。

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
DeepSeek V4 FlashとMoonshot AIのKimi K3を比較したイラスト
Trending

DeepSeek V4 Flash vs Kimi K3、どちらを使うべきか?

一方のモデルはタスクあたりのコストがもう一方の29倍にもなる。両方の公開データをすべて調べてみたが、面白いのは誰も選ぶべきではない「中間の選択肢」の存在だ。

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める