Gemini 3.8 Flashレビュー: 高速だが冗長、番号が示すほどのアップグレードではない

Kurnia Kharisma Agung Samiadjie
執筆者

Kurnia Kharisma Agung Samiadjie

Katelin Teen
レビュー者

Katelin Teen

最終更新 September 8, 2026

専門家による検証済み
Gemini 3.8 Flashをレビューするチームのイラスト。速度計、ロケット、結論を示すチェックマーク付き

Gemini 3.8 Flashとは実際何なのか

Gemini 3.8 FlashはGoogle最新の高速で安価なマルチモーダルモデルで、Gemini APIではgemini-3.8-flashとして利用でき、Googleのエージェント型開発環境Antigravityでもデフォルトモデルとして使われています。テキスト、画像、音声、動画、PDFを入力として受け取り、テキストを出力します。入力ウィンドウは100万トークン、出力は64Kです。リリースの全体的な内容についてはGemini 3.8 Flash概要で取り上げており、料金面はGemini 3.8 Flashの料金の記事にあります。今回はレビューです。時間をかける価値があるのか、実際どこに適しているのかを見ていきます。

Google DeepMindから取得したGemini 3.8 Flashのモデルページ
Google DeepMindから取得したGemini 3.8 Flashのモデルページ

レビューにとって最も有用な事実は、誰も見出しにしなかったものです。これは新しいモデルではありません。モデルカードは逐語的に、しかも4つの別々のセクションで、"Gemini 3.8 Flash is based on Gemini 3.7 Flash."と記載しています。アーキテクチャ、学習データ、ハードウェア、安全性ポリシーはすべて3.7 Flashのカードに依拠しています。つまり3.8は3.7のベースに対する事後学習のパスです。これが3週間という間隔を説明し、また価格が1セントも動かなかった理由も説明します。このレビューは「追加の事後学習は切り替える価値があるのか」という質問への答えとして読んでください。それが本当の問いだからです。

このレビューを決める唯一の数字

すべての発表記事はスピードを前面に出していました。ここに、それを再定義する数字があります。Artificial Analysisは、Gemini 3.8 Flashを毎秒305.1トークン、195モデル中3位と計測しています。これは本物であり、印象的です。しかし同じ計測ページは初回トークン到達時間が13.30秒であることも報告しており、この価格帯の中央値の推論モデルは2.99秒です。

Gemini 3.8 Flashは出力速度で3番目に速いが、初回トークンの生成に13.30秒かかる
Gemini 3.8 Flashは出力速度で3番目に速いが、初回トークンの生成に13.30秒かかる

この2つの数字は、まったく異なる体験を表しています。スループットは、いったん始まった後にどれだけ速く文章が流れ出すかです。初回トークン到達時間は、何かが表示されるまで読み手が空白のボックスをどれだけ見つめ続けるかです。リポジトリを一晩処理するバッチエージェントにとって、事前の13秒の思考は見えないものであり、スループットこそがすべてです。チャットウィジェットを見ている人や、提案された返信を待っているサポート担当者にとっては、13秒の無音がすべての体験であり、その後どれだけ速くなってもそれを救うことはできません。

"3.8 Flash is the fast one"という言い方に私が反論し続けているのはそのためです。それは機械にとっての速いモデルであり、人間にとっての遅いモデルです。この一つの区別だけで、思いつく限りほぼすべての使用例が分類でき、それが以下のベンチマークが見た目より重要でない理由です。

本当に優れている点

長時間実行するエージェント型コーディングタスクを与えると、3.8 Flashはその実力を発揮します。Google自身の数字によれば、HLE-Verifiedで54.9%を記録して首位に立ち(GPT-5.6 Sol、Claude Opus 5、そして自身の前身モデルを上回る)、Vals Finance Agent v2ベンチマークでは61.4%で勝利し、長時間のソフトウェア作業ではDeepSWEでトップに立っています。ベンチマークベンダーのdavidは、その魅力を明確にまとめています。"5x cheaper and 2x faster than Opus 5 for similar intelligence."

Gemini 3.8 Flashがベンチマークでどこで先行し、どこで遅れているか
Gemini 3.8 Flashがベンチマークでどこで先行し、どこで遅れているか

Intelligence Indexもコーディングの話を裏付けています。Artificial Analysisで59点を記録し、medium effortでClaude Opus 5と同水準であり、Flashクラスのモデルとしては強力な結果です。そして長時間タスクでの挙動は本物であり、ベンチマーク特有の現象ではありません。デザインパートナーのGlean社のThai Tranは、ドキュメント量の多いワークフローにおいて"completing more than three times as many tasks as Gemini 3.7 Flash in our evaluations"と報告しています。Hacker Newsではsimonwが13秒、1.8セントでHTMLビジュアライゼーションを生成し、スピードとフロントエンド品質の組み合わせを"pretty exciting."と評しました。

私が気に入っている実際の使い方のパターンは、panarkyによるもので、Flashをビルダーではなく監査役として使っています。

Hacker News

"I've been using 3.7 Flash to audit the work of Opus High, and Flash finds lots of subtle and insidious defects even while all the unit tests are green... it is blazing fast in Antigravity CLI. Easily 10x faster than Opus. Can't wait to try 3.8 Flash. If it's good enough, maybe I'll switch Flash to primary and make Opus the auditor."

これこそが3.8 Flashが構築された対象のワークロードの形です。安価で、速く、疲れることなく、長いタスクをこなす意欲があります。あなたがそうなら、他の最高のAIコーディングアシスタントツールと並んでショートリストに入れる価値があります。

弱点

コーディングのベンチマークで勝利するのと同じ"works harder"という設計が、他のあらゆる場面で使いにくくしている原因です。Googleはリリース記事の中でこの点について珍しく率直に述べています。3.8 Flashは"exhibits greater diligence, executing extra reasoning steps, and calling tools iteratively. At times, the model might use more tokens to maximize performance."つまり、たくさん考え、その分の代金を支払うことになるということです。

Gemini 3.8 Flashは同じベンチマークスイートの実行に、中央値71Mに対して120Mの出力トークンを使用した
Gemini 3.8 Flashは同じベンチマークスイートの実行に、中央値71Mに対して120Mの出力トークンを使用した

Artificial Analysisはこれを"very verbose"と指摘しました。Indexの実行に120Mの出力トークンを使用し、中央値71Mを大きく上回っています。Geminiは思考トークンを3.75ドルの出力レートで課金するため、この冗長性は表示価格が隠している直接的なコスト倍率になります。HNユーザーのbermudiは、同じベンチマークで3.7よりタスクごとに約1.1万トークン多く使うと数字を示し、"making it more expensive and slower in practice than the headline rate suggests."と述べています。Gemini 3.8 Flashの料金の記事に完全な計算がありますが、要点を言えば、モデルがより多くの100万トークンを出力すると決めた場合、100万トークンあたりの料率は実態を反映しなくなるということです。

それから、お世話をし続ける必要があるという問題もあります。mythzは私も共有するフラストレーションをこう表現しました。

Hacker News

"Whilst it's a fast model, having to baby sit through and approve prompts every few seconds ends up making it slower than the Auto approve modes of Claude/ChatGPT."

また、単純なプロンプトに対して過剰にやり過ぎることもあります。refulgentisは"Hi"と入力しただけで、偽の天気ウィジェットとToDoリストを備えた4パネルのアプリが返ってきたと報告しています。小さなことですが、最大限の作業をするように調整されたモデルの表れであり、それはまさに、範囲が狭く明確に定義されたタスクでは望ましくないことです。

さらに2つの正直な注意点があります。Terminal-Bench 4.0では19.1%にとどまり、Opus 5の51.8%に及ばないため、「Opus 5に匹敵する」というのは、Googleが見せることを選んだベンチマークにおいてのみ真実です。そしてモデルカードには2つの後退した安全性指標が記録されています。多言語での安全性が5.4ポイント、不当な拒否が1.1ポイント後退しており、Googleは率直に"safety performance across non-English languages regressed slightly."と述べています。Frontier Safetyの全体評価は再実施すらされておらず、推論によって3.7から引き継がれました。これらはいずれも単独では決定的な欠点ではありませんが、公正なレビューが指摘すべき類の詳細です。

実際に使ってみた人々の声

コミュニティの評価は有用な形で分かれており、それは上で述べた機械対人間という分断とほぼ完全に一致しています。

長時間のコーディング作業を実行する人々は、概ね気に入っていました。Seltaはこれを"quite a big update,"と呼び、コーディング推論の向上とスピードを維持したままの幻覚の減少を指摘しました。Conor Dartは"Google is back... this model takes its time to think and work through the tasks."と述べました。そしてscrlkは、ベンチマークが完全に見落としている点を挙げました。"Gemini's speed and quality doesn't degrade badly during weekday working hours compared to OAI, and especially Anthropic."負荷がかかった状態での安定性は本物の強みです。

飛躍的な進化を期待していた人々は、より冷ややかでした。markasoftwareは、Artificial Analysisでは"opus 5 medium effort"にしか匹敵しないと指摘し、"opus 5 medium outputs 4x fewer tokens to achieve the same result, negating a lot of the speed difference."とも述べました。zuzululuは私と同じ結論に達しました。"i might consider 3.8 flash for simple side hobby projects or quick scaffolding but would not trust it for long agentic tasks."そしてpkos98は、発表当日のベンチマークに対する最も健全な懐疑論を提示しました。"Wait a week with your judgement, most likely, Google is just bench-maxing very hard."

取り上げる価値のある構造的な不満もあります。Kol Tregaskesは、これが"with no Pro model."という4連続のFlashモデルであると指摘しました。これは3.8 Flash自体への批判ではありませんが、背景として重要です。報道によれば3.5 Proは完全に見送られる可能性があり、Proクラスのモデルがラインナップに欠けている中で、Flashがフラッグシップの負荷を担っているということです。ベンダー間で比較しているなら、ChatGPT対Geminiと私のGeminiの代替案まとめが最も有用な出発点です。

結論: 3.7 Flashから切り替えるべきか

価格が同一であるため、これが唯一重要な比較であり、ほとんどのアップグレードの判断よりも明快です。

あなたのワークロードが...選ぶべきモデル理由
長時間のエージェント型コーディング、ドキュメント量の多いタスク、夜間バッチエージェントGemini 3.8 Flashここで重要なベンチマークにおいて本当に優れており、価格は同じ。余分な思考には見返りがある
レイテンシーに敏感で、人間が介在する(チャット、リアルタイム対応)Gemini 3.7 Flash13.30秒の初回トークンのコストは人に直接影響する。余分な冗長性は純粋なオーバーヘッド
コスト優先、大量処理、シンプルな呼び出し(分類、OCR、抽出)Gemini 3.7 FlashGoogleがはっきりと述べている。"remains fully supported for efficiency-first workloads"
より大きなモデルの作業を再確認する監査役どちらのFlashでも可レビュアーとして使うには十分安価で速く、賢いパターンになる

結論として、3.8 Flashはある一つの形の作業に対しては本当のアップグレードであり、もう一方の作業に対しては見かけ倒しのダウングレードです。Googleが両方を同じ価格で提供しているのは、寛大さではなく、新しいモデルが効率と丁寧さを引き換えにしていることの表れであり、あなたのワークロードがそのトレードオフのどちら側にあるかは、あなただけが知っています。もう一つ考慮すべき点があります。0.75ドルというレートはプロモーション価格で、2027年1月1日には1.50ドルに倍増します。今日の数字で予算を立てている人は、割引価格で予算を立てているということです。

サポートキューにAIを導入する場合、これは何を意味するのか

ここで正直に言わなければなりません。私がこれらのモデルをテストする理由は、まさにサポートチームが私に問い続ける質問に答えるためです。「どのモデルをチケットに使うべきか?」

正直な答えは、モデルこそが探すべき対象として間違っているということです。サポートのワークロードは、3.8 Flashが得意とすることのほぼ完全な逆です。チケットはコンテキストが短く、長時間タスクではありません。量が多いため、レイテンシーが積み重なり、初回トークンまで13秒の遅延を数千件の会話に乗じれば、実際のコストになります。そして生のモデルは、サポート自動化を実際に機能させる要素を何も提供しません。ヘルプセンターを知らず、過去のチケットを読むこともできず、ZendeskFreshdeskの中に組み込まれることもなく、顧客に伝える前に何を言うつもりだったかを見せる方法もありません。

私は、自信があるように聞こえるボットがライブのキューで静かに間違った答えを出すのを見てきました。これはベンチマークスコアが決して警告してくれない種類の失敗です。だからこそ私が気にかけているのは、モデルのIntelligence Indexではなく、その周囲のシステムがまず実際のチケットに対してシミュレーションできるかということです。モデルはインフラです。サポートチームが本当に必要としているのは、コンテキストとガードレールが既に整った状態でヘルプデスクに組み込まれた従業員です。その下でのモデル選択は、プラットフォームが処理すべき詳細であり、発表時のベンチマークを読んで決めるべき判断ではありません。

eeselを試す

あなたが本当に求めているのが、自分でモデルを組み込むことではなくAIがチケットに回答することなら、私ならeeselから始めます。eeselは生のインフラではなく、すぐに使えるAIチームメイトを提供しており、AIヘルプデスクのチームメイトZendeskFreshdesk、Gorgiasの既存のキューに数分で加わり、あなたのヘルプセンターと過去のチケットで学習します。

eeselのAIヘルプデスクダッシュボード
eeselのAIヘルプデスクダッシュボード

その差別化要因は、モデルベンチマークでは得られない部分です。すべてのeeselの導入は、まず実際の過去のチケットに対してシミュレーションされるため、ライブの顧客に何かを伝える前に、すでに対応した顧客に対してAIが何を言っていたかを確認できます。チケットの分類サポートタグ付けといった目立たない作業も処理し、試用は無料です。コンテンツがボトルネックであり、サポートではない場合は、同じプラットフォーム上で動くAIブログライターのチームメイトもあります。

数字の面では、AIサポートによるコスト削減が計算を示しており、エージェント対人間のコストは財務チームが実際に求める比較です。まだモデルを探している段階で、プロダクトを探していないなら、次に読むべきはトップAIエージェント中小企業向けの最高のAIエージェントの2つのまとめです。

よくある質問

Gemini 3.8 Flashは3.7 Flashから切り替える価値がありますか?
長時間実行するエージェント型コーディングやドキュメント量の多い作業では、同じ価格で本当にステップアップになるので、はい。チャットウィジェットやチケットの振り分けのようなレイテンシーに敏感で大量処理が必要な作業では、いいえです。Google自身も効率優先のワークロードには3.7 Flashを使い続けるようにと述べており、このGemini 3.8 Flashレビューで示す13.30秒の初回トークン到達時間がその理由です。
Gemini 3.8 Flashの料金はいくらですか?
2026年12月31日までは入力100万トークンあたり0.75ドル、出力100万トークンあたり3.75ドル(思考トークン含む)で、2027年1月1日には1.50ドル/7.50ドルに倍増します。これは3.7 Flashと同一です。詳細な内訳と計算ツールは、Gemini 3.8 Flashの料金に関する記事にあります。
Gemini 3.8 Flashはなぜこれほど冗長なのですか?
それは意図的な設計です。Googleは、追加の推論ステップを実行し、ツールを繰り返し呼び出すことで"works harder"だと述べています。Artificial Analysisは、同じベンチマークスイートの実行に120Mの出力トークンを使用したと計測しており、中央値の71Mを大きく上回っています。出力トークンには出力レートで課金される思考トークンが含まれるため、より多く考えるモデルはタスクごとのコストも高くなります。これは、カスタマーサービスのAI自動化を実際の量に対してテストするべきなのと同様に、導入前にシミュレーションしておく価値があります。
Gemini 3.8 Flashはカスタマーサポートのチャットボットに適していますか?
その用途には不向きな形をしています。サポートはコンテキストが短く、量が多く、レイテンシーに敏感ですが、長時間タスク向けに調整され余分な思考トークンを消費するモデルは、この3つすべてに反します。カスタマーサポートの自動化には、自社のチケットでテストされた、専用に作られたAIヘルプデスクエージェントが必要であり、生のコーディングモデルではありません。
Gemini 3.8 FlashはClaude Opus 5とどう比較されますか?
Artificial AnalysisではIntelligence Indexで59点を記録し、Opus 5のmedium effortと同水準ですが、より安価で高速です。しかしOpus 5 maxは63点を記録し、同じ結果を得るために使用するトークンはおよそ4分の1で済み、Terminal-Bench 4.0では3.8 Flashに大差で勝っています(51.8%対19.1%)。より広い比較についてはGeminiの代替案Claudeレビューを参照してください。

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Gemini 3.8 Flashを表す、人が見守る中ノートパソコンで高速にコーディングするロボットのイラスト
Trending

Gemini 3.8 Flashとは何か、正直なベンチマークと私のレビュー

Googleは2026年9月2日、3.7からわずか3週間後にGemini 3.8 Flashをリリースした。価格は同じ、スコアは向上、そして答えを変える一文の注意書きがある。

Alicia Kirana UtomoAlicia Kirana UtomoSep 3, 2026
Geminiのスパークを囲んでグラフとスピードメーターを確認する2人のイラスト、Gemini 3.8 Flashの料金を表現
Trending

Gemini 3.8 Flashの料金:全レート・隠れたコスト・その落とし穴

Gemini 3.8 Flashは100万トークンあたり$0.75/$3.75で、3.7 Flashと全く同じ価格です。しかし表示価格には冗長性という隠れたコストがあり、両方の数字は2027年1月1日に2倍になります。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 8, 2026
DeepSeek V4 Flashの料金:実際の請求額はどうなるか
Trending

DeepSeek V4 Flashの料金:実際の請求額はどうなるか

DeepSeek V4 Flashの公式価格は100万トークンあたり入力$0.14、出力$0.28。実際のユーザーは1セント未満の混合レートを報告している。どちらになるかを決める要因を解説する。

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
低とマックスというラベルの付いた2つのエフォートダイヤルとDeepSeekのクジラの横で、判定スコアカードを見ているレビュアー
Trending

DeepSeek V4 Flashレビュー: 1つのモデル、2つの人格

両方のスコアボードが公開する数値に基づくDeepSeek V4 Flashレビュー。安価な実行と賢い実行は同じ重みファイルであり、それが評価を変えてしまう。

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
DeepSeek V4 Flashのスペックと価格、実際の使い道
Trending

DeepSeek V4 Flashのスペックと価格、実際の使い道

DeepSeek V4 Flashは100万トークンあたり入力$0.14、出力$0.28で、DeepSeek自身の高価な上位モデルより高いスコアを記録している。価格表からは見えてこないポイントを解説する。

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
テーブルを挟んで腕相撲をする2人と、それを見守る1人を描いた、モデル同士の直接対決を表すイラスト
Trending

DeepSeek V4 Flash vs GPT-5.6:どちらを選ぶべきか

DeepSeek V4 Flash vs GPT-5.6を2026年8月の最新データで比較。本当の戦いはFlash対Lunaで、知能スコアはほぼ互角、決め手は速度・画像入力・データの扱いだ。

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
DeepSeek V4 FlashとV4 Proのモデルプランを比較したイラスト
Trending

DeepSeek V4 Flash vs V4 Pro:どちらのプランを使うべきか?

DeepSeekの安価なプランが、独立系ベンチマークで高価なプランよりも高いスコアを記録している。それが当てはまる場面と、当てはまらない2つの例外を具体的に見ていく。

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Google ブルーで描かれたGemini 3.5 Proレビューのヒーローバナー
Trending

Gemini 3.5 Pro レビュー:Googleのフラッグシップの正直な現状

Gemini 3.5 Proの正直なレビュー:まだリリースされていない。Googleが確認したこと、遅れている理由、実在するベンチマーク、そして今使うべきモデルをまとめた。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
とても長い猫が伸びをしている横で、2人がスコアカードを確認しているイラスト。LongCatのロゴが入っている
Trending

LongCat 2.0レビュー:頼れる働き者、ただし一つの大きな壁

私はLongCat 2.0を、買い手が実際に気にする7つの観点で採点した。使ったのはMeituan自身の資料と、数十億トークンをこのモデルに流した人たちの声だ。6項目は良好な結果だった。

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める