
Gemini 3.5 Flash-Liteの正体
GoogleはGeminiファミリーを2つのレーンに分けている。Proモデルは高度な推論向けの最上位ティアだ。Flashモデルは働き手で、より安く、より速く、1日に数千回の呼び出しを行う本番アプリ向けにチューニングされている。Flash-Liteはその中でも最も軽量なモデルで、Googleは大量のエージェント型タスク、翻訳、単純なデータ処理向けに位置づけている。
低価格モデルとしてはスペックが意外なほど充実している。テキスト、画像、動画、音声、PDFを入力として扱え、1,048,576トークンのコンテキストウィンドウ(約100万トークン、およそ1,500ページ分)を持ち、思考、関数呼び出し、構造化出力、コード実行、検索グラウンディングをサポートする。一方でコンピュータ操作、画像・音声生成、Live APIには対応していないため、あらゆることをこなす万能モデルではなく、大量処理向けのテキスト入出力エンジンだ。
Artificial Analysisでは、Intelligence Indexが36(152モデル中12位で、同クラスの平均を大きく上回る)を記録し、同時に約秒間490出力トークンという、同社が計測した中で2番目に速い速度で動作している。これほど安価なモデルとしては、この知能対価格比こそが最大のセールスポイントだ。
Gemini 3.5 Flash-Liteの料金
全体像はこうだ。価格は100万トークンあたりの有料ティア料金で、出力には思考トークンも含まれる。
| モード | 入力(100万あたり) | 出力(思考含む) | コンテキストキャッシュ |
|---|---|---|---|
| 標準 | $0.30 | $2.50 | $0.03 |
| バッチ(50%オフ) | $0.15 | $1.25 | $0.02 |
| Flex | $0.15 | $1.25 | $0.02 |
| Priority | $0.54 | $4.50 | $0.05 |
| 無料ティア | 無料 | 無料 | 利用不可 |
スプレッドシートに入力する前に押さえておきたい点がいくつかある。
- 無料ティアはデータを学習に使う。 無料ティアでは、Googleが製品改善のためにコンテンツを利用する。有料ティアではそうしない。顧客データを扱う用途では、この一点だけで無料ティアは除外される。
- バッチモードは一律50%オフ。 リアルタイム性が不要な作業(夜間の文書処理、一括翻訳など)であれば、Batchを使えば$0.15 / $1.25まで下がる。
- 検索グラウンディングは別課金。 Gemini 3ファミリー全体で月5,000回のグラウンディング済みプロンプトが無料で、それ以降は検索クエリ1,000回あたり$14。1リクエストが複数の課金対象クエリを発生させることもある。
コンシューマー向けGeminiプランやAPI全体との比較については、Geminiの料金ガイドに全体像がまとまっており、Gemini Workspaceの料金ではビジネスプランを扱っている。
実際にかかるコスト
定価だけを見ても、実際の数字を計算するまではピンと来ない。月間5万件のチケットトリアージにFlash-Liteの一次処理を使い、1チケットあたり入力約1,000トークン、出力約200トークンとしよう。

入力トークンは5,000万($15)、出力トークンは1,000万($25)で、合計すると生のモデルコストは月約$40となる。同じ量を3.6 Flashで処理すると$150近くになる。この差こそFlash-Liteが存在する理由であり、AIサポートの予算を組んだり自動化でサポートコストを削減しようとしたりする際に、多くのチームが思っている以上にモデルティアの選択が重要になる理由でもある。
Flash-Liteはどう比較されるか
Googleは比較表を公開しており、価格の行がまさに核心だ。$0.30 / $2.50というFlash-Liteの価格は、GPT-5.4 mini($0.75 / $4.50)やClaude Haiku 4.5($1.00 / $5.00)を下回りながら、ほとんどのエージェント型ベンチマークで同程度の品質帯に収まっている。

ただし一点注意が必要で、GPT-5.4 miniはコーディングと知識のスコアの一部で優位に立っている。とはいえ、大量処理における価格対性能で見るとFlash-Liteはなかなか手強く、長文コンテキストの記憶力では明確に上回る。芳しくない数字がひとつだけあり、最初のトークンまでの時間は約6秒(思考時間を含む)と、このクラスとしては長めだ。そのため軽快なライブチャットよりもバックグラウンド処理に向いている。
前世代モデルとの比較では、世代交代がはっきり表れている。

エージェント型ターミナルコーディングはTerminal-Bench 2.1で31%から54%に上昇し、知識作業はGDPval-AA v2で642から1140とほぼ倍増した。Googleによれば、旧世代の3 FlashをSWE-Bench Proやコンピュータ操作タスクでも上回っているとのことで、この低価格で品質をほとんど犠牲にしていないことになる。Geminiを他モデルと比較検討したい場合は、Gemini vs Claude、Gemini vs ChatGPT、そして広くGeminiの代替ツールまとめでも解説している。
実際にどちらを選ぶべきか
Flash-LiteはGemini 3.6 Flashと同時に登場しており、どちらを選ぶかを間違えると、コストを無駄にするか、力不足のボットを本番投入することになる。判断基準はシンプルだ。

本当の推論が必要な作業、たとえば多段階エージェント、コーディング、複数システムにまたがる複雑なサポートチケットには3.6 Flashを選ぶ。一方、各アイテムが単純な大量処理、たとえば一次トリアージや、定型的な質問のライブチャット振り分け、一括での多言語対応にはFlash-Liteを選ぶ。本格的なAIエージェントを構築するか、スクリプト型のボットにするかはモデル選びとは別の判断であり、たいていはそちらのほうが重要になる。SaaSプロダクトを運営しているなら、SaaSサポートに最適なAIの解説で各モデルがどこに当てはまるかを紹介している。
サポート向けAIを構築する場合に意味すること
ここからは率直に伝えたい。モデルの料金を扱う記事の多くが、サポートチームにとって肝心なこの部分を素通りしてしまうからだ。
安くて速いモデルが登場するのは良いニュースだ。しかしFlash-Liteに切り替えたからといって、動くサポートエージェントが手に入るわけではない。安いエンジンを積んだからといって車が完成するわけではないのと同じだ。私はこの3年以上、本番のサポートキューにAIを載せる仕事をしてきたが、繰り返し目にしてきた失敗は、モデルが賢くないことではなく、モデルの周りに必要な層を誰も作らなかったせいで、自信満々に見えるボットが実在の顧客に間違った回答をしてしまうことだった。モデルはスタックの最下層にすぎない。

本当に重要なのはその上の層だ。リトリーバルがあれば、モデルは推測ではなくヘルプセンターや過去のチケットをもとに回答できる。ガードレールとスコープがあれば、返金ポリシーをでっちあげる代わりにきちんとエスカレーションできる。連携があれば、チケッティングシステムの内部で実際に行動できる。そしてテストがあれば、顧客に触れる前にその挙動を把握できる。これは生のAPIと本物のAIカスタマーサービスソフトウェアとの間にある差そのものであり、AIチャットボットの問題がほぼ常にモデルではなく配管部分に起因する理由でもある。
だからこそ、生のGemini APIを自前でヘルプデスクに組み込むことには慎重になったほうがいいと私は考えている。リトリーバル、ハルシネーション対策のガードレール、シミュレーション、あらゆるヘルプデスク連携をゼロから作り直し、モデルが数週間ごとに変わるたびにそれを保守し続けることになる。Flash-Liteが安いからといって、この計算式は変わらない。だからこそ専用に作られたヘルプデスクAIがDIYスタックより優れているという主張が成り立つ。モデルティアは単なる項目のひとつにすぎず、周辺のシステムこそが製品なのだ。そしてエージェントを正しくトレーニングすれば、その下にあるモデルが結果に与える影響はほとんどなくなる。
eeselを試す
これはまさにeeselが担うべき層だ。既存のヘルプデスクに接続するだけで、過去のチケットやナレッジベースからすぐに学習を始め、フロンティアモデルの上で動作するので、APIを自分で組み上げなくても効率性を得られる。

安いモデルだけでは得られない差別化ポイントはこうだ。eeselなら実際の顧客に回答する前に過去のチケットに対してエージェントをシミュレーションできるので、解決率や実際に送信されたであろう返信を確認でき、それを実際のAIサポートのROIに結びつけられる。さらに実際にこなした作業に応じた価格であり、トークン単位ではないので、チケットごとのトークン計算から解放される。サポート自動化の構築にFlash-Liteを検討しているなら、まず欲しい成果から逆算し、配管部分はプラットフォームに任せてしまおう。無料で試せる。
よくある質問
Gemini 3.5 Flash-Liteの料金はいくらですか?
Gemini 3.5 Flash-LiteはGemini 3.6 Flashより安いですか?
Gemini 3.5 Flash-Liteに無料ティアはありますか?
カスタマーサポートにGemini 3.5 Flash-Liteを使うべきですか?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.







