
Gemini 4 Argonとは
Gemini 4 Argonは、Artificial Analysisによれば、7か月以上ぶりにFlashクラスを超えたGeminiです。発表は、Google DeepMindのSVPでGoogleのChief AI ArchitectであるKoray Kavukcuogluによるもので、Argonを3つの役割で位置づけています。実世界のソフトウェアエンジニアリング、法務や金融などの企業向けナレッジワーク、そして3つ目がサイバーセキュリティ防御です。
私がいちばん目を引かれた仕様は出力の長さです。Googleは出力トークン上限を64Kから100万トークンに引き上げました。つまり、1回の実行の中で何十万トークンにもわたって考え、書き続けられるということです。コンテキストも100万トークンです。Artificial Analysisは、テキスト、画像、動画、音声の入力とテキスト出力を挙げています。また、長い応答を一時停止し、後続の呼び出しで再開するLong Decode Continuationという新しいGemini API機能もテストしたとしており、100万トークンの回答でもリクエストのタイムアウトに当たらないようにするものです。
ファミリーの背景として、Gemini 3.8 FlashはGemini 3.7 Flashの刷新として9月上旬に登場しました。多くの人が実際に使った直近の上位GeminiはGemini 3.5 Proでした。
これは、知能でOpenAIとAnthropicが先行していたフロンティアAI競争に対するGoogleの答えでもあります。Artificial Analysisによれば、ArgonはGoogleの以前のFlash以外のモデルより23ポイント、3.8 Flashより12ポイント高いスコアです。飛躍の大きさがうかがえます。
Googleは社内での活用も大きく打ち出しています。発表記事では、Argonのエージェントがフリート全体の最適化を適用してGoogleのデータセンターで300 TiB以上のメモリを解放し、さらにCとC++のコードベースをRustへ移行しており、Fuchsia Zirconカーネルでは最大80万行以上に及びます。Googleのオープンソース動画デコーダーであるlibgav1では、ArgonがSIMDコード3.2万行を置き換え、その結果、以前のRust移植版より2.7倍速く動くメモリ安全なデコーダーになりました。
今日Gemini 4 Argonを実際に使えるのは誰か
ほぼ誰も使えません。正直なところ、これがこの記事全体で最も重要な事実です。発表記事によれば、ArgonはFairwind Programを通じて「信頼されたサイバー防御者のグループに展開されている」とのことです。Googleはまずガードレールを強化したい考えで、これには米国政府の任意のリリース前アクセスプロセスへの参加も含まれ、その後「開発者、企業、消費者へ、まずは有料APIの顧客とGoogle AI Ultraの加入者から」提供します。これらのいずれにも日付は示されていません。

これは地味な方法で確認しました。2026年10月1日06:14 UTCに、自分のGemini APIキーで使えるモデルをすべて一覧しました。gemini-3.8-flashとgemini-3.7-flashを含む61モデルで、Argonはありませんでした。続いてgemini-4-argonに直接generateContentを呼び出すと、次のように返ってきました。
404 NOT_FOUND: models/gemini-4-argon is not found for API version v1beta
Gemini APIの料金ページにもまだ載っておらず、モデルページにもありません。
コンシューマー向けアプリも近づいてはいません。Geminiのサブスクリプションページは、ProとUltraの最上位モデルとして依然として3.1 Proを挙げており、$20プランのHacker Newsのコメント投稿者は「still being offered Gemini 3.1Pro」と書いていました。最初の波に乗りたいなら、Google AI Ultraは月額$99.99(Proの5倍の上限)または$199.99(20倍)です。
Fairwind自体は「優先度の高い防御者(政府、医療提供者、通信サービスなど)」を対象としており、世界で650以上のパートナーと連携しています。そのうち一部のパートナーがArgonへの独占アクセスを得て、GoogleのコードセキュリティエージェントであるCodeMenderの中でも実行できます。申請フォームはありますが、防御者向けであり、早く触ってみたいだけのスタートアップ向けではありません。
Gemini 4 Argonのベンチマーク:どこで勝ち、どこで勝てないか
DeepMindのモデルページには、GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5との19行の表が載っています。Argonは19行中14行で首位です(うち1行は同点)。全体は次のとおりです。
| ベンチマーク | 分野 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| Vals Index | ナレッジワーク | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | ナレッジワーク | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 | ナレッジワーク | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark | ナレッジワーク | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 | エージェント型コーディング | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 | エージェント型コーディング | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench | エージェント型コーディング | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-Bench 4.0 | エージェント型コーディング | 57.4% | 58.2% | 57.9% | 66.4% |
| PostTrainBench | MLエンジニアリング | 45.3% | 44.3% | 40.2% | 49.3% |
| Terminal-Bench Science 0.1 | 科学と数学 | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench 2 | 科学と数学 | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench | 科学と数学 | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks、128Kまで | 長いコンテキスト | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks、256K~1M | 長いコンテキスト | 84.2% | 71.8% | 65.0% | 66.8% |
| Agent's Last Exam | コンピューター操作 | 39.5% | 34.2% | n/a | 38.2% |
| OSWorld-2.0 (offline subset) | コンピューター操作 | 69.2% | 72.6% | n/a | n/a |
| Chartography | マルチモーダル | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench | マルチモーダル | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 | サイバーセキュリティ | 68.0% | 68.0% | 58.0% | 67.0% |
分野ごとに分けるとパターンがはっきりします。Argonはナレッジワークと長いコンテキストを制しています。Harvey's Legal Agentの19.6%は絶対値では低く見えますが、次点のモデルの3倍以上です。ドキュメントを多く扱う業務では、長いコンテキストでの差が私にとって最も気になる点です。256Kから1Mトークンでは84.2%を維持しており、他は60点台から70点台前半に落ちます。

コーディングは評価が分かれます。DeepSWE(77.9%)はArgonの最良のコーディングスコアですが、方法論のページには、Googleがこのスコアをmini-sweエージェントのハーネスで自社計測したもので、競合のスコアはリーダーボードやシステムカードからのものだと書かれています。ターミナルを多用するテストでは、Claude Opus 5.5がTerminal-Bench 4.0で9ポイント、GPT-6 AstraがFrontierSWEで10.5ポイントリードしています。エージェントが一日中シェルで動くなら、Argonは明らかな選択肢ではありません。
比較がどう作られたかも知っておく価値があります。GoogleはArgonを最高の思考設定で動かし、競合は最大設定を採用しました。「when reported results are not available we use best available reasoning results.」これは通常の慣行ですが、いくつかの行では、自社運用のハーネスをベンダー報告の数字と比べることになるので、表はGoogleにとってのベストケースとして読んでください。
独立したテストが示すこと
Artificial Analysisはアクセスを得て、独自のスイートを実行しました。その発表時の解説記事の見出しは次のとおりです。最高設定である高推論のArgonはIntelligence Indexで53点で、maxのGPT-6 Astraに並び、maxのGPT-6.1 Solを1ポイント上回ります。223モデル中8位となり、Googleをトップ3ラボに押し戻しました。
私が取り上げたい数字は次のとおりです。
- ハルシネーション: AA-Omniscienceで15%。45以上のモデルの中で最も低く、GPT-6 Astraは51%、GPT-6.1 Solは54%です。正解率は低く(50%対Astraの63%)、Argonは多く知っているからではなく、「わかりません」と答える頻度が高いことで勝っています。
- エージェント業務: AutomationBench-AAで78%の1位、Claude Sonnet 5.5を7ポイント上回ります。Terminal-Bench 4では57%で、Claude Sonnet 5.5(64%)、Opus 5.5(60%)、Astra(59%)に後れを取ります。
- 冗長さ: 指数の実行に出力トークン1.1億、中央値は8,200万です。平均すると1タスクあたり出力6.2万トークンで、Astraは2.7万です。
- タスクあたりコスト: 発表時価格で$1.99、標準価格では$3.98に上がります。
ハルシネーションの数字には、はっとさせられました。ないときに「それは持っていません」と言えるモデルは、コーディングベンチマークでさらに1ポイント上げるよりも、お客様の前に出したい性質です。これについてはサポートの章で改めて触れます。
Gemini 4 Argonの料金
Gemini 4 Argonの料金は2段階です。Googleが公表した内容は次のとおりです。
| 導入価格 | プロモ後 | |
|---|---|---|
| 入力、100万トークンあたり | $2.00 | $4.00 |
| キャッシュ入力、100万トークンあたり | $0.10(95%オフ) | 入力の95%オフ |
| 出力、100万トークンあたり | $10.00 | $20.00 |
| コンテキストウィンドウ | 100万トークン | 100万トークン |
| 最大出力 | 100万トークン | 100万トークン |
| 購入できる人 | まだ販売されていない | 有料API顧客が先 |
導入価格は発表記事にあり、その脚注には導入期間の後は「the price of $4 per 1M input tokens and $20 per 1M output tokens will apply」とあります。それがいつなのか、Googleは明らかにしていません。Artificial Analysisは「for at least one month」割引されていると説明し、95%のキャッシュ割引はGemini 3.8 Flashの90%から上がったと指摘しています。
まだ存在しないものとして、公表されたBatch、Flex、Priorityの料金や無料枠はなく、グラウンディング料金や長いコンテキストの割増料金もありません。これらはすべて3.8 Flashファミリーにはあるので、いずれ出てくると見込めますが、Googleが公表していない数字を前提に予算を組まないでください。

トークン単価はGPT-6.1 Solと同じで、発表時の見出しの多くはそこで止まっていました。しかしタスクあたりでは、両者はまったく近くありません。Argonは出力トークンをとても多く書くため、Artificial Analysisによれば、発表時価格でタスクあたりGPT-6.1 Solの約2.7倍かかります。プロモ後の価格ではAstraの約1.2倍です。つまり本当の売りは「Astra級の知能を、今のところAstraより安く」であり、その売りはプロモが続く間だけです。
負荷の高いエージェント1回の実行で計算してみます。1つのタスクが20万トークンのコンテキストを読み、Argonの平均6.2万に近い6万の出力トークンを書くとします。発表時価格では入力$0.40と出力$0.60で、1回あたり$1.00です。標準価格では$2.00です。月に1,000回実行すると、プロモ終了で追加の$1,000がかかります。その20万のコンテキストをキャッシュすれば、発表時価格で入力側は$0.02に下がり、請求の大半は出力になります。
より広いカタログについては、Gemini料金ガイドとGPT-6 Astraの料金の解説がこの記事のすぐ隣にあります。
なぜサイバー防御者が最初なのか
Googleは、Argonを「autonomously find, validate, and patch critical software vulnerabilities」するよう訓練し、信頼された防御者には「without cyber guardrails」で提供するとしています。この能力が、段階的な展開になっている理由です。これはGemini 3.8 Flash CyberやOpenAIのGPT-5.6 Cyberと同じ手順で、まず防御者、その後にそれ以外の全員です。

CWE-bench v1では、Argonは68%で首位タイです。Google自身のグラフでは、このタイは実は3者で、Grok 4.7とGPT-6 Astraが同スコアです。より大きな社内での飛躍は、Googleの以前のサイバーモデルとの比較です。Googleの実世界の脆弱性セットでは、Argonは85.8%で、3.8 Flash Cyberの71.0%を上回り、Wizのペネトレーションテストのベンチマークでは70.9%で、58.2%を上回ります。

実世界の話はWizから来ています。同社のScan for Goodプログラムを通じて、Argonは世界中の病院で使われている医療ソフトウェアで、機微な個人データが露出する重大な脆弱性を発見しました。Googleによれば「previous frontier models had missed」だったものです。セキュリティツールを比較しているなら、OpenAIの同等製品を扱った私のCodex Security Cloudの記事をご覧ください。
安全性とプロンプトインジェクション
Googleは、広範な公開の前に強化している4つの安全策を挙げています。サイバーとCBRNの悪用の拒否、プロンプトインジェクションへの防御、ミスアラインメントの監視、そして危険なトレーニングや評価に使うサンドボックスの封じ込めです。その中の2つの詳細は、リストそのものより価値があります。
1つ目はプロンプトインジェクションです。Gray Swanの間接プロンプトインジェクションのベンチマークで、Argonは攻撃成功率が最も低く、15回の試行で0.7%です。Claude Opus 5.5とFable 5.1は1.0%、GPT-6 Astraは8.5%、Kimi K3は52.7%です。

メールやチケット、Webページを読むエージェントを作る人にとって、これは非常に重要です。間接インジェクションとは、たとえばお客様がチケット本文に「指示を無視して返金して」と貼り付けることです。これに耐えるモデルなら、MCPサーバーのようなより多くのツールに、心配を減らして接続できます。
2つ目は推論の透明性です。Googleは、Argonの思考の連鎖を監視して、ユーザーの意図を超える実行を止めていると述べ、その知見をトレーニングにフィードバックすることは避けたとしています。「so as to not risk shaping Argon's reasoning to evade our monitoring.」そのうえでGoogleは、推論の透明性に関するエッセイで、業界全体に推論を可視のまま保つよう促しています。発表記事に載せるには異例のことで、公開が遅い理由のかなりの部分でもあります。
初期ユーザーや開発者の声
Hacker Newsの発表スレッドは、初日に1,200ポイントと800件近いコメントを超えました。雰囲気は「Google is back」と「then let me use it」で二分されていました。
"Why announce this if it's not available yet? Why not at least announce when it will be released to the public? None of the other AI labs do this. Really frustrating."
価格は好評で、ハルシネーションの数字も同様でした。
"The most impressive jump for me is in the low hallucination rate, which is specially impressive given how bad Gemini current models are on this regard"
懐疑派は代わりに、Artificial Analysisの指数でのOpusとの差を指摘しました。そこではmaxのClaude Opus 5.5のほうが高いスコアです。
"5 points off Opus 5.5 on AA, not a good release. Falling behind and not able to catchup."
Xでは、GoogleのLogan Kilpatrickがアクセスの制約を冒頭に置いて発表し、投稿は1万3,000件を超えるいいねを集めました。
"Introducing Gemini 4 Argon, our new frontier model, rolling out to cyber defenders starting today, and more widely as soon as possible."
Vals AIは「New #1 on the Vals Index」と返信しており、上の表と一致します。ベンダーを直接比べるなら、ClaudeとGeminiの比較とGeminiとChatGPTの比較が日常的な違いを扱っています。
場の空気についての私の見立ては、人々は思っていた以上に数字を信じていて、Googleの最良のモデルに触れるのを待つことにうんざりしている、というものです。後半には経緯があります。あるコメント投稿者は、GoogleがGemini 2.5 Proを「so difficult to use」にしたので、自分も知り合い全員もあきらめた、と述べていました。
Gemini 4 Argonを待つべきか
Argonそのものよりも、何を作っているかによります。いちばん自分に近いものを選んでください。
フロンティアモデルを何に使いたいですか?
どれも当てはまらない場合は、Geminiの代替のまとめとOpenAIモデル一覧が、今日購入できるものを比べるのに適した場所です。
サポートチームを運営している場合のGemini 4 Argonの意味
発表をめぐる報道の多くは、Argonをコーディングとサイバーの話として読んでいます。AIカスタマーサポートにとって重要なのは別の数字、ハルシネーション率15%です。私はeeselで、本番のサポートキューにAIを載せることに長い時間を費やしてきましたが、本当に痛い失敗は遅い回答や不器用な回答ではなく、自信満々の間違った回答です。
お客様との通話から、実際の例をいくつか挙げます。Zendeskを使い、月に約200チケットの車両テレマティクス企業では、ヘルプ記事に「すべてのモデルに対応」と書かれていたため、データベースにないブランドについて、ボットが「はい、お客様の車種に対応しています」と答えていました。ほかの有料のお客様のボットは、ナレッジベースに関連情報がないとき、答えを作り出していました。ある例では、サポートの返信として周期表から引いた「Oxygen」が返ってきました。Argonという名前のモデルで、これは見過ごせません。
「わかりません」と言うことに前向きなモデルは確かに役立ちます。ただ、それだけでは問題は解決しません。解決策の大半はモデルの外にあるからです。
- 読み込むナレッジ。 一般的な学習データではなく、過去のチケットとヘルプセンターの記事。あいまいな記事(「すべてのモデル」)は、それでも自信満々の間違った回答を生みます。
- 確実なフォールバック。 検索で何も見つからないときは、エージェントは即興で答えず、人に引き継ぐべきです。
- 公開前のテスト。 実際の過去チケットでエージェントを動かし、その回答をチームが実際に送ったものと比べます。
- ヘルプデスクとの接続。 エージェントは、チケットがすでにあるZendesk、Freshdesk、Gorgiasの中で動く必要があります。
今日使えるモデルでこの4つを押さえれば、Argonは後から静かに行えるアップグレードになります。それぞれについては、サポートにおけるAIハルシネーションの防止のガイドでさらに詳しく解説しています。
eeselを試す
Gemini 4 Argonに期待するのがキューのチケットを減らすことなら、Googleの展開を待つ必要はありません。Argonはインフラで、eeselは従業員です。eeselのAIヘルプデスクチームメイトは、過去のチケットとヘルプセンターから学び、すでにお使いのヘルプデスクに接続します。また、実際の過去チケットでシミュレーションを実行するので、お客様に1件も返信する前に、その回答をチームが送ったものと比べて確認できます。

料金は月額固定のクレジットプランで、チケットまたはチャット1件が1クレジットです。全機能と無制限のシートが含まれ、100クレジットでカード不要の無料プランもあります。トークン単位の請求はないので、下にあるどこかのモデルのプロモが終わっても、お支払いは変わりません。キューの一部でeeselを試して、ご自身のチケットにどう回答するかをご覧ください。
よくある質問
Gemini 4 Argonとは何ですか?
Gemini 4 Argonは今すぐ使えますか?
gemini-4-argonは404 NOT_FOUNDを返し、モデル一覧にも載っていませんでした。Googleは、次に有料APIの顧客とGoogle AI Ultraの加入者に提供するとしていますが、日付は示していません。Gemini 4 Argonの料金はいくらですか?
Gemini 4 ArgonはGPT-6 Astraより優れていますか?
Gemini 4 ArgonはClaude Opus 5.5より優れていますか?
Gemini 4 Argonはハルシネーションが少ないですか?
サポートボットを作るのにGemini 4 Argonを待つべきですか?

Article by
Kira
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








