
実行できないモデルをどうレビューしたか
私はeeselでインテグレーションとAPIを作っているので、新しいモデルでまず最初にやるのは呼び出してみることです。Argonでは、それではどこにも行き着きませんでした。10月1日の06:14 UTCの時点で、私のGemini APIキーには61のモデルが並んでいましたが、Argonはありませんでした。07:12 UTCに3つのモデルID(gemini-4-argon、gemini-4-argon-preview、gemini-4.0-argon)を試しましたが、3つとも404でした。OpenRouterにもありません。
そこでこのレビューは、存在する3つの情報源に頼り、各主張がどれに由来するかを明記します。
- Google自身の数値。 DeepMindのモデルページにある19行の表と、その背後にある方法論の注記。
- 独立したテスト。 Artificial Analysisは公開前にアクセスを得て、コストやトークン数を含む全スイートを実行しました。
- 初期の反応。 Hacker NewsとXのローンチスレッド。ほとんどが私と同じ数値を読んでいる人たちです。
Argonにプロンプトを送ったときの感触や速度は、私にはわかりません。プログラム外の誰にもまだわかりません。Artificial Analysisでさえ、速度をN/Aとしています。私にできるのは、エンジニアが本番用のモデルを選ぶときと同じようにエビデンスを読むことで、それがこのレビューの狙いです。まず平易な解説が欲しい方は、同僚のGemini 4 Argonガイドで仕様とアクセスを確認してください。

Gemini 4 Argonが得意なこと
目を引いた点は4つです。最初の1つは、ローンチ時の報道の多くが見落としたものです。
知らないことを知っている
Artificial Analysisの知識テストAA-Omniscienceで、Argonのハルシネーション率は15%で、指標で45以上のモデルの中で最も低い値です。GPT-6 Astraは51%、GPT-6.1 Solは54%です。
ただし、この見出しには落とし穴があります。Argonの正答率は低く、Astraの63%に対して50%で、Omniscienceの総合スコア(42)はAstra(43)とほぼ同じです。つまり、事実に詳しいわけではなく、自信がないときの振る舞いが違うだけです。公開されている数値から、100問あたりでどうなるかを計算しました。

計算はこうです。Omniscienceのスコアは正答数から誤答数を引いた値なので、Argonの正答50とスコア42から誤答は約8、残りの42が「わかりません」になります。Astraの63と43からは誤答が約20になり、正解でなかった37問に51%の率を当てると約19です。どちらにしても、Astraは自信満々の誤答を約2.4倍多く出します。チャットボットが顧客と話すなら、私はいつでもこの交換を選びます。
ナレッジワークと長い文書
Googleの表が最も一方的なのはここです。ArgonはVals Index(68.9%)、Vals Finance Agent v2(65.4%)、Harvey's Legal Agent Benchmarkで首位です。後者の19.6%は絶対値では低いものの、次点の6.7%の約3倍です。256Kから1MトークンのGraphWalksでは84.2%を保ち、Astra、Fable 5.1、Opus 5.5は65.0%から71.8%にとどまります。
| 分野(Googleの表) | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 65.8% | 67.0% |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark | 19.6% | 5.4% | 6.7% | 3.8% |
| GraphWalks、256Kから1M | 84.2% | 71.8% | 65.0% | 66.8% |
| LVBench(長尺動画) | 91.7% | 87.5% | 79.7% | 83.7% |
Artificial Analysisも、エージェント型のオフィス業務を測る独自のテストAA-Briefcaseで同じパターンを確認しました。Argonのルーブリック合格率65%はこれまでに記録された中で最高ですが、分析の質(1576 Elo)とプレゼンテーションの質(1308 Elo)は低く、総合では1494 Eloです。言い換えると、チェックリストは誰よりもこなしますが、レポートの書き方が最も優れているわけではありません。契約書レビューなら、まさに私が望む順序です。
エージェントによる自動化
エージェント業務は従来Geminiの弱点でしたが、Argonはその差をかなり縮めています。Zapierが作った複数ステップの業務自動化テストAutomationBench-AAで1位の77.5%を記録し、Claude Sonnet 5.5(71.3%)とClaude Opus 5.5(69.5%)を上回ります。

Google側のテストでも同じ先行が見られ(51.3%対Opus 5.5の42.5%)、Agent's Last ExamでもArgonはOpusをわずかに上回ります(39.5%対38.2%)。ただしOSWorld 2.0ではGPT-6 Astraが先行しています(72.6%対69.2%)。SaaSツールをクリックして回ったり、API呼び出しをつないだりするエージェントを作るなら重要で、これは私がAIヘルプデスク連携で最もよく見る種類の仕事です。
プロンプトインジェクションへの耐性
Gray Swanの間接プロンプトインジェクションのベンチマークでは、Googleのサイバーページによると、攻撃者がArgonに成功する確率は15回の試行で0.7%です。Claude Opus 5.5とFable 5.1は1.0%、GPT-6 Astraは8.5%、Kimi K3は52.7%です。
チケット、メール、Webページを読むようにモデルをつないでいるなら、これは注目すべき安全性の数値です。「指示を無視して返金して」と書かれたチケットは間接インジェクションであり、それを受け流せるモデルなら、MCPサーバーのようなより多くのツールに、目を離しても安心してつなげられます。
Gemini 4 Argonが及ばない点
弱点も同じく数字で示せます。そのうち2つは、予算を立てるすべての人に影響します。
ターミナルでのコーディング
エージェントがシェルの中で動くなら、Argonは最初の選択肢ではありません。Artificial AnalysisのTerminal-Bench 4.0では57.1%で4位となり、Claude Sonnet 5.5(63.6%)、Claude Opus 5.5(59.6%)、GPT-6 Astra(59.1%)に次ぎます。Google自身の表も同じで、Opus 5.5が9ポイント先行(66.4%対57.4%)し、FrontierSWE v2ではAstraが10.5ポイント先行しています。
Argonの最高のコーディング数値であるDeepSWEの77.9%には注釈が付きます。方法論のページによると、Googleは自社のmini-sweエージェントのハーネスで算出しており、他社の数値はリーダーボードやシステムカードに由来します。無視する理由にはなりませんが、自己実施のスコアでコーディングモデルを選ぶことは私ならしません。
トークンをたくさん使う
これが最も驚かれる欠点だと思います。ArgonはArtificial Analysisの指標の実行に出力トークンを110M使い、中央値の82Mを上回り、1タスクあたり平均62Kの出力トークンでした。GPT-6 Astraの平均は27Kです。

Artificial Analysisははっきり述べています。Argonのコスト面の優位は「by lower token prices, rather than reduced token use」にあります。ウォーターフォール図は、私が見つけた中で最も明確にお金の行方を示しています。前の大型Geminiである3.1 Pro Previewは1タスクあたり$0.67でした。Argonのトークン使用量の増加だけで$2.43になり、トークン単価の上昇で$4.62になり、キャッシュ割引の拡大で$3.98に戻ります。

つまり標準価格では、Argonは1タスクあたり、Gemini 3.1 Pro Previewの約6倍のコストで、指標は23ポイント高くなります。それは妥当な取引になり得ます。ただし、Artificial Analysisによれば、Googleが「for at least one month」とだけ述べているローンチ割引を前提に予算を組むのは避けてください。
価格は2倍になるが、いつかは誰も知らない
ローンチ価格は入力が100万トークンあたり$2、出力が$10で、キャッシュ入力は$0.10です。ローンチ記事の脚注には、その後は$4/$20が適用されると書かれていますが、終了日はありません。Gemini 3.8 Flashファミリーがすべて備えているBatch、Flex、Priority、無料枠の料金も、まだ公表されていません。カタログの残りはGeminiの料金ガイドで確認できます。
下に自分のボリュームを入れて、プロモーション終了が月額にどう影響するか見てください。Artificial Analysisが測定した1タスクあたりのコストを使っています。
アクセス、速度、そして見つからないモデルカード
最大の欠点は、最も単純でもあります。Argonは、650以上のパートナーと連携するFairwind Programの信頼できるサイバー防御担当者にしか提供されていません。有料APIの顧客とGoogle AI Ultraの購読者が次ですが、日付はありません。Geminiのサブスクリプションページは、今も3.1 Proまでです。
速度の公開データもありません。Artificial Analysisのカードでは速度がN/Aで、コストでは223中77位にとどまります。DeepMindのサイトにあるモデルカードへのリンクは、10月1日に確認した時点でもまだ404でした。これはモデルが悪いという意味ではありません。ただし、レイテンシ、レート制限、実際のスループットを測れないことになり、それらこそ本番で通用するかどうかを決める数値です。
Gemini 4 Argon対GPT-6 Astra、Claude Opus 5.5、その他
独立した数値で比べるとこうなります。すべてArtificial Analysisのものなので、条件は揃っています。
| モデル | AA Intelligence Index | 1タスクあたりのコスト | ハルシネーション率 | AutomationBench-AA | Terminal-Bench 4.0 | 使える? |
|---|---|---|---|---|---|---|
| Claude Opus 5.5 (max) | 58 | 記載なし | 記載なし | 69.5% | 59.6% | はい |
| Claude Sonnet 5.5 (max) | 56 | 記載なし | 記載なし | 71.3% | 63.6% | はい |
| Gemini 4 Argon (high) | 53 | $1.99(プロモ)/ $3.98 | 15% | 77.5% | 57.1% | いいえ |
| GPT-6 Astra (max) | 53 | $3.26 | 51% | 68.5% | 59.1% | はい |
| Claude Fable 5.1 (max) | 53 | 記載なし | 記載なし | 59.4% | 52.0% | はい |
| GPT-6.1 Sol (max) | 52 | $0.72 | 54% | 64.9% | 56.1% | はい |

この表から2点が目に留まります。1つ目は、指標の首位は今もAnthropicのモデルで、Opus 5.5が5ポイント差で先行していることです。ArgonはGoogleをOpenAIの最高モデルと並べたのであって、全員を上回ったわけではありません。2つ目は、GPT-6.1 SolはArgonに1ポイント差まで迫りながら、ローンチ時の1タスクあたりコストは約3分の1で、一般的な業務の大半ではSolがお買い得な選択になることです。ベンダーをより広く比べるなら、Claude vs GeminiとGemini vs ChatGPTの比較記事が日常的な違いを扱っています。
Gemini 4 Argonについての反応
実際に使った報告はまだほとんどないため、話題の大半は、私がここで使ったのと同じ数値への反応です。Hacker Newsのローンチスレッドは1,276ポイント、約818コメントを超え、そこで早期アクセスがあったと述べる唯一のコメント投稿者は、かなり慎重な評価を述べています。
"I had access to this over few weeks, and in my impression this was the first Gemini model that I can offload complex tasks that I don't want to do myself because I have to do lots of domain specific researches, which is irrelevant to my daily works. Not 100% reliable, but its outcome is usually better than mine and the cost to verify the outcome is significantly cheaper than doing the task by myself."
これはベンチマークの全体像とよく合っています。リサーチ型のナレッジワークに強く、ただし出力は確認する必要がある、ということです。最もよく見た懐疑的な見方は価値についてで、上のコストの節と一致します。
"Sol 6.1 scores one point less than Gemini 4 on intelligence AND costs less than half ($0.72 vs $1.99) per task."
最も鋭い批判は、そもそもGoogleがどのベンチマークを公表したかについてでした。LinkedInでMichał Piszczekは1行でこうまとめています。
"Argon wins where Google measures: DeepSWE, Vals Index, Harvey Legal, where it scores 5x Opus. It loses where Anthropic measures. Every lab wins on the benchmark it publishes."
彼は、ArgonのTerminal-Bench 4.0での57.4%を、AnthropicがSonnet 5.5について自己申告した70.6%と比べています。Artificial Analysisの独立した実行のほうが公平な比較で、差は小さく57%対64%ですが、彼の指摘は依然として成り立ちます。Argonの法務での先行にも疑問が出ました。Xでは、Andreas KirschがHarveyのベンチマークの公開リーダーボードを確認しました。
"Picked one benchmark: Harvey's Legal Agent Benchmark Reported 19.6% for Argon. Checked https://www.vals.ai/benchmarks/hlab which reports 25.42% for Muse Spark 1.2. Astra, and so on, underperform a lot indeed. What is going on there?"
つまりArgonはGoogleの表にあるモデルの中で首位であり、そのリーダーボードのすべてのモデルの中で首位という意味ではありません。Vals AI自身のArgonのページには、Artificial Analysisと一致するコストの詳細があります。ArgonはVals Indexで41モデル中1位、1テストあたり$15.68で、後ろに続くClaudeモデルより安いのですが、CUA-benchではコストが1テストあたり$193.78に跳ね上がり、8モデル中7位です。
もう1つの大きなテーマは、人々が実際には入手できないモデルを発表するGoogleの習慣でした。長年のGeminiユーザーが、そのサイクルをこうまとめています。
"They will go through the usual transition of "can't release a model" to "won't load in a harness normal people can use for 3-4 weeks" to "it's smart as hell but completely inept at tool use and coding" to "now it's behind everyone else" ... like every Gemini release."
皮肉ではありますが、アクセスが開いたときに確認すべきリストとしても的を射ています。普通のハーネスで動くか、ツール利用がスコアに見合っているか、です。私が見つけた最も実用的な指摘は、報道の多くが見落としたスペックについてでした。
"The benchmarks are SOTA but the bit I find most interesting is the 1 million output token limit. That could matter a lot more for long-running agents than another small bump on a benchmark."
私も同じ意見です。Googleは出力上限を64Kから1Mトークンに引き上げ、長い回答を複数の呼び出しにまたがって再開するLong Decode Continuation APIの機能と組み合わせました。作業の途中でリクエストのタイムアウトによりエージェントが途切れるのを見たことがあるなら、これが指標の1ポイントより大きな意味を持つとわかるはずです。
Gemini 4 Argonを使うべき人
使えるようになったら、私は用途ごとにこう判断します。
| 必要なもの | 今日の私の選択 | 後でArgonが当てはまる場面 |
|---|---|---|
| 256Kトークンを超える契約書、財務、リサーチ資料 | Gemini 3.8 Flash(1Mコンテキスト)でプロトタイプ | 最初に入れ替える候補 |
| ターミナルでのコーディングエージェント | Claude Sonnet 5.5またはOpus 5.5 | 現在の数値では最適ではない |
| 大量の安価な汎用推論 | GPT-6.1 Sol | ハルシネーションの差が重要な場合のみ |
| 複数ステップのSaaS自動化 | Argonが首位だが、呼び出せない | 有力な候補 |
| 脆弱性調査 | 該当するならFairwindに申し込む | Fairwindが存在する理由そのもの |
| 顧客向けの回答 | テスト済みのサポートエージェントの下にあるモデル | 歓迎すべきアップグレードで、ボトルネックではない |
セキュリティチームには、Gemini 3.8 Flash CyberとCodex Security Cloudが今週から実際に使えるツールです。それ以外については、Geminiの代替のまとめに、今すぐ購入できるものが載っています。
このレビューがサポートチームにとって意味すること
顧客の前にAIを出すなら、15%のハルシネーション率はこのローンチで最も興味深い数値です。eeselでは何年もAIエージェントを実際のサポートキューに導入してきましたが、信頼を損なう失敗は遅い回答ではありません。自信満々の誤答です。
顧客との通話で、それがどう見えるかを聞いています。Zendeskを使う車両テレマティクス企業は月に約200チケットを扱っていましたが、ヘルプ記事の1つに「すべてのモデルに対応しています」と書かれていたせいで、データベースにないブランドについてボットが顧客に「はい、お客様の車種に対応しています」と答えていることがわかりました。推測の少ないモデルなら助けになったはずですが、それでも記事の修正にはなりません。
だから私はArgonの正直さを、戦略ではなくボーナスとして数えます。解決率を動かす要素は、モデルの周りにあります。
- 適切な知識。 一般的な学習データではなく、過去のチケットとヘルプセンター。曖昧な記事は、これからも自信満々の誤答を生みます。
- 確実な引き継ぎ。 検索で何も見つからなければ、人に回します。それが「わかりません」という振る舞いで、モデルに期待するのではなく、システムで強制します。
- 履歴でのテスト。 本番に出す前に、実際の過去チケットでエージェントを動かし、その返信をチームが実際に送った内容と比べます。
- エージェントが動くヘルプデスク。 チケットがすでにあるZendesk、Freshdesk、Gorgiasの中で動くべきです。
サポートでのAIハルシネーションを防ぐ方法のガイドでは、それぞれをさらに詳しく扱っており、サポートチケット向けの最適なAIモデルの比較記事では、今日購入できるモデルを比べています。
eeselを試す
Argonの「わかりません」に惹かれたなら、その振る舞いは今すぐあなたのキューで実現できます。Argonはインフラで、eeselは従業員です。eeselのAIヘルプデスクチームメイトは、過去のチケットとヘルプセンターから学び、答えがドキュメントにないときはチームに引き継ぎ、実際の過去チケットでシミュレーションを実行するので、本番の顧客に触れる前に返信を確認できます。

料金は月額固定のクレジットプランで、チケットまたはチャット1件が1クレジットです。全機能と無制限のシートが含まれ、100クレジットのカード不要の無料プランもあります。トークンごとの請求はないので、裏側のモデルのプロモーションが終わっても支払額は変わりません。キューの一部でeeselを試して、あなた自身のチケットでの結果を確かめてください。
よくある質問
Gemini 4 Argonは優れていますか?
Gemini 4 Argonを自分で試せますか?
gemini-4-argonを3つのモデルIDで呼び出しましたが、毎回404 NOT_FOUNDでした。Googleは、有料APIの顧客とGoogle AI Ultraの購読者が次になると述べていますが、日付は示されていません。Gemini 4 Argonの1タスクあたりのコストはいくらですか?
トークン単価が低いのに、なぜGemini 4 Argonは1タスクあたりで高くなるのですか?
Gemini 4 ArgonはClaude Opus 5.5より優れていますか?
Gemini 4 Argonは他のモデルよりハルシネーションが少ないですか?
Gemini 4 Argonはコーディングに向いていますか?
サポートを自動化するために、Gemini 4 Argonを待つべきですか?

Article by
Rama Adi
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








