Gemini Robotics 2:DeepMind自身の数字が示すもの

Alicia Kirana Utomo
執筆者

Alicia Kirana Utomo

Katelin Teen
レビュー者

Katelin Teen

最終更新 August 6, 2026

専門家による検証済み
ヒューマノイドロボットの制御モデルを描いたイラスト、Gemini Robotics 2を表現

Gemini Robotics 2の正体

作業台の上で青いビンの中の布に手を伸ばすApptronik Apollo 2ヒューマノイドと、その様子をノートPCの後ろから見守る3人の研究者、Google DeepMindより
作業台の上で青いビンの中の布に手を伸ばすApptronik Apollo 2ヒューマノイドと、その様子をノートPCの後ろから見守る3人の研究者、Google DeepMindより

この命名は誰の助けにもなっていないので、まずシンプルに説明しておく。「Gemini Robotics 2」はファミリー全体の名前でもあり、そのファミリーの中にある特定の1モデルの名前でもある。3つのモデルが同じ日に一斉に発表され、それぞれ役割が異なる。

Gemini Robotics 2の3モデルを縦に並べた図。上段の計画役ER 2が中段のVLAへモーター制御を渡し、それがさらに下段のオフラインで動くOn-Device 2へ渡される
Gemini Robotics 2の3モデルを縦に並べた図。上段の計画役ER 2が中段のVLAへモーター制御を渡し、それがさらに下段のオフラインで動くOn-Device 2へ渡される

この分割は重要だ。まともなエージェントシステムを設計するなら、私も同じアーキテクチャを描くはずだからだ。1つのモデルが「何をすべきか」を推論し、うまくいったかどうかを追跡する。別の、より高速なパーツが実行を担う。DeepMindは、ER 2が「モーターの実行を、その時点で与えられた下位のvision-language-action(VLA)モデルに委ねる」と明言している。つまり計画役は、意図的に「手」の実装を気にしない設計になっている。

モデル役割ステータス入手方法
Gemini Robotics 2(VLA)視覚と言語をモーター制御に変換、足先から指先までプライベートプレビューTrusted Testerフォームのみ
Gemini Robotics ER 2複数ステップのタスクを計画し、人と対話し、進捗を追跡パブリックプレビューGemini APIとGoogle AI Studioからセルフサーブで利用可能
Gemini Robotics On-Device 2同じVLAの役割を、ネットワークなしでローカル実行信頼されたテスターのみウェイトリストフォーム

ドキュメントの中の一つの記述が、全体の見方を変えてくれる。ER 2はGemini 3.5 Flashをベースに構築されている。Proクラスの派生版でもなければ、専用に設計されたアーキテクチャでもない。空間推論、動画中の特定シーン検索、複数ロボットのオーケストレーションをチューニングしたFlashクラスのモデルなのだ。Gemini 3.6 Flashを追っていた人なら、その裏にある計算資源の規模感はおおよそ想像がつくはずで、Flash-Liteシリーズも同じことを物語っている。

ポインティングや座標系の処理は、Geminiのエージェント型ビジョンと同じ系譜から来ている。ファミリー全体を比較検討したいなら、私が更新し続けているGeminiの代替ツール一覧も参考にしてほしい。

全身制御という主張は本物であり、はっきりさせておく価値がある。これまでのバージョンはテーブル上の作業向けに、ヒューマノイドの上半身しか動かしていなかった。今回は脚も制御する。DeepMindが公開したデモ用のプロンプトは_「水差しを一番下の棚の緑色のビンに入れて」_というもので、Apptronikの Apollo 2がテーブルまで歩いていき、水差しを持ち上げ、棚まで歩いて置く。同じモデルのチェックポイントは、二指グリッパーを装着したFranka Duoも動かしており、こちらのほうが実は静かに印象的だ。

DeepMindが自ら公開した数字

以下が、DeepMindが報告したとおりの完全な表だ。3つのスキルグループはいずれも1つの共有チェックポイント上で動作し、3種類の異なるロボット本体で実行されている。だからこそ、ここで見られる差は恥ずかしいものではなく、むしろ興味深い。

スキルグループロボットとハンドタスク成功率
全身操作Inspireハンド搭載のApollo 2棚から物を拾う76.3%
全身操作Inspireハンド搭載のApollo 2テーブルから物を拾う68.4%
全身操作Inspireハンド搭載のApollo 2床から物を拾う45.7%
多指の巧緻性SharpaWaveハンド搭載のApollo 2電球を外す92%
多指の巧緻性SharpaWaveハンド搭載のApollo 2ゴミ袋を結ぶ44%
多指の巧緻性SharpaWaveハンド搭載のApollo 2ジップロックを閉じる40%
多指の巧緻性SharpaWaveハンド搭載のApollo 2電球を取り付ける36%
多指の巧緻性SharpaWaveハンド搭載のApollo 2ちりとりで掃く32%
グリッパーの巧緻性Robotiqグリッパー搭載のFranka Duo精密な差し込み89.6%
グリッパーの巧緻性Robotiqグリッパー搭載のFranka Duo多様な工具の仕分け78.9%
グリッパーの巧緻性Robotiqグリッパー搭載のFranka Duo一般的なピックアンドプレース74.2%

多指グループの一番上と一番下を並べて見てほしい。この2つの組み合わせだけで、2026年のロボット学習がどこまで来ているかがすべて分かる。電球を外す作業は92%。取り付ける作業は36%。どちらも同じロボットの、同じ5指・22自由度のSharpaWaveハンドを使っている。違うのは動きの種類だ。外す動作はゆるく、多少の誤差も許容される。取り付ける動作は、トルクをかけながら位置合わせを保つ必要がある。片方はただの「つかむ」動作で、もう片方は「制御」の問題なのだ。

グリッパーグループはほぼ全ての項目でハンドグループを上回っており、これも少し考えてみる価値がある2番目のポイントだ。Franka Duo上の二指Robotiqグリッパーは精密な差し込み作業で89.6%を出しているのに対し、人型のハンドはジップロックの作業でわずか40%しか出せていない。自由度が多いほど、細かい作業ではむしろ結果が悪くなった。少なくとも今のところは。

そしてDeepMind自身がそう認めている。グラフの注記にはこうある。「Gemini Robotics 2は全身動作とグリッパーを使った巧緻タスクでは中〜高程度の成功率を達成しているが、多指を使った巧緻な操作は依然として課題が残る」。同じページの別の場所では「私たちのロボットは動作速度についてまだ進歩の余地がある」とも述べており、人間レベルの巧緻性は「主張」ではなく「目標」として位置づけられている。

単一の混合数値では、これらすべてが見えなくなる理由

この5つの多指タスクを平均すれば、40%台半ばあたりの数字になり、そこから学べることは何もない。あるモーションではほぼ解決済みで、別のモーションではほとんど機能していないという事実は見えなくなる。また、どのタスクを前提にプロダクトを設計してはいけないかも分からなくなる。

ビフォーアフター図。「見出しスコア1つ」と書かれた高いバーが「問題なさそうに見える」と示し、そこから「内訳を開く」という矢印が伸びて、外す・結ぶ・ジップロック・取り付ける・ちりとりの5本の降順バーへ続き、平均を示す破線が引かれている
ビフォーアフター図。「見出しスコア1つ」と書かれた高いバーが「問題なさそうに見える」と示し、そこから「内訳を開く」という矢印が伸びて、外す・結ぶ・ジップロック・取り付ける・ちりとりの5本の降順バーへ続き、平均を示す破線が引かれている

これはロボティクスに限った問題ではまったくない。あらゆるカテゴリーのAIマーケティングの標準的な状態であり、自分自身の業界も例外ではない。ひとつの一次対応デフレクションの数字が、まったく同じばらつきを覆い隠してしまう。実際に数字を動かしてみて、見出しがいかに簡単に操作できるかを見てほしい。

"都合のいい4つだけ"を試してみると、どのマーケティングチームも喜んで印刷したくなるような数字が出てくる。同じモデル、同じ日、同じ研究所。それを作るために何かを偽造したわけでもない。これがそのトリックであり、単一の数字を報告するすべてのベンダーが使える手口だ。

最も興味深い数字は、ロボットではなく人間についてのものだ

ER 2のベンチマークの中に、DeepMindが3パターンで比較している数字が埋もれている。これは推論モデルが下流の実行役をどれだけうまく操縦できるかを測るもので、変わるのはその実行役だ。実機のロボット、シミュレーションされたロボット、そして人間の遠隔操作者。

制御モードGemini Robotics ER 1.6Gemini Robotics ER 2
人間の遠隔操作を制御63.6%74.0%
実機VLAを制御48.6%60.0%
シミュレーションVLAを制御37.4%42.9%

同じ計画役モデルでも、ロボットを指示するより人間を指示するほうが14ポイント成績が良い。どちらかのケースでモデルの性能が落ちているわけではない。相手側の人間が、あいまいさを吸収し、つかみ損ねをリカバーし、指示に書かれていなかった意図を補ってくれているだけなのだ。

「同じ計画役、同じ脳」と書かれた1つのボックスが2本のレーンに分かれる図。人間の助手を操縦する74.0%と、ロボットアームを操縦する60.0%の2本で、14ポイントの差を示す括弧が付いている
「同じ計画役、同じ脳」と書かれた1つのボックスが2本のレーンに分かれる図。人間の助手を操縦する74.0%と、ロボットアームを操縦する60.0%の2本で、14ポイントの差を示す括弧が付いている

デモ映像を見ていたRedditのコメント投稿者も、外から見て同じ結論に達している。

Reddit

"The bottleneck seems to be software. So until we get ai good enough to pilot a robot, it's going to remain slow.

If you see robots piloted by humans, they are much faster."

これは壁に貼っておきたいくらいの発見であり、実のところロボティクスの発見ではない。数字が付いたAIコパイロットの議論そのものだ。計画を立てたうえで有能な人間に引き渡すモデルは、同じモデルが自らエンドエフェクタを操作するよりも成績が良く、その差は数値で測れる。サポート業務に当てはめれば、エージェントが人が送る返信の下書きを作るケースと、エージェントが自分で返信するケースの違いだ。どちらの成績が良いかについての正直な答えは、DeepMindと同じで、人間がループに入っているほうだ。タスク別の数字が別のことを語るようになるまでは。

これは自律性そのものへの反論ではまったくない。選ぶ前にその数字を知っておくべきだという主張であり、その数字は速く動く。半年前の最良のAIエージェントが、今日選ぶべきものとは限らないくらい速く。

ER 2の比較データの残りの部分も強力で、公平に報告する価値がある。

指標Opus 5GPT 5.6 SolER 1.6Gemini 3.6 FlashER 2
質問応答(ERQA)67.2%43.2%72.5%73.0%78.5%
成功検知(画像)83.6%83.1%82.9%83.3%87.7%
成功検知(動画)81.0%74.7%76.0%75.4%82.4%
汎用的な計器読み取り53.0%61.5%52.8%52.0%65.7%
進捗の分類37.1%46.2%42.7%43.9%57.4%

進捗分類は、このページの中で最も差が大きい項目だ。57.4%対、ロボティクス以外の最良モデルの46.2%。この指標は「タスクのどこまで進んでいるか分かるか」を測るもので、フレームごとに5段階のバケットに分類してスコア化される。地味な指標だが、エージェントが「続けるべきか、助けを求めるべきか」を判断する前に必ず知っておく必要のあるものだ。DeepMindはまた、モーメント検索の精度が91.3%で、平均絶対誤差が0.96秒、実行速度は大型モデルカテゴリーの4倍だと報告している。

この57.4%という数字は、裏を返せば10回に4回ほど進捗を見誤っているということでもある。この分野のベストであっても、それだけの頻度で間違えるのが普通の状態であり、これはまさに「最先端」という一行の主張が消し去ってしまう類の事実だ。

誰も話題にしていない安全性の急上昇

これは私が思わず身を起こしてしまった数字だ。まだどこでも取り上げられているのを見たことがない。

安全性指標Opus 5GPT 5.6 SolER 1.6ER 2
安全指示への追従95.9%91.4%47.2%97.9%
人への接近(1m)77.1%83.4%51.1%93.0%

Gemini Robotics ER 1.6が安全指示に従っていたのは47.2%の割合でしかなかった。このモデルは2026年4月にリリースされた、つまり4か月前のものであり、両方の安全性指標でOpus 5とGPT 5.6 Solの両方を下回っていた。ロボティクス向けに調整されたモデルが、比較対象となった汎用テキストモデルよりもロボットの安全性で劣っていたということだ。

ER 2はこれを大きく改善し、97.9%と93.0%まで引き上げている。良いことだ。ただ、ここで有用な教訓は、バージョンラベルを信頼することについて前世代の数字が示している内容のほうだ。「フロンティアラボの最新ロボティクスモデル」というものが、先週まで、安全制約に従う割合が半分未満だったということになる。DeepMindはこのためのベンチマークとしてASIMOV-Agenticを新たに公開し、パブリックデータセットとして提供している。これは推論エージェントが安全でないツール呼び出しを拒否するか、タスクが不可能であることを予測できるか、そして不確かなときに人間に助けを求めるかを測定するものだ。

拒否すること、失敗を予測すること、不確かなときにエスカレーションすること。これは、多くのサポートAIのドキュメントよりも、よくできたサポートエージェントの説明としてすぐれており、そのままエスカレーション管理にも当てはまる。ハンドオフはさらに別の規律であり、チャットのハンドオーバーは多くのチームが最初に間違えるポイントだ。

ここでの限界については正確に述べておく価値がある。このブログはER 2をDeepMind史上最も安全なロボティクスモデルだと主張しているが、ASIMOV-Agenticの結果自体については数値スコアを何も公開していない。それらは別の安全性技術レポートにまとめられている。そして開発者向けドキュメントは、責任の所在についてはっきりと書いている。「ロボット周辺の安全な環境を維持するのはあなたの責任だ」と。

コストと、ドキュメントに潜む落とし穴

価格が付いているのはER 2だけだ。ハードウェアに触れる2つのモデルには価格が一切ない。単純に、購入すらできないからだ。

項目gemini-robotics-er-2-previewER 1.6(廃止予定)
入力、100万トークンあたり$2.00(テキスト、画像、動画、音声)$1.00、音声は追加$2.00
出力、100万トークンあたり$10.00(思考トークンを含む)$5.00
バッチ料率入力$1.00 / 出力$5.00非公開
コンテキストキャッシュ$0.20、加えて保存に100万トークン・1時間あたり$1.00非公開
無料利用枠無料。ただし入力データはGoogleのプロダクトの学習に使われる無料
コンテキストウィンドウ入力131,072 / 出力65,536入力131,072 / 出力65,536
公開されているレート制限なしなし

価格は2倍になった。ER 2は入力・出力の両方でER 1.6の2倍だ。ただ、入力レートが一律であるため、音声中心の作業は視覚系の作業に比べて相対的な上昇幅は小さくなる。コンテキストウィンドウはまったく増えていない。ストリーミング版の姉妹モデルgemini-robotics-er-2-streaming-previewもあり、見出しの料率は同じだが、バッチ料率もキャッシュもない。

ドキュメントの中には、先に読んでおかないと午後の時間を丸ごと持っていかれる4つのポイントがある。

  1. 制限のないAPIキーは容赦なく403になる。 ロボティクス系はGeminiの中でもデフォルトキーを拒否する唯一の窓口なので、最初の呼び出しの前にAI Studioで制限を追加しておくこと。
  2. ストリーミングエンドポイントは画像入力をJPEG、1秒あたり1フレームに制限している。 リアルタイムを謳う文脈の中では奇妙な制約だ。ロボットのカメラフレームは1秒に1枚までしかストリーミングできない。
  3. ストリーミングエンドポイントは構造化出力とコード実行をサポートしない。 つまりJSONスキーマを使う経路も、エージェント型ビジョンの経路も、非ストリーミングモデルの領分になる。
  4. ドキュメントはレイテンシのためにmediumの思考レベルを推奨しているが、はじめかたのサンプルコードはhighのまま出荷されている。 そこからコピペすると、遅いデフォルト設定を引き継いでしまう。

これらのモデルには、普通のGeminiのページには付いていないプライバシー通知も付いている。モデルが「ハードウェアを操作し、動かすために動画データと音声データを活用する」ため、Googleは、通知と同意を得るまで、識別可能な人物をロボットの周囲に居させないことを求めており、さらに顔のブラー処理も要求している。これを無料利用枠の「プロダクト改善に使用:はい」という項目と並べてみてほしい。カメラを人に向けた無料利用枠のロボットは、クォータの問題ではなく、同意の問題になる。

そしてカレンダーに書き込んでおく価値のあるスケジュールの話をひとつ。gemini-robotics-er-1.6-preview2026年8月31日に停止される。ER 1.5はすでに4月に引退済みだ。つまり1年の間に2つのエンドポイントが引退しており、現行のモデルコードにはいまだに-previewという接尾語が付いたままで、固定できる安定したエイリアスは存在しない。

新しいロボットへの適応と、複数ロボットの話

Gemini Robotics On-Device 2は、私が個人的に最も静かに重要だと感じている部分だ。ローカルで動作し、Gemini Robotics 1.5からのモーション転送の成果を引き継いでおり、まったく新しい双腕ロボットにも「わずか数時間の適応時間、多くの場合200例未満」で適応できる。新しい形状、新しいセンサー、一致しない自由度にも対応する。

様々な速度で自律タスクをこなすロボットの6分割グリッド画像。書籍を棚に並べる双腕ロボット、チェスの駒を動かすTrossenアーム、モニター上で「私はロボットです」というチェックボックスをクリックするアーム、ラックに皿を積み重ねるロボット、上空から見たキッチンのシーン、トレイにパーツを仕分けするオレンジ色のグリッパー、Google DeepMindより
様々な速度で自律タスクをこなすロボットの6分割グリッド画像。書籍を棚に並べる双腕ロボット、チェスの駒を動かすTrossenアーム、モニター上で「私はロボットです」というチェックボックスをクリックするアーム、ラックに皿を積み重ねるロボット、上空から見たキッチンのシーン、トレイにパーツを仕分けするオレンジ色のグリッパー、Google DeepMindより

新しいロボット本体を立ち上げるのに200例未満というのは、この分野の経済性を変えてしまう数字だ。あのグリッドの中のタスクはDexmate、SO101、Trossenの各プラットフォームで実行されており、いずれも旗艦のヒューマノイドではない。パネルのひとつは、ロボットアームが「私はロボットです」というチェックボックスをクリックしているもので、おそらくジョークだと思うし、私はそれを気に入っている。

複数ロボットの連携も、もう一つの新機能だ。ロボット同士が通信し、互いの物理的な強みを認識し、タスクを互いに委任し合う。デモではApollo 2ヒューマノイドがFrankaアームと並んで作業しており、モニターにはモデルが実際に見ている映像が表示されている。

作業台の上のグレーのトートの横に立つApollo 2ヒューマノイドと、双腕Frankaロボット。右側のモニターにはロボットのカメラ映像が表示されている、Google DeepMindより
作業台の上のグレーのトートの横に立つApollo 2ヒューマノイドと、双腕Frankaロボット。右側のモニターにはロボットのカメラ映像が表示されている、Google DeepMindより

DeepMindはApptronik、Boston Dynamics、Agile Roboticsをパートナーとして謝辞に挙げている。別のデモでは、Boston DynamicsのSpotがオーケストレーションされたSpot APIを通じてポップコーンを取ってくる様子も見られる。ハードウェア側では、Apptronikが2026年2月に5.2億ドルのシリーズA-Xを調達し、累計は10億ドル近くに達している。指摘しておく価値があるのは、Apollo 2はデータ収集用のプラットフォームであり、商用機ではないという点だ。商用機はApollo 3で、発表日はまだない。関係する4社のハードウェアベンダーいずれからも、仕様や価格は一切公開されていない。

現場のエンジニアたちが実際に語ったこと

Hacker Newsのスレッドは619ポイント、553件のコメントに達し、どの報道記事よりも読む価値がある。中でも最も有用だったコメントは、こうしたモデルに実際に取り組んでいる人物からのものだった。

Hacker News

"Plus we have no good reliable accuracy testing data in most cases (most tests occur on a few demos, but that isn't a good representation of how must things work), popular benchmarks, such as libero have been saturated, and nearly everything gets 95% there, most companies and researchers have their own benchmarks here."

飽和したベンチマークと、みんなが自分の宿題を自分で採点している状況。これはソフトウェアAIの評価にもほぼそのまま当てはまる話であり、だからこそOpenAI自身の評価ガイダンスも、公開のリーダーボードを信じるよりも自前の評価セットを作ることを強く推奨している。

最も鋭い批判は、モデルそのものについてではまったくない。動画の「見せ方」についてのものだ。

Reddit

"This is why we need long continuous shots of robots interacting doing tasks, rather than the sizzle reels with 5 second shots. The long shots tell the true story of how far along the technology is, while the short shots make it look way more advanced than it really is. Still, great to see the progress being made."

あるHNのコメント投稿者はさらに踏み込み、このデモを「無駄に複雑なロボットで低い成功率のピックアンドプレースを大げさに見せているだけ」と評し、競合の公然と遠隔操作していることを明示した映像のほうが好ましいと述べている。実際の展開に近いからだという。厳しい評価だが、45.7%という数字を踏まえれば、あながち的外れとも言えない。

その36%という数字は、さらに大きな議論の根拠として取り上げられることになった。

Hacker News

"A 36% success rate on screwing in a light bulb means there's probably something to LeCunn's take that VLM/VLA models aren't going to be the thing powering tomorrow's robots, but only time will tell."

最も鋭い反論は一行で来た。私が賭けるならこちらだ。

Hacker News

"It's still very early days. There are many benchmarks that LLMs scored 36% on just 18 months ago that they're now at 100% on."

そして、あるロボット工学者が「ゆっくり慎重に」と「速く滑らかに」がまったく別の問題クラスである理由を説明している。

Hacker News

"An algorithm to fold tshirts 90% of the time is easy. The cloth hangs down by gravity and you can just look for right angles (corners), find their coordinates with binocular matching, and move them to meet each other. Getting 99%, or folding them quickly, so that the fabric is actually moving instead of just hanging still- incredibly, incredibly more complex."

「それってFigureがもう見せていたのでは」という声もかなり多く見られた。そこで、本当に重要な比較の話に移ろう。

この表を公開しているのは他に誰もいない

この分野の他のすべてのラボについて、同等のタスク別数値がないか探してみた。公開されているものはこれで全部だ。

ラボ最新の公表モデルタスク別成功率は公開されているか?
Google DeepMindGemini Robotics 2, 30 Jul 2026はい、ローンチページに11個の絶対値を公開
Physical Intelligenceπ0.7, 16 Apr 2026部分的、ベースラインとの相対値のみ、クライアント側でレンダリング
FigureHelix 02, 27 Jan 2026いいえ、成功率はゼロ、タスクは動画のみ
Tesla名前なしいいえ
UnitreeUnifoLM-VLA-0、オープンソースいいえ、評価データなし

自社のローンチページに絶対的なタスク別失敗率を載せているのはDeepMindだけだ。Figureは巧緻性タスクの名前を挙げ、4分間の皿洗い機動画を見せているが、そこにはいっさい数字が付いていない。Teslaは Optimusのモデル名すら一度も明かしていない。Physical Intelligenceはタスク別レートをグラフ化しているが、それはRL専門のベースラインとの比較であり、値は明記されずクライアント側でレンダリングされているだけだ。

だからGemini Robotics 2について正直に読み取るべきなのは「Googleのロボットは遅れている」ということではない。自社のロボットが実際にどこまで来ているかを見せているのはGoogleだけであり、しかもその開示した数字のせいで批判されている。これは良くないインセンティブだ。このままいけば、次のラボはただ動画だけを公開するようになるだろう。

AIエージェントを購入する側にとって、これが意味すること

私はロボットの仕事はしていない。サポートチケットを処理するAIエージェントを作っている立場から見ても、今回のリリースは、ベンダーが私に見せるべきものについての考え方を変えるものだった。

あるお客さまの話をしよう。デンマークのB2B車両テレマティクス企業で、Zendeskで月間約200件のチケットを処理し、2,000件規模へと拡大しつつあるチームだった。そこのエージェントは、データベースに存在しないブランドの車種について、自信満々に「はい、そのお車の型式には対応しています」と顧客に伝えるようになってしまった。ナレッジベースには「すべての型式に対応」と書かれていた。ボットはそれを信じたのだ。彼ら自身によるその初期セットアップの総括は「最初は試行錯誤だった」というものだった。このタイプのチケットは、タスク別の表では明確にゼロ点になるはずのものだが、混合された数字の中では単純に見えなくなっていた。これはカスタマーサービスの自動化においてよくある、特別珍しくもない失敗の形であり、だからこそハルシネーション防止はモデルの問題である以上に、設定の問題なのだ。

だからこそ、eeselのすべての導入は、まず顧客自身のチケット履歴に対してシミュレーションを実行する。解決済みチケットのバッチを取り出し、エージェントが答えたであろう内容を生成し、実際に人間が送った内容と比較してスコア化し、実際の顧客が1人も関わる前にギャップレポートを作成する。これはDeepMindの表と同じ考え方であり、ただ電球ではなく自分たちのチケットから作られているだけだ。あるDTCサプリメントブランドのCXリーダーは、この要件を私よりうまく言い表している。

"The AI will never be able to answer 100% of the questions... I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

この今回のリリースから、物理・非物理を問わずAIエージェントを購入する際に持ち帰りたい3つのポイント。

  1. 見出しの数字ではなく、タスク別の表を求める。 ベンダーが単一のデフレクション数値を提示してきたら、インテント別、チケットタイプ別に分割してもらうよう求める。真実はそのばらつきの中にあり、AIの性能指標もその粒度でこそ役に立つ。初回解決率にも同じことが言える。
  2. 本番投入の前に、自社の履歴でテストする。 他人のタスクで実行したベンチマークは、自社の返金ポリシーのエッジケースについては何も予測してくれない。敵対的テストと同じ発想であり、エージェントを評価することがデモを信じるより優れている理由もそこにある。
  3. 92%のタスクではなく、32%のタスクを前提に設計する。 エージェントがどの作業を拒否すべきかを把握する。確信度のしきい値を意図的に設定し、ハンドオフをきれいに保つ。ひとつの自信満々な間違いを防ぐことは、カバレッジの1ポイントよりも価値がある。

最後のポイントがすべてを決める。チケットの60%を解決し、残りをきれいにエスカレーションするエージェントは、100%に挑んで5件に1件は間違えるエージェントよりも優れたプロダクトであり、お客さまも常にそう言っている。誤った回答が生み出す後始まつ的なチケットのコストを織り込めば、解決件数あたりのコストの計算もこちらのほうが有利になる。

計測についてもっと詳しく知りたいなら、カスタマーサービスの評価についての私の記事のほうがここより深く掘っている。エージェントと人間のコスト比較も同様だ。まだ基盤モデルを選んでいる最中なら、どのLLMがサポートに向いているかのほうが、どんなロボティクスのベンチマークよりも良い出発点になる問い掛けだ。

eeselを試す

エージェント型カスタマーサービスソフトウェアを探していて、この記事が何度も主張してきたようなタスク別の正直さを求めているなら、eeselはまさにそれを提供するために作られたものだ。Zendeskや、すでに使っているどのヘルプデスクにもプラグインでき、Freshdeskも含まれる。マクロと過去のチケットから学習する。そして実際の履歴に対してシミュレーションを実行するので、顧客に返信する前に、チケットタイプ別の精度の形を見ることができる。

Zendeskエージェント向けのeeselレポート画面。30日間のタスク量、種類別のトリガーイベント、ツールごとの承認・却下件数を表示している
Zendeskエージェント向けのeeselレポート画面。30日間のタスク量、種類別のトリガーイベント、ツールごとの承認・却下件数を表示している

具体的な違いはこうだ。どのチケットタイプに触れさせ、どれには触れさせないかを自分で決められ、単一のデフレクション率ではなく、アクションごとの承認・却下件数が見られる。Gridwiseは最初の1か月で一次対応リクエストの73%を解決し、残りの27%が何であるかも把握できた。料金はチケット単位なので、キューの一部しか処理しないエージェントのために座席分を買う必要はない。

eeselを試す、無料で。あるいは、古いチケットを100件だけ渡して、ギャップレポートが何と言うか見てみるのもいい。

よくある質問

Gemini Robotics 2とは何か?
Gemini Robotics 2は、2026年7月30日に発表されたGoogle DeepMindのロボティクス向けモデルファミリーだ。単一モデルではなく3つのモデルから構成されている。ロボットのモーターを直接動かすvision-language-actionモデル、タスクを計画するGemini Robotics ER 2という身体性推論モデル、そしてローカルで動作するオンデバイス版だ。一般に公開されているのはER 2のみ。テキスト側ではGemini 3.6 FlashGemini 3.5 Proと同じ系譜に位置する。
Gemini Robotics 2の料金はいくらか?
価格が公開されているのは推論モデルのみだ。gemini-robotics-er-2-previewは入力100万トークンあたり2.00ドル、出力100万トークンあたり10.00ドルで、バッチ利用時はその半額になる。これはER 1.6の2倍の料金だ。モーターを動かすvision-language-actionモデルとオンデバイスモデルはウェイトリスト限定のため、価格は一切公開されていない。成果に対してAI予算を組みたいなら、解決件数あたりのコストという考え方のほうが役に立つ。
Gemini Robotics 2の実タスクでの成功率はどれくらいか?
DeepMindは11個のタスク別数値を公開した。最も高いのは電球を外す作業の92%と、精密な差し込み作業の89.6%。最も低いのはちりとりで掃く作業の32%と、電球を取り付け直す作業の36%だ。床から物を拾う作業は45.7%。DeepMind自身もグラフの注記で、多指を使った巧緻な操作は依然として難しいと述べている。こうしたタスク別の開示こそ、AIの性能指標のあるべき姿だ。
ロボットなしでGemini Robotics 2を使うことはできるか?
部分的には可能だ。Gemini Robotics ER 2はテキスト・画像・動画・音声を入力し、テキストを出力するビジョン言語モデルなので、Google AI Studioで画像を渡すだけで、ハードウェアなしに物体の座標やタスクプランを取得できる。実際にモーターを動かすモデルのほうは手に入らない。物理作業以外の用途では、ロボティクス向けの調整よりも適切なLLMを選ぶことのほうが重要になる。
Gemini Robotics 2は人の近くで安全に使えるのか?
Googleの公式ドキュメントは、その責任を利用者側に置いている。ロボット周辺の安全な環境を維持するのは利用者の責任だ、としている。ER 2は安全指示への追従率が97.9%で、ER 1.6の47.2%から大きく向上している。また、周囲にいる人からの同意取得と顔のブラー処理を求めるロボティクス向けのプライバシー通知もある。同じ考え方はソフトウェアにも当てはまり、エージェントを本番投入する前に確信度のしきい値きちんとしたハンドオフのルールが重要になる理由もそこにある。
Gemini Robotics 2はFigureやPhysical Intelligenceと比べてどうか?
開示の姿勢では大きな差がある。FigureのHelix 02のページには成功率がまったく公開されておらず、Teslaは Optimusのモデル名を一度も明かしていない。UnitreeはUnifoLM-VLA-0をオープンソースで公開しているが、評価データは何も付いていない。Physical Intelligenceはタスク別の数値をグラフ化しているものの、ベースラインとの比較のみで、値はクライアント側でレンダリングされている。自社の実際のタスク別失敗率を公開しているのはDeepMindだけだ。合わせて私がまとめたGemini代替ツールの一覧も参考にしてほしい。
Gemini Robotics ER 1.6はどうなったのか?
廃止される予定だ。Googleの廃止予定ページにはgemini-robotics-er-1.6-previewが2026年4月14日にリリースされ、2026年8月31日に停止されると記載されており、後継としてER 2が推奨されている。ER 1.5はすでに4月に引退済みだ。移行はモデル文字列を書き換えるだけで済む。1年の間に2つのエンドポイントが引退したという事実は、新しいリリースを信頼する前に敵対的テストを検討するのと同じくらい、ロードマップに織り込む価値がある。
Gemini Robotics 2はカスタマーサポート向けAIにとって何を意味するのか?
そこから汲み取れる教訓はロボットではなく計測の仕方だ。DeepMindはタスクごとに成功率を報告しているため、同じモデルの中に92%と32%が同時に存在することが分かる。一方、多くのサポートAIベンダーは、混ぜ合わせた単一のデフレクション数値しか報告しない。単一の数値ではなく、インテント別の内訳を求めるべきだし、まずは自社の履歴でテストすべきだ。これはまさに、公開前にシミュレーションできるエージェント型カスタマーサービスソフトウェアの考え方であり、一次対応のデフレクションを謳うマーケティング上の単一数値を信じるより確実だ。

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Googleブルーの背景に浮かぶGemini 3.5 Flash-Liteのヒーローバナー
Trending

Gemini 3.5 Flash-Liteとは?価格と向いている用途を解説

Gemini 3.5 Flash-Liteは、Googleの最速・最安の3.5系モデルで、100万トークンあたり$0.30/$2.50です。その正体、料金、使うべき場面を解説します。

Rama Adi NugrahaRama Adi NugrahaJul 22, 2026
Google Blueの背景にあるGemini 3.6 Flash料金のヒーローバナー
Trending

Gemini 3.6 Flashの料金:2026年の全コスト内訳

Gemini 3.6 Flashは入力$1.50、出力$7.50(100万トークンあたり)。料金表の全体、見えにくいコスト、実際の運用コストを解説します。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Googleブルーの背景に浮かぶGemini 3.6 Flashのヒーローバナー
Trending

Gemini 3.6 Flashとは?できること・料金・向いている人を解説

Gemini 3.6 FlashはGoogleの新しい主力モデルです。出力トークンが17%減り、出力コストも下がり、コンテキストウィンドウは100万トークン。その正体と、どんな人に向いているかを解説します。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Gemini 3.5 Flash Cyber hero banner on a Google-blue background
Trending

Gemini 3.5 Flash Cyberとは何か、誰が使えるのか

Gemini 3.5 Flash Cyberは、コードの脆弱性を発見して修正するためのGoogleのセキュリティモデルだ。何をするのか、CodeMenderがどう使っているのか、そしてなぜまだほとんどの人が触れないのかを解説する。

Alicia Kirana UtomoAlicia Kirana UtomoJul 22, 2026
Gemini 3.5 Flash-Liteの料金を紹介するGoogleブルーの背景のヒーローバナー
Trending

Gemini 3.5 Flash-Liteの料金:費用と向いている用途

Gemini 3.5 Flash-LiteはGoogleの最も安価なモデルで、100万トークンあたり$0.30/$2.50。料金表全体、実際のコスト例、向いている用途を解説する。

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 22, 2026
Tasklet AIレビュー2026のヒーローバナー
Trending

Tasklet AIレビュー2026:エージェントプラットフォームは価値があるか?

2026年版Tasklet AIの実践レビュー:このAIエージェントプラットフォームが実際に何をするのか、クレジット制の料金が実際のワークロードでどう振る舞うのか、強みと弱みはどこかを解説する。

Alicia Kirana UtomoAlicia Kirana UtomoJul 17, 2026
整然とした小型モデルのコアと、はるかに大きく絡み合ったコアを比較するイラスト。Inkling-Small のレビュー用
Trending

Inkling-Smallレビュー:サイズは4分の1、賢さはほぼそのまま

実際に試したInkling-Smallレビュー:サイズと価格が4分の1でありながら、コーディングでは975Bの親モデルを上回る。ただし事実性は崖から落ちるように急落する。このトレードオフが実際に何を意味するのかを解説する。

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
画像、動画、音声のパネルを1つのモデルが生成する様子を描いたイラスト。Black Forest Labs の FLUX 3 を表現
Trending

FLUX 3:Black Forest Labsが実際にリリースしたもの

FLUX 3は画像・動画・音声・ロボット動作を1つのモデルで生成する。だがAPIも価格もオープンウェイトもまだない。今得られるものと得られないものを整理した。

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
画像、動画、文書のパネルがビジョン言語モデルに入力される様子を描いたイラスト、Qwenのロゴ付き
Trending

Qwen 3.7 Flash: スペック、価格、そして実際にできること

Qwen 3.7 Flashはブログ記事もベンチマークも重みの公開もないまま登場した。ここでは完全なスペックシート、段階的な料金、そしてQwenが決して主張しなかったことをまとめる。

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026

AIチームメイトを採用する準備はできましたか?

数分でセットアップ。クレジットカード不要。

無料で始める