Gemini Robotics ER 2 登場:映像理解・タスク統括・マルチロボット協調でロボットの「高次の頭脳」へ
Google DeepMind は最高性能の身体性推論モデル Gemini Robotics ER 2 を発表した。ロボットの高次の頭脳として人との対話、物理世界の理解、複数ステップの計画を担い、モーター制御は下位の VLA モデルへ委ねる。連続映像で進捗を追い、失敗から立て直し、マルチロボット協調にも初対応した。Gemini API と Google AI Studio で提供中で、企業向けはプライベートプレビュー。
Google DeepMind は、同社で最も高性能な「身体性推論(embodied reasoning)」モデルとして Gemini Robotics ER 2 を発表した。公式ブログの署名は Steven Hansen 氏と Peng Xu 氏で、ページの日付は 2026 年 7 月 30 日である。位置づけは明確で、モーターを直接動かすモデルではなく、ロボットの「高次の頭脳」にあたる。 発表の内容 公式の説明によれば、Gemini Robotics ER 2 はロボットが人と対話し、物理世界を理解し、複数ステップのタスクを計画できるようにする。そのうえで、具体的なモーター制御は任意の下位 VLA(視覚・言語・行動)モデルに引き渡す。Google 検索のようなツールや、ユーザーが定義した関数をネイティブに呼び出すこともできる。前世代の Gemini Robotics ER 1.6 からの大きな改良とされ、柱は三つある。連続した映像の理解、ツールとタスクの統括、そして初めて導入されたマルチロボット協調である。
提供状況としては、Gemini API と Google AI Studio を通じて開発者に一般提供されており、Gemini Enterprise Agent Platform ではプライベートプレビューとなっている。モデルの設定方法や、より実用的な物理 AI タスクを動かすためのプロンプト例も公開されている。 仕組み:上位の推論と下位の制御 日常の環境で人を助けるロボットには、正確な空間推論だけでは足りないと Google は述べる。ロボットは素早く考え、物理世界のリアルタイムな速さに合わせて判断のタイミングを取る必要がある。そのため ER 2 は、現在の動作を実行している間に、次に何をするかを同時に考えられるように設計されている。 開発の手順はエージェント型の構成である。VLA モデルやナビゲーション API といった低レベルの制御インターフェースをツールとして宣言し、マルチモーダルな映像・音声・テキストをモデルへ直接ストリーミングする。ER 2 は、どのツールをどの引数で呼ぶか、見えている状況を踏まえて次に何をするかを決める。これはソフトウェアのエージェントが使う関数呼び出しの考え方と同じだが、ツールが「動いて、つかむ物理システム」である点が異なる。Google は ER 2 が Gemini Live API に統合されているとも述べているが、確認できた原文の抜粋はこの文で途切れており、詳細は公式の完全なドキュメントを参照する必要がある。 この分離には実用上の利点がある。推論モデルと制御ポリシーを独立して改善できる。ロボットメーカーは動作モデルを再学習せずに計画能力を高められ、上位ロジックを書き換えずに下位コントローラーを交換できる。 映像によるフィードバックの閉ループ 従来の「計画してから実行する」流れは、指示を出せば成功すると仮定しがちである。ER 2 は連続した映像フィードを見ることで、ロボットが自分の進捗を追跡し、問題が起きたら調整し、次の工程へ進む正確な時機を把握できるようにする。物体が滑り落ちる、ドアが閉まりきっていない、人が目標を動かした、といったことが起こる物理世界では重要な点だ。結果を見ている上位モデルだけが、こうしたずれに気づいて修正できる。
タスク統括の評価方法 Google によれば、モデルはシミュレーション上のロボット、実世界でのロボット制御、さらに人が遠隔でロボットを操作する構成と組み合わせて評価できる。公式の結論は、実機 VLA、シミュレーション VLA、人間による遠隔操作の 3 つの制御モードすべてで、ER 2 がツール統括において ER 1.6 を一貫して上回るというものだ。正確を期すなら、確認できた抜粋には具体的なベンチマークスコア、遅延、価格は含まれていない。したがって改善幅を数値で判断することはできない。 マルチロボット協調 ER 2 はマルチロボット協調を初めて導入した。ロボットが共有空間で協力し、1 台では実行できない複雑なワークフローを完了させる。原理的には、1 つの上位モデルが仕事を分割し、役割を割り当て、複数のロボットを順番に、あるいは並行して動かせる。倉庫、工場、実験室の自動化では、単体デモから協調する作業セルへの一歩になる。抜粋には協調の仕組みや台数の上限が書かれていないため、開発者自身の検証が必要である。 開発者と企業への意味 開発者にとっては参入のハードルが下がる。Gemini API を通じて、映像を理解しツールを呼べる計画器を、身体性推論の仕組みを一から作らずに使える。企業にとっては、プライベートプレビューが安全性、コンプライアンス、統合コストを管理された条件で評価する機会になる。エコシステム全体では、上位の推論と下位の制御が切り離されることで分業が明確になる。モデル提供者が汎用の頭脳を用意し、ロボットメーカーや VLA の研究者は動作と操作の能力に集中する。
課題と展望 未解決の論点はいくつかある。まず遅延である。クラウド API 経由の上位モデルが、ごく速い反応を要する作業に耐えられるかは実測が必要だ。次に信頼性と安全性である。映像の判断が誤れば、ロボットは誤った前提のまま動き続けるおそれがあり、ハードウェア側の安全制限と人の監督は引き続き不可欠である。さらにコストと規模の問題がある。マルチロボット構成では推論呼び出しが増え、価格とクォータが事業性を左右する。最後に、身体性推論モデルを比較できる公開・再現可能なベンチマークが業界に求められる。 総じて Gemini Robotics ER 2 は、ロボットの計画・監督・協調を呼び出せるサービスとしてまとめた。雑然とした実際の現場でその約束を果たせるかは、独立した評価と初期顧客からの声にかかっている。