DeepMindがGemini Robotics ER 2を発表:リアルタイム空間動画推論によるマルチロボット協調システム

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Google DeepMindは次世代の身体性AI基盤「Gemini Robotics ER 2」を発表しました。ストリーミング3D空間動画推論と階層型マルチエージェント協調オーケストレーションを統合し、二足歩行ヒューマノイドや移動式アームロボットなど構造の異なる複数の異種ロボットが、事前の通信規約やルール定義なしにマルチカメラの視覚情報のみを基に自律的に役割分担を行い、精密な産業機器の組み立てや荷積みを連動して完遂します。

身体性AIにおける協調の壁:単体作業から群ロボット自律統合への飛躍

スマートマニュファクチャリングや次世代物流の現場において、単一ロボットによるピッキングや部品検査の自動化は着実な進展を遂げてきました。しかし、航空機の構造部材の精密締結、大型エンジンの同軸組み立て、あるいは流動的な仕分けラインにおけるパレタイジングなど、製造業の中核をなす高難度タスクの多くは、異なる身体構造を持つ複数のロボットが互いの動作を物理的に同期させながら共同で行う必要があります。従来の産業用マルチロボットシステムは、PLC(プログラマブルロジックコントローラ)を介したミリ秒単位の決定論的同期や、数万行に及ぶ手動スクリプトに全面的に依存していました。ワークの位置がわずか数ミリずれたり、1台の通信にわずかなジッターが生じただけで、システム全体が物理的な衝突や動作停止を引き起こす脆さを抱えていました。

この根深い産業的課題を打破するため、Google DeepMindは身体性AI(Embodied AI)の最前線を切り拓く新世代基盤「Gemini Robotics ER 2(Embodied Reasoning 2)」を正式に発表しました。この技術は、個々のロボットが独立して動作を出力していた従来の時代を終わらせ、統一されたマルチモーダル基盤モデルがリアルタイムで物理空間を把握し、群ロボットの自律協調を導く新たな時代の幕開けを告げています。

技術構造の全貌:ストリーミング3D空間動画推論と階層型オーケストレーション

Gemini Robotics ER 2の中核は、エッジクラスタで稼働する「巨視的空間認識頭脳」と、各ロボットに搭載された「微視的動的サーボ小脳」からなる洗練された2層の階層制御アーキテクチャにあります。

上層の認知レイヤーには、DeepMindが誇る最新のストリーミング動画空間推論エンジンが採用されています。工場の天井に設置された広角カメラ、二足歩行ヒューマノイドの頭部ステレオカメラ、および機械アームの手先カメラから送信される映像ストリームを60Hzの高頻度でリアルタイムに統合処理します。2D画像を断片的に解析する旧来の手法とは一線を画し、ER 2は空間全体を「4D動的シーン幾何グラフ」としてモデル化します。各ロボットの関節自由度、エンドエフェクタの速度ベクトル、周辺の工具や部品の物理的境界が、重力や摩擦係数を考慮した共通の3次元ユークリッド座標系上にリアルタイムでマッピングされます。

下層の協調実行レイヤーにおいて、DeepMindは個別の無線通信メッセージに依存する方式を廃止し、視覚的な振る舞いから相手の意図を汲み取る「視覚的インテント同期」を実現しました。管理者が自然言語で「主構造フレームを治具に固定し、補助アームでボルトを締め付けよ」と指示すると、空間モデルは数ミリ秒で作業を分解し、各ロボットに局所的な動作プリミティブを割り当てます。ロボット同士は複雑なデジタルパケットを交換することなく、相手の物理的な動作やワークの傾きを視覚的に直接知覚することで、自律的にトルクを協調させます。

工場実証テスト:未知環境でのゼロショット組み立てと自己修復

DeepMindが公開した実験データによると、Gemini Robotics ER 2は事前のCADデータが存在しない未知の環境においても驚異的な適応力を示しました。大型トランスミッションケースの組み立て実証では、二足歩行ヒューマノイド1機、全方位移動台車型アーム2機、卓上ロボットアーム1機が協調して作業を完遂しました。

テスト中、研究者がトレイの位置を意図的に動かしたり、特定ロボットの視界を遮ったり、作業中のアームを強く押して軌道を狂わせるなどの過酷な外乱を与えましたが、システムは極めて高い耐障害性を発揮しました。視界を失ったロボットは仲間の動きから対象物の座標を逆算して補正し、外乱を受けたアームは即座に把持力を再計算して作業に復帰しました。物流パレタイジングの実験では、複数ロボットの自律協調によって積載効率が38%向上し、荷崩れ事故は完全にゼロに抑えられました。

製造業の未来と次世代インフラへの影響

Gemini Robotics ER 2の登場は、身体性AIが研究室のデモを脱し、過酷な実運用の製造インフラへと到達したことを証明しています。従来数週間を要していたマルチロボットのティーチングや同期設定作業は、数時間の動画提示や音声対話による指示へと圧縮されます。

空間認識と物理的直感を備えたロボット群が人間の熟練工のように協調して働く未来は、製造業の生産性を劇的に押し上げるだけでなく、危険作業の完全無人化や柔軟なオンデマンド生産体制を支える決定的な基盤となるでしょう。

Sources

FAQ

Gemini Robotics ER 2の革新的点はどこですか?

リアルタイムの空間動画推論と階層的制御を融合し、プログラミング規約なしに異種ロボット同士が視覚のみで自律協調し複雑な組み立てを実現した点です。

事前通信規約なしで複数ロボットはどう協調する?

共有された3次元シーン幾何グラフをもとに高次タスクを分解し、相手の物理的な動きや荷重変化をリアルタイムで視覚認識しながらトルクを即座に調整します。

実工場の多ロボット協調における今後の課題は?

複雑な遮蔽環境での高精度なリアルタイム3D再構成、低遅延ビジュアルサーボの維持、および柔軟物体の把持における動的誤差への適応力向上が課題です。