DeepMindがGemini Robotics 2を発表:全身ダイナミクス知能で具身制御を革新

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Google DeepMindは、次世代の身体性AI基底モデル「Gemini Robotics 2(GR-2)」を発表しました。高レベルのマルチモーダル視覚・言語・行動(VLA)推論と、低レベルの全身動的トルク制御を初めてエンドツーエンドで統合。人型ロボットや双腕移動マニピュレータが、個別タスクの追加学習を行うことなく、乱雑で動的な現実環境において極めて滑らかで継続的な複合タスクを自律遂行できるようになります。

背景と技術的概要

具身知能(Embodied AI)の実用化において、長年にわたり最大の障壁となってきたのは「認知と運動制御の断絶」でした。従来の手法では、マルチモーダル大規模言語モデルが高レベルのタスク計画を低周波(1〜5Hz)で生成し、現場のロボットハードウェアはバランス制御や接触力制御のために別系統の古典的動力学コントローラを100Hz以上の高周波で動かすという分断構造が一般的でした。この構造は、環境のわずかな物理的変化に対して極めて脆弱であり、少しの接触や障害物によって動作が破綻し、タスクごとに膨大な遠隔操作データの収集と個別ファインチューニングを必要としていました。この根本的課題を打破すべく、Google DeepMindは新世代の具身知能基底モデル「Gemini Robotics 2(GR-2)」を発表しました。

GR-2は、高次元の視覚・言語理解から低レベルの全身動的トルク制御までを単一のニューラル表現空間で統合した画期的なシステムです。人型二足歩行ロボットや双腕移動型ロボットにおいて、個別のタスク再学習を行うことなく、未知の散らかった環境下で数十ステップに及ぶ複雑で連続的な物理動作を極めて滑らかに遂行できる「全身フィジカル知能」を実現しました。

アーキテクチャと詳細分析

GR-2の技術的核心は、階層的潜在ストリーミング・アーキテクチャ(Hierarchical Latent Streaming Architecture)にあります。認知層では、Gemini 2.5ベースの空間幾何ビジョンモデルが10Hzの周期でシーン全体を把握し、物体の把持可能領域や長期的な行動目標をエンコードした「潜在物理意図トークン」をストリーミング生成します。ここには幾何学的な軌道情報だけでなく、予測される接触力や摩擦制約も暗黙的に含まれています。

この意図トークンは、200Hz以上で駆動する超高速アクション・ディフュージョン・デコーダへとリアルタイムに渡されます。デコーダは、関節エンコーダや足底の6軸力覚センサ、IMU(慣性計測装置)から得られる高速な固有受容感覚(プロプリオセプション)データと認知情報をミリ秒単位で融合し、各関節のアクチュエータに対する直接的な目標トルク値とインピーダンスゲインを算出します。位置制御ではなく連続的なトルク制御を直接行うことで、ロボットは生物の筋肉のように柔軟に接触衝撃を受け流し、滑らかで力強い全身協調動作を維持します。

モデルの学習には、多種多様なロボットから収集された実機操作ログに加え、物理シミュレータ上での大規模な分散強化学習が活用されました。滑りやすい床面、重心の突然の変化、予測不能な外力といった無数の物理的摂動をシミュレーション内で経験させることで、GR-2は人間の小脳のような反射的バランシングと適応力を身につけました。

業界への影響と実務革新

Gemini Robotics 2の登場は、産業用オートメーションとサービスロボットの境界を再定義します。これまで製造ラインにロボットを1台導入するためには、厳密に設計された治具と専任エンジニアによる数週間のプログラミングが必要でした。しかしGR-2を搭載したロボットは、自然言語による曖昧な指示を受けるだけで、形状や重さの異なる荷物を識別し、全身の姿勢を巧みに調整しながら自動で仕分けや運搬をこなします。

人間と協働する環境における本質的な安全性も飛躍的に向上しました。全身トルク制御により、ロボットは作業中に人間や障害物とわずかに接触した瞬間に微小な反力を検知し、瞬時に力を抜いてバランスを取り直すことができます。この柔構造的な制御により、硬直した衝突による人身事故のリスクが劇的に低減し、医療現場や介護施設、家庭内への導入ハードルが一気に下がりました。

今後の課題と展望

一方で、汎用ロボットの社会実装に向けては、依然としていくつかの工学的課題が残されています。200Hzという超高速ループで大規模なニューラルネットワークを推論し続けることは、バッテリー駆動のロボットにとって熱設計および電力消費の観点で極めて大きな負担となります。今後はエッジNPUに最適化された軽量化アーキテクチャの開発が不可欠です。

さらに、布のような柔軟素材の折りたたみや、液体を扱うような複雑な変形物体の操作においては、視覚情報だけでなく指先における高密度な触覚センシングとの緊密な統合が求められます。DeepMindは今後、触覚フィードバックをネイティブに統合した次世代アーキテクチャの開発を推進する方針を示しており、真の汎用物理知能の実現に向けた挑戦が加速しています。

Sources

FAQ

Gemini Robotics 2の最大の技術革新は何ですか?

視覚言語行動モデルの認知推論と200Hz以上の全身動的トルク制御を統合し、タスク個別学習なしで流暢な連続動作を実現した点です。

全身トルク制御はロボットにどのような利点を与えますか?

生物の筋肉のような柔軟なコンプライアンスを実現し、予期せぬ物理的接触や衝撃を滑らかに吸収して自律的にバランスを保持できます。

汎用的な社会実装に向けた今後の課題は何ですか?

超高周波推論に伴う車載プロセッサの消費電力と発熱の抑制、および変形物を精緻に扱うための指先触覚センシングの統合が課題です。