EyeRobot 2.0:能動的な注視で手首カメラなしの精密操作を実現

Published · AI Daily — AI-assisted deep research, methodology & disclosure

EyeRobot 2.0 は1組のステレオカメラだけで、人間のように2つの目の視点を3次元の注視点へ向けます。画像中心により多くの視覚トークンを割り当て、階層的な強化学習で視線を制御し、グリッパー動作は注視相対のSE(3)座標系で表します。受動ステレオでは実機成功率が52%から27%に落ちますが、本手法はそれを40%上回ります。手首視界が良好なら頭部+手首方式と並び(69%対64%)、物体が手首カメラを遮るときは2倍超(48%対22%)です。

研究の背景:ロボットはなぜ「どこを見るか」を決める必要があるのか

双腕による精密操作では、視覚入力の与え方が政策(ポリシー)の上限を決めます。一般的な構成は、頭部(エゴ)カメラに加えて、両手首にカメラを付けるものです。手首カメラはグリッパーに近く、把持や挿入の細部を捉えられます。しかし代償もあります。追加のハードウェア、配線、キャリブレーションが必要です。さらに、把持した物体が手首カメラの視界を遮るという厄介な問題があります。

EyeRobot 2.0 は別の道を選びました。人間の視覚に着想を得て、1組のステレオカメラだけを使い、人間のように場面内の3次元の1点を「注視」させます。論文はこの仕組みを能動的視覚注視(Active Visual Fixation、AVF)と呼びます。狙いは明快です。カメラを増やして全方向を覆うのではなく、1組のカメラをその時点で最も重要な場所へ向けます。

中核アーキテクチャ:連携する3つの要素

物理的な注視。 システムは3次元の注視点を選び、左右2つの「目」の視点を回転させて、両者の視線をその点に集中させます。画像の切り出しではなく、実際の機械的な回転です。

中心窩(フォベア)型の処理。 画像をネットワークに入力する際、画像の中心部により多くの視覚トークンを割り当て、周辺部には少なく割り当てます。人間の中心窩が中央で高解像度、周辺で低解像度であることに似ています。計算資源はタスクに関係する特徴に集中します。

階層的な視線制御。 視線は勝手に動かせません。タスクの進行と歩調を合わせる必要があります。論文は2段構成を採ります。下位は、目標物体を条件とする視線サーボ政策で、視線をその物体へ向けます。上位はターゲットセレクタで、タスクの進捗に応じて次の注視目標を出力します。

学習方法:両モジュールとも実世界データで強化学習

視線サーボ政策は、密な幾何学的報酬を用いた強化学習で訓練されます。報酬は視線と目標の幾何学的な整合度を直接測ります。信号が密なので、実機での学習に向いています。

より興味深いのは上位のターゲットセレクタです。これは行動模倣(BC)のグリッパー政策と共同で訓練されます。「どこを見るべきか」という人手のラベルはありません。セレクタはグリッパー政策と一緒に最適化される中で、注視の系列を自ら発見します。著者らは、この系列が人間が同じ作業をするときの注視系列に似ることがあると報告しています。注視行動が、タスク成功という目標だけから自然に現れ得ることを示唆します。

行動表現:注視相対のSE(3)座標系

EyeRobot 2.0 は、注視点を使って行動学習も簡単にします。グリッパー情報を、注視相対のSE(3)座標系へ正規化します。グリッパーの姿勢はロボット基部ではなく、現在の注視点を基準に表されます。

これにより、学習すべき行動分布が小さくなります。位置と向きの変動範囲が狭まり、政策が当てはめやすくなります。規模が限られる実機の遠隔操作データでは、この圧縮に価値があります。

実験設計と主な結果

著者らは、実世界7タスクとシミュレーション6タスクの遠隔操作データを収集し、1000回超の実機試行と1800回のシミュレーション試行を行いました。比較対象は、同じデータで訓練した受動ステレオ政策と、エゴ+手首カメラ政策です。 主な結果は次のとおりです。 - 手首カメラを外すと、標準的な政策では大きな損失が出ます。受動ステレオのみでは、実機の成功率が52%から27%に落ちます。

  • EyeRobot 2.0 はステレオのみでこの差を埋めます。受動ステレオに対して、実機で40%、シミュレーションで20%上回ります。
  • 手首の視界が良好なときは、エゴ+手首政策と並びます。成功率は69%対64%です。
  • 把持物体が手首カメラを遮るときは、48%に対してエゴ+手首政策は22%で、2倍以上の差が出ます。

最後の結果が最も示唆的です。遮蔽時の手首カメラの失敗は物理的な限界です。能動注視カメラは物体の外側にあり、適切な角度から接触領域を見続けられます。

コストと遅延のトレードオフ

ハードウェアの面では、手首カメラをなくし、ステレオ1組だけを残します。代わりに、2つの視点を回転させる機構が加わります。カメラの数を機械的な自由度と交換する形です。

計算の面では、中心窩型のトークン割り当てが画像中心に計算を集中させ、周辺にかかるコストを原理的に減らします。ただし、要旨には遅延や計算量の数値がないため、これらの利点は全文のデータで確認する必要があります。また、視線サーボはタスク中ずっと動き続ける必要があり、制御ループの複雑さが増します。

開発者と産業への意味

ロボット開発チームにとって、この研究はセンサー構成を簡素化する現実的な案です。手首カメラの配線、校正、保守、遮蔽は、量産や長期運用では実際のコストです。回転するステレオ1組で同等以上の成功率が得られるなら、部品表は短くなります。

学習手法の面では、「知覚も行動である」ことの価値を示します。視線は受動的な入力ではなく、学習し最適化できる意思決定になります。注視相対の行動表現は、他の模倣学習の枠組みにも応用できます。

限界と今後

注意すべき点がいくつかあります。第一に、ロボットの頭部に可動する目の機構が必要で、既存のプラットフォームにそのまま載せられるわけではありません。第二に、実世界7タスクは堅実な数ですが、なお研究室規模で、開かれた環境への一般化は検証が必要です。第三に、ターゲットセレクタはBC政策との共同訓練に依存するため、データの質が注視系列の質に影響します。第四に、視線が移る間の一時的な視覚の不安定さをどう扱うかは、全文で確認すべき点です。

今後の方向としては、能動注視と大規模な視覚言語行動モデルの統合、言語指示による注視目標の駆動、より長いタスクや移動操作での検証、より軽量な目の機構の設計が考えられます。全体として、EyeRobot 2.0 は明確な主張をしています。ロボットに「どこを見るか」を教えることは、カメラを増やすことの代わりになり得ます。

Sources