EyeRobot 2.0:主動注視讓雙臂機器人擺脫腕部相機

Published · AI Daily — AI-assisted deep research, methodology & disclosure

EyeRobot 2.0 只用一對立體相機,讓機器人像人一樣把兩隻“眼睛”轉向三維注視點,並把更多視覺 token 分給影象中心。分層強化學習負責注視控制,夾爪動作則表示在注視相對的 SE(3) 座標系中。真機上,被動立體的成功率從 52% 降到 27%,而該方法比它高 40%。手腕視野清晰時它與頭部加腕部方案相當(69% 對 64%),物體遮擋腕部相機時則超過兩倍(48% 對 22%)。

研究背景:機器人為什麼需要“看哪裡”

在雙臂精細操作任務中,視覺輸入的組織方式直接決定策略的上限。主流方案通常給機器人配一個頭部(ego)相機,再在每隻手腕上加裝腕部相機。腕部相機離夾爪近,能看清抓取與插入的細節。但它也有明顯的代價:額外的硬體、線纜與標定,以及一個更棘手的問題,即被抓取的物體常常會擋住腕部視野。

EyeRobot 2.0 提出了另一條路。它受人類視覺啟發,只用一對立體相機,讓機器人像人一樣“注視”場景中的某個三維點。論文把這一機制稱為主動視覺注視(Active Visual Fixation,AVF)。核心判斷是:與其用更多相機覆蓋所有視角,不如讓一對相機始終對準當前最重要的位置。

核心架構:三個相互配合的部件

第一,物理注視。 系統在場景中選取一個三維注視點,然後轉動左右兩個“眼睛”視點,使兩者的視線匯聚到該點上。這是真實的機械轉動,而不是對影象做裁剪。

第二,中央凹式(foveal)處理。 影象送入網路時,系統給影象中心區域分配更多視覺 token,給周邊分配較少。這與人眼中央凹高解析度、周邊低解析度的結構類似。計算資源因此集中在與任務相關的特徵上。

第三,分層的注視控制。 注視不能隨意移動,它必須與任務進度協調。論文采用兩級結構:底層是一個注視伺服(gaze servoing)策略,以“目標物體”為條件,負責把視線對準它;上層是一個目標選擇器(target selector),根據任務進度輸出下一個注視目標。

訓練方式:兩個模組都用真實資料上的強化學習

底層伺服策略使用稠密的幾何獎勵進行強化學習訓練。獎勵直接衡量視線與目標的幾何對齊程度,訊號密集,適合在真機上學習。

上層目標選擇器的訓練更有意思。它與行為克隆(BC)的夾爪策略共同訓練。選擇器沒有人工標註的“該看哪裡”,而是在與夾爪策略協同最佳化的過程中自己發現注視序列。論文指出,這些序列可以與人類執行同一任務時的注視序列相似。這說明,注視行為可以從任務成功這一目標中自然湧現。

動作表示:注視相對的 SE(3) 座標系

EyeRobot 2.0 還利用注視點簡化了動作學習。系統把夾爪資訊規範化到一個“注視相對”的 SE(3) 座標系中。夾爪的位姿不再相對於機器人基座,而是相對於當前注視點。

這樣做的好處是縮小了需要學習的動作分佈。位置與朝向的變化範圍變窄,策略更容易擬合。對於資料量有限的真機遙運算元據集,這種壓縮尤其有價值。

實驗設計與關鍵結果

作者採集了 7 個真實任務和 6 個模擬任務的遙運算元據,並進行了超過 1000 次真機試驗和 1800 次模擬試驗。對照組是在同樣資料上訓練的被動立體相機策略,以及“頭部相機加腕部相機”策略。 主要結果如下: - 去掉腕部相機代價很大。標準策略只用被動立體相機時,真機成功率從 52% 降到 27%。

  • EyeRobot 2.0 只用立體相機,就把這一差距補了回來。它在真機上比被動立體高出 40%,在模擬中高出 20%。
  • 在腕部視野清晰時,它與頭部加腕部策略基本持平,成功率為 69% 對 64%。
  • 在被抓取物體遮擋腕部相機時,它的成功率為 48%,而頭部加腕部策略只有 22%,超過兩倍。

最後一項最能說明問題。腕部相機在遮擋場景下的失效,是物理上的限制。主動注視的相機位於物體之外,可以從合適的角度持續觀察接觸區域。

成本與延遲的權衡

從硬體角度看,系統去掉了腕部相機,只保留一對立體相機,但需要增加讓兩個視點轉動的機構。這是用機械自由度換取相機數量。

從計算角度看,中央凹式 token 分配把算力集中到影象中心,理論上能降低對周邊區域的開銷。論文摘要沒有給出延遲與算力的具體數字,因此這些收益需要以全文資料為準。另一方面,注視伺服需要在任務執行期間持續執行,這增加了控制迴路的複雜度。

對開發者與產業的意義

對機器人團隊而言,這項工作提供了一個可行的感測器簡化思路。腕部相機的線纜、標定、維護和遮擋問題,在量產和長期部署中都是真實的成本。如果一對可轉動的立體相機能達到同等甚至更好的成功率,硬體清單會更短。

對學習方法而言,這篇論文展示了“感知也是動作”的價值。注視不再是被動的輸入,而是一個可以被學習和最佳化的決策。同時,注視相對的動作表示可以被其他模仿學習框架借鑑。

侷限與未來方向

需要謹慎的地方有幾點。第一,機器人頭部需要可轉動的眼部機構,這對現有平臺不是即插即用的。第二,實驗任務雖有 7 個真實任務,但規模仍屬實驗室級別,向開放環境泛化還需驗證。第三,目標選擇器依賴與 BC 策略的聯合訓練,資料質量會影響注視序列的質量。第四,注視點切換期間的短暫視覺不穩定如何處理,需要看全文細節。

未來方向包括:把主動注視與大型視覺語言動作模型結合,讓注視目標由語言指令驅動;在更復雜的長程任務和移動操作中驗證;以及探索眼部機構的輕量化設計。總體來看,EyeRobot 2.0 提出了一個清晰的論點:讓機器人學會“看哪裡”,可以替代“多裝幾個相機”。

Sources