SpatialHarness:用測試時空間腳手架解鎖精細機器人操作
SpatialHarness 在測試時為凍結的多模態策略補充空間腳手架:線上維護與真實執行同步的模擬場景,識別任務關鍵的空間關係,並渲染互補虛擬視角,無需微調,也不改動感測器。配合區分靜止、被持有、過渡三種模式的互動感知同步,同一個 GPT-6 Astra 策略的插頭插入成功率由 26.7% 升至 66.7%,漢諾塔由 0% 升至 100%。
近年來,以 GPT-6 Astra 為代表的前沿多模態基礎模型已經顯示出直接控制機器人的潛力,但一旦任務進入插拔、對位、堆疊這類毫米級的精細操作,成功率就明顯下滑。業界的慣常解釋是策略能力不足,於是常見的對策是收集更多示教資料、對模型做微調,或者乾脆換一個更強的底座。SpatialHarness 這篇論文給出了另一種診斷:失敗的重要來源未必是策略不夠強,而是空間可觀測性不足。完成任務所必需的空間關係,比如插頭與插孔是否同軸、圓盤是否已經越過柱子的頂端,在現有物理相機的視角里可能根本看不清,甚至被機械臂和物體自身遮擋。模型再強,看不見的東西也無從推理,這一點在人類操作中同樣成立:讓一個熟練的技工蒙著半隻眼睛去插線,他也會頻頻失手。
針對這一診斷,作者提出了 SpatialHarness,一個在測試時執行的具身外掛框架。它不對策略做任何微調,也不改動物理感測器的佈置,而是在模型與真實世界之間加了一層空間腳手架。具體而言,系統線上維護一個與真實執行同步的模擬場景,從中識別出當前任務的關鍵空間關係,再渲染若干互補的虛擬視角,把這些視角作為額外觀測交給被凍結的多模態策略。真實相機負責提供事實,虛擬相機負責把事實換成模型更容易讀懂的角度。這個設計的聰明之處在於,模擬裡的相機可以放在物理世界無法安放的位置,例如貼近插孔內側的特寫,或者兩個零件間隙的側視,而且不增加任何硬體成本。對於只能透過介面呼叫、無法觸碰權重的閉源模型,這種不碰模型本身、只改善輸入的路線尤其現實。
讓模擬場景與現實長期保持一致,是整套方法最難的部分。物體一旦被抓起、移動、放下,位姿估計的誤差就會不斷累積,虛擬檢視只要與現實出現偏差,反而會誤導策略,造成比沒有額外視角更糟的結果。論文為此提出了互動感知的場景同步,把物體區分為靜止、被持有、過渡三種模式。從摘要給出的資訊可以理解為:物體靜止時,可以信任感知結果並保持場景穩定;物體被夾爪持有時,它與末端執行器的相對關係大體固定,更新應當跟隨機械臂的運動;而在抓取與釋放這類過渡時刻,狀態正在發生變化,需要以更謹慎的方式重新對齊。至於每種模式下具體採用什麼估計與校正演算法,需要以論文正文為準。但這一思路本身值得借鑑:把任務所處的互動階段當作先驗,用它來決定當下應該信任哪一種資訊來源,而不是用一套統一的跟蹤邏輯應付所有時刻。
實驗部分覆蓋四項真實機器人任務,涉及精確幾何對齊、物體相對放置和鉸接物體互動三類難點。在使用同一個凍結的 GPT-6 Astra 策略的前提下,SpatialHarness 顯著提升了任務成功率:插頭插入從 26.7% 升至 66.7%,漢諾塔從 0% 升至 100%。這兩個數字的含義並不相同。漢諾塔從零到滿分,說明該任務的瓶頸幾乎完全在於看不看得清圓盤與柱子之間的相對位置,一旦這些關係被清楚地呈現,模型原有的推理與規劃能力就足以完成任務。插頭插入則更接近真實工業場景的難度,成功率翻了一倍多,但仍有大約三分之一的嘗試失敗,說明空間可觀測性只是瓶頸之一,力控與接觸處理等因素依然存在。同時需要冷靜看待的是,實驗只有四項任務,各任務的試驗次數與失敗模式的細分,需要讀者在論文與專案網站上進一步核對。
這項工作的更大意義在於對能力來源的重新歸因。過去幾年,機器人學習的主流敘事是把模型訓得更大、把資料收得更多。SpatialHarness 提醒我們,強模型身上可能已經具備相當一部分精細操作能力,只是被糟糕的觀測條件封印了。測試時增強不需要重新訓練,可以疊加在任何凍結的底座之上,部署成本相對低,也便於隨底座升級而複用。當然,它也有明顯的邊界:方法依賴模擬場景的建模質量,需要物體模型與可靠的位姿估計;對可變形物體、未知物體是否適用,摘要並未涉及;線上渲染帶來的延遲與算力開銷也沒有披露。對行業而言,這篇論文把一個工程層次推到了臺前,即圍繞凍結模型構建的 harness 層。當基礎模型的能力趨於同質化,決定真機表現的,可能越來越是誰能為模型提供更好的觀察世界的方式。對從業者來說,一個直接的啟示是:在為機器人選型和排障時,不妨先問一句,模型究竟看到了什麼,再問它為什麼沒做對。很多團隊習慣在策略與資料上反覆加碼,卻很少系統地審視相機位置、遮擋與視角這些前端因素。如果空間可觀測性確實是瓶頸,那麼花在觀測設計上的力氣,往往比花在模型訓練上的力氣回報更快,也更容易被複現和驗證。
Sources
FAQ
SpatialHarness 解決的核心問題是什麼?
它認為前沿多模態模型在精細操作上失敗,重要原因未必是策略能力不足,而是任務關鍵的空間關係在現有相機視角中看不清。它在測試時補充虛擬視角,讓凍結的策略看清這些關係,無需微調,也不改動物理感測器。
互動感知場景同步為什麼要區分靜止、被持有和過渡三種模式?
物體被抓取、移動、釋放時,模擬場景若與現實偏離,虛擬檢視會誤導策略。區分三種模式,可以按互動階段決定該信任哪種資訊來源並更新場景。各模式的具體演算法請以論文正文為準。
實驗結果能說明什麼,又有哪些侷限?
在四項真機任務上,同一個凍結的 GPT-6 Astra 策略的插頭插入由 26.7% 升至 66.7%,漢諾塔由 0% 升至 100%,說明提升空間可觀測效能釋放已有能力。侷限是任務數量有限,方法依賴模擬建模質量,延遲與算力成本摘要未披露。