SpatialHarness:用测试时空间脚手架解锁精细机器人操作

Published · AI Daily — AI-assisted deep research, methodology & disclosure

SpatialHarness 在测试时为冻结的多模态策略补充空间脚手架:在线维护与真实执行同步的仿真场景,识别任务关键的空间关系,并渲染互补虚拟视角,无需微调,也不改动传感器。配合区分静止、被持有、过渡三种模式的交互感知同步,同一个 GPT-6 Astra 策略的插头插入成功率由 26.7% 升至 66.7%,汉诺塔由 0% 升至 100%。

近年来,以 GPT-6 Astra 为代表的前沿多模态基础模型已经显示出直接控制机器人的潜力,但一旦任务进入插拔、对位、堆叠这类毫米级的精细操作,成功率就明显下滑。业界的惯常解释是策略能力不足,于是常见的对策是收集更多示教数据、对模型做微调,或者干脆换一个更强的底座。SpatialHarness 这篇论文给出了另一种诊断:失败的重要来源未必是策略不够强,而是空间可观测性不足。完成任务所必需的空间关系,比如插头与插孔是否同轴、圆盘是否已经越过柱子的顶端,在现有物理相机的视角里可能根本看不清,甚至被机械臂和物体自身遮挡。模型再强,看不见的东西也无从推理,这一点在人类操作中同样成立:让一个熟练的技工蒙着半只眼睛去插线,他也会频频失手。

针对这一诊断,作者提出了 SpatialHarness,一个在测试时运行的具身外挂框架。它不对策略做任何微调,也不改动物理传感器的布置,而是在模型与真实世界之间加了一层空间脚手架。具体而言,系统在线维护一个与真实执行同步的仿真场景,从中识别出当前任务的关键空间关系,再渲染若干互补的虚拟视角,把这些视角作为额外观测交给被冻结的多模态策略。真实相机负责提供事实,虚拟相机负责把事实换成模型更容易读懂的角度。这个设计的聪明之处在于,仿真里的相机可以放在物理世界无法安放的位置,例如贴近插孔内侧的特写,或者两个零件间隙的侧视,而且不增加任何硬件成本。对于只能通过接口调用、无法触碰权重的闭源模型,这种不碰模型本身、只改善输入的路线尤其现实。

让仿真场景与现实长期保持一致,是整套方法最难的部分。物体一旦被抓起、移动、放下,位姿估计的误差就会不断累积,虚拟视图只要与现实出现偏差,反而会误导策略,造成比没有额外视角更糟的结果。论文为此提出了交互感知的场景同步,把物体区分为静止、被持有、过渡三种模式。从摘要给出的信息可以理解为:物体静止时,可以信任感知结果并保持场景稳定;物体被夹爪持有时,它与末端执行器的相对关系大体固定,更新应当跟随机械臂的运动;而在抓取与释放这类过渡时刻,状态正在发生变化,需要以更谨慎的方式重新对齐。至于每种模式下具体采用什么估计与校正算法,需要以论文正文为准。但这一思路本身值得借鉴:把任务所处的交互阶段当作先验,用它来决定当下应该信任哪一种信息来源,而不是用一套统一的跟踪逻辑应付所有时刻。

实验部分覆盖四项真实机器人任务,涉及精确几何对齐、物体相对放置和铰接物体交互三类难点。在使用同一个冻结的 GPT-6 Astra 策略的前提下,SpatialHarness 显著提升了任务成功率:插头插入从 26.7% 升至 66.7%,汉诺塔从 0% 升至 100%。这两个数字的含义并不相同。汉诺塔从零到满分,说明该任务的瓶颈几乎完全在于看不看得清圆盘与柱子之间的相对位置,一旦这些关系被清楚地呈现,模型原有的推理与规划能力就足以完成任务。插头插入则更接近真实工业场景的难度,成功率翻了一倍多,但仍有大约三分之一的尝试失败,说明空间可观测性只是瓶颈之一,力控与接触处理等因素依然存在。同时需要冷静看待的是,实验只有四项任务,各任务的试验次数与失败模式的细分,需要读者在论文与项目网站上进一步核对。

这项工作的更大意义在于对能力来源的重新归因。过去几年,机器人学习的主流叙事是把模型训得更大、把数据收得更多。SpatialHarness 提醒我们,强模型身上可能已经具备相当一部分精细操作能力,只是被糟糕的观测条件封印了。测试时增强不需要重新训练,可以叠加在任何冻结的底座之上,部署成本相对低,也便于随底座升级而复用。当然,它也有明显的边界:方法依赖仿真场景的建模质量,需要物体模型与可靠的位姿估计;对可变形物体、未知物体是否适用,摘要并未涉及;在线渲染带来的延迟与算力开销也没有披露。对行业而言,这篇论文把一个工程层次推到了台前,即围绕冻结模型构建的 harness 层。当基础模型的能力趋于同质化,决定真机表现的,可能越来越是谁能为模型提供更好的观察世界的方式。对从业者来说,一个直接的启示是:在为机器人选型和排障时,不妨先问一句,模型究竟看到了什么,再问它为什么没做对。很多团队习惯在策略与数据上反复加码,却很少系统地审视相机位置、遮挡与视角这些前端因素。如果空间可观测性确实是瓶颈,那么花在观测设计上的力气,往往比花在模型训练上的力气回报更快,也更容易被复现和验证。

Sources

FAQ

SpatialHarness 解决的核心问题是什么?

它认为前沿多模态模型在精细操作上失败,重要原因未必是策略能力不足,而是任务关键的空间关系在现有相机视角中看不清。它在测试时补充虚拟视角,让冻结的策略看清这些关系,无需微调,也不改动物理传感器。

交互感知场景同步为什么要区分静止、被持有和过渡三种模式?

物体被抓取、移动、释放时,仿真场景若与现实偏离,虚拟视图会误导策略。区分三种模式,可以按交互阶段决定该信任哪种信息来源并更新场景。各模式的具体算法请以论文正文为准。

实验结果能说明什么,又有哪些局限?

在四项真机任务上,同一个冻结的 GPT-6 Astra 策略的插头插入由 26.7% 升至 66.7%,汉诺塔由 0% 升至 100%,说明提升空间可观测性能释放已有能力。局限是任务数量有限,方法依赖仿真建模质量,延迟与算力成本摘要未披露。