EyeRobot 2.0:主动注视让双臂机器人摆脱腕部相机
EyeRobot 2.0 只用一对立体相机,让机器人像人一样把两只“眼睛”转向三维注视点,并把更多视觉 token 分给图像中心。分层强化学习负责注视控制,夹爪动作则表示在注视相对的 SE(3) 坐标系中。真机上,被动立体的成功率从 52% 降到 27%,而该方法比它高 40%。手腕视野清晰时它与头部加腕部方案相当(69% 对 64%),物体遮挡腕部相机时则超过两倍(48% 对 22%)。
研究背景:机器人为什么需要“看哪里”
在双臂精细操作任务中,视觉输入的组织方式直接决定策略的上限。主流方案通常给机器人配一个头部(ego)相机,再在每只手腕上加装腕部相机。腕部相机离夹爪近,能看清抓取与插入的细节。但它也有明显的代价:额外的硬件、线缆与标定,以及一个更棘手的问题,即被抓取的物体常常会挡住腕部视野。
EyeRobot 2.0 提出了另一条路。它受人类视觉启发,只用一对立体相机,让机器人像人一样“注视”场景中的某个三维点。论文把这一机制称为主动视觉注视(Active Visual Fixation,AVF)。核心判断是:与其用更多相机覆盖所有视角,不如让一对相机始终对准当前最重要的位置。
核心架构:三个相互配合的部件
第一,物理注视。 系统在场景中选取一个三维注视点,然后转动左右两个“眼睛”视点,使两者的视线汇聚到该点上。这是真实的机械转动,而不是对图像做裁剪。
第二,中央凹式(foveal)处理。 图像送入网络时,系统给图像中心区域分配更多视觉 token,给周边分配较少。这与人眼中央凹高分辨率、周边低分辨率的结构类似。计算资源因此集中在与任务相关的特征上。
第三,分层的注视控制。 注视不能随意移动,它必须与任务进度协调。论文采用两级结构:底层是一个注视伺服(gaze servoing)策略,以“目标物体”为条件,负责把视线对准它;上层是一个目标选择器(target selector),根据任务进度输出下一个注视目标。
训练方式:两个模块都用真实数据上的强化学习
底层伺服策略使用稠密的几何奖励进行强化学习训练。奖励直接衡量视线与目标的几何对齐程度,信号密集,适合在真机上学习。
上层目标选择器的训练更有意思。它与行为克隆(BC)的夹爪策略共同训练。选择器没有人工标注的“该看哪里”,而是在与夹爪策略协同优化的过程中自己发现注视序列。论文指出,这些序列可以与人类执行同一任务时的注视序列相似。这说明,注视行为可以从任务成功这一目标中自然涌现。
动作表示:注视相对的 SE(3) 坐标系
EyeRobot 2.0 还利用注视点简化了动作学习。系统把夹爪信息规范化到一个“注视相对”的 SE(3) 坐标系中。夹爪的位姿不再相对于机器人基座,而是相对于当前注视点。
这样做的好处是缩小了需要学习的动作分布。位置与朝向的变化范围变窄,策略更容易拟合。对于数据量有限的真机遥操作数据集,这种压缩尤其有价值。
实验设计与关键结果
作者采集了 7 个真实任务和 6 个仿真任务的遥操作数据,并进行了超过 1000 次真机试验和 1800 次仿真试验。对照组是在同样数据上训练的被动立体相机策略,以及“头部相机加腕部相机”策略。 主要结果如下: - 去掉腕部相机代价很大。标准策略只用被动立体相机时,真机成功率从 52% 降到 27%。
- EyeRobot 2.0 只用立体相机,就把这一差距补了回来。它在真机上比被动立体高出 40%,在仿真中高出 20%。
- 在腕部视野清晰时,它与头部加腕部策略基本持平,成功率为 69% 对 64%。
- 在被抓取物体遮挡腕部相机时,它的成功率为 48%,而头部加腕部策略只有 22%,超过两倍。
最后一项最能说明问题。腕部相机在遮挡场景下的失效,是物理上的限制。主动注视的相机位于物体之外,可以从合适的角度持续观察接触区域。
成本与延迟的权衡
从硬件角度看,系统去掉了腕部相机,只保留一对立体相机,但需要增加让两个视点转动的机构。这是用机械自由度换取相机数量。
从计算角度看,中央凹式 token 分配把算力集中到图像中心,理论上能降低对周边区域的开销。论文摘要没有给出延迟与算力的具体数字,因此这些收益需要以全文数据为准。另一方面,注视伺服需要在任务执行期间持续运行,这增加了控制回路的复杂度。
对开发者与产业的意义
对机器人团队而言,这项工作提供了一个可行的传感器简化思路。腕部相机的线缆、标定、维护和遮挡问题,在量产和长期部署中都是真实的成本。如果一对可转动的立体相机能达到同等甚至更好的成功率,硬件清单会更短。
对学习方法而言,这篇论文展示了“感知也是动作”的价值。注视不再是被动的输入,而是一个可以被学习和优化的决策。同时,注视相对的动作表示可以被其他模仿学习框架借鉴。
局限与未来方向
需要谨慎的地方有几点。第一,机器人头部需要可转动的眼部机构,这对现有平台不是即插即用的。第二,实验任务虽有 7 个真实任务,但规模仍属实验室级别,向开放环境泛化还需验证。第三,目标选择器依赖与 BC 策略的联合训练,数据质量会影响注视序列的质量。第四,注视点切换期间的短暂视觉不稳定如何处理,需要看全文细节。
未来方向包括:把主动注视与大型视觉语言动作模型结合,让注视目标由语言指令驱动;在更复杂的长程任务和移动操作中验证;以及探索眼部机构的轻量化设计。总体来看,EyeRobot 2.0 提出了一个清晰的论点:让机器人学会“看哪里”,可以替代“多装几个相机”。