SafeHarness:让机器人编程智能体在完成任务时避开障碍物

Published · AI Daily — AI-assisted deep research, methodology & disclosure

一篇 arXiv 论文(2609.20822)发现,用语言模型写控制程序的机器人编程智能体在带障碍物的任务中多数会发生碰撞。作者提出 SafeHarness,加入路径规划验证和接触方向选择两套 harness。以 GPT-6 为主干,它在 SafeLIBERO 上取得 71.9% 的任务成功率和 87.5% 的避碰率。

论文报告了什么

arXiv 新论文 arXiv:2609.20822(分类 cs.RO,2026 年 9 月 17 日提交)由 Bingxin Xu(USC)、Yuzhang Shang(UCF)、Zhen Dong(UCSB)和 Emilio Ferrara(USC)撰写。它提出了一个作者认为此前研究没有回答的问题。在机器人操作的「编程智能体」(coding agent)路线中,语言模型把机器人控制器写成一段程序,这类智能体如今无需机器人专用训练就能操作机器人。那么,这条路线安全吗?

为了回答这个问题,作者在安全约束下评估编程智能体。每个任务都把一个操作目标和一个「机器人不得触碰的障碍物」配成一对。结果是:智能体追求目标,在多数情况下撞上了障碍物。随后论文提出 SafeHarness,在智能体外围加上两套「障碍感知 harness」。以 GPT-6 为主干时,SafeHarness 在 SafeLIBERO 基准上取得 71.9% 的任务成功率和 87.5% 的避碰率。论文称,这分别比此前最优方法高出 6.5% 和 27.0%,比不带 harness 的同一智能体高出 2.3 倍和 1.5 倍。

背景:为什么安全一直没有被测量

论文回顾了自己所依托的研究脉络。Code as Policies 定下了范式:模型把感知和控制 API 组合成程序,程序本身就是策略。后来的智能体会在失败后改写控制器代码,维护一个「有效技能」库,并投入更多测试时计算来换取可靠性。Harness VLA 让智能体先探索场景,把有效做法存成技能记忆,只在任务变得接触密集时才调用冻结的视觉-语言-动作(VLA)策略。

作者指出,这些工作只按「目标是否达成」给一次运行打分,机器人途中碰了什么从未被度量。论文还引用已有研究来说明「成功不等于安全」:跨模型代际,两者可能朝相反方向变化;把同一策略的无碰撞示范数据增加到十倍,碰撞率下降不到三个百分点。用作者的话说,完成任务和不碰其他东西,是同一个要求的两半。

诊断:约束从未成为优先级

作者先在机器人安全基准上评估编程智能体。它能完成任务,但多数情况下会撞到障碍物。论文排除了两个容易想到的解释。感知没有问题:智能体能正确识别障碍物,也在推理中提到它。指令也没有问题:提示词本来就禁止触碰。智能体会复述约束,然后违反它。

论文把问题定位在规划上,并把每个操作阶段拆成两部分。在穿越自由空间的路径上,模型没有「绕开障碍物的路径」这个概念,于是选择最短路径;它也没有「所选路径中途变得不可行时重新规划」的概念。在阶段末尾的接触环节,模型没有意识到接触本身同样受这条安全约束限制。第 4.3 节的消融显示,更强的规划器无法弥补这一差距。

第 3.4 节给出一种解释。一个回合就是一场数百步的长对话。每次工具调用和每张图像都会加进上下文,上下文增长到数万个 token,而点出障碍物的那一句话还停留在开头。作者引用的研究表明,随着上下文变长,模型对中段内容的召回、对指令的遵循以及对系统提示的坚持都会变差。在他们的运行记录中,约束出现在最初的几步推理里,随后就消失了。

SafeHarness 如何工作

SafeHarness 以接触事件为界把任务切成若干阶段,两套 harness 在每个阶段各运行一次。

障碍感知的路径规划采用「规划、验证、执行」循环。分割模型(SAM-3)把目标和障碍物定位为包围盒。语言模型给出一条由路点组成的折线路径,要求终点在目标处,且不得穿过障碍物包围盒。随后由语言模型之外的检查程序对路径和包围盒做测试,检查范围包括夹爪,抓着物体时还包括物体本身。侵入包围盒的路径会被拒绝,模型重新规划。执行过程中同样会触发重新规划:如果机械臂中途停住,例如被卡住,就从停下的位姿重新规划一条新路径。harness 还限制执行期间读取路径规划图像的次数,因为重复的相同图像只会拉长上下文。

障碍感知的接触执行先做一次「障碍物与接触目标是否相邻」的测试。若无相邻障碍物,任何策略都可以。若有,夹爪必须从能保持间隙的方向接近,并在这些方向中选离障碍物最远的一个。如果没有任何方向可行,夹爪就旋转,使开口轴与障碍物相切,并让负载垂直下降。抓取和放置两处都做同样的测试。

基准与结果

SafeLIBERO 从 LIBERO 的 Spatial、Goal、Object、Long 四个套件中各取四个任务,并为每个任务加入一个障碍物:摩卡壶、收纳盒、牛奶盒、酒瓶、马克杯或书。任务文字从不提及障碍物。每个任务出现在两个难度级别:Level I 中障碍物靠近目标,干扰抓取或放置;Level II 中障碍物远离目标,但位于运输路径上。论文使用 32 个任务、每个任务 10 个随机种子,并原样复用 Harness VLA 的编程智能体循环、冻结的 π0.5 策略和原始技能记忆,因此唯一区别就是这两套 harness。指标为任务成功率(TSR)和避碰率(CAR)。

表 1 的平均结果(百分比,先 TSR 后 CAR):OpenVLA-OFT 为 26.2 和 5.7;π0.5 为 57.8 和 17.1;AEGIS(在 π0.5 上加屏障函数安全层,是最强的既有方法)为 67.5 和 68.9;GPT-5.5 版 SafeHarness 为 70.0 和 86.0;GPT-6 版 SafeHarness 为 71.9 和 87.5。在 Long 套件上,AEGIS 的 TSR 为 46.3,低于它所包裹的冻结策略的 54.3。

表 2 的消融比较三种智能体。在 GPT-6 下,仅模型的 TSR 为 6.0、CAR 为 50.0。作者称这个 CAR 没有意义,因为机械臂过早失败就什么也碰不到。加入技能和冻结 VLA 后变为 31.0 和 59.0,再加入 harness 后变为 71.9 和 87.5。在 GPT-5.5 下,有技能而无 harness 为 28.0 和 31.0,SafeHarness 为 70.0 和 86.0。论文的结论是:这里的安全性是 harness 的属性,而不是它所包裹的模型的属性。

我们的分析

有三点值得注意。第一,核心思想是把一个老的工程习惯用到了新地方:不要相信在提示词里说过一次的规则,而要在关键时刻用工具重新检查。论文说,验证工具相对于对话是无状态的,对需要长期保持的不变量来说,工具接口比提示词更可靠。

第二,数字需要细读。6.5% 和 27.0% 与表 1 中的相对差值吻合(71.9 对 67.5,87.5 对 68.9),并不是百分点差距。百分点差距约为 4.4 和 18.6。两种读法都显示有提升,但任务成功率上的百分点差距不大。论文与「同一智能体不带 harness」的比较(提升 40.9 和 28.5 个百分点)才是更有力的证据。

第三,消融给出一个有用的划分。更强的规划器能改善「从哪一侧接近」这类局部决策,仅技能设置下 Level I 的避碰率从 18.8 升到 69.0;但对 Level II 的路径安全帮助有限,提升只有六个点。加上 harness 之后,规划器之间的差异缩小了。

局限与未解问题

作者自己列出了局限。评估沿用 SafeLIBERO,每个场景只有一个障碍物,障碍物模型是一个轴对齐的包围盒。接触侧的判断是针对平行夹爪调好的。定位质量来自分割模型,定位失败会表现为路径被拒绝,而不是碰撞。每个回合要花几分钟的规划时间。评估以仿真为主。

SafeHarness 也并非零碰撞,约每八个回合仍有一个会移动障碍物。Level II 的任务成功率依然较低(GPT-5.5 下 64.0 对 76.0,GPT-6 下 62.5 对 81.2)。作者认为最可能的原因是:经过验证的绕行让回合变长,而步数预算是固定的。这是他们的推测,不是经过检验的结果。

我们作为读者也有局限:只读到了论文正文,没有看到代码,并且有些表格数字我们无法与文中所述的实验协议对上。结果来自单一基准,论文没有报告真实机器人测试。

对读者的实用启示

为物理系统或高风险系统构建 LLM 智能体的团队,可以带走三条经验。其一,度量副作用,而不仅是目标是否完成。其二,把硬约束放进智能体必须通过的验证器,不要只写在提示词里。

其三,执行前检查计划,并为检查器看不到的情况保留重新规划的通道。论文期望这种基于工具的做法能推广到工作空间限制和力限制,但这只是期望,不是结果。在任何部署之前,都应测试多个障碍物、其他类型的夹爪以及真实硬件。

Sources

FAQ

这篇论文研究什么问题?

它问的是机器人操作的编程智能体是否安全。当每个任务都加入一个不得触碰的障碍物时,智能体追求目标,在多数情况下会撞上障碍物。

SafeHarness 给智能体增加了什么?

两套障碍感知 harness。路径规划把物体定位为包围盒,让模型提出路点,在模型之外验证路径并在需要时重新规划。接触执行则测试障碍物是否紧邻接触目标,并据此选择接近方向。

论文报告了哪些结果?

以 GPT-6 为主干,SafeHarness 在 SafeLIBERO 上取得 71.9% 的任务成功率和 87.5% 的避碰率。有技能但没有 harness 的同一智能体为 31.0 和 59.0。论文说明评估以仿真为主,SafeHarness 约每八个回合仍有一个会移动障碍物。