BATON:通過智能子任務探索與轉換感知記憶實現長程機器人操控

Published 2026-08-17 · AI Daily — AI-assisted deep research, methodology & disclosure

針對視覺-語言-動作(VLA)模型在處理長程機器人操控任務時面臨的誤差累積與子任務銜接失效問題,本文提出了 BATON 框架。現有的「LLM 規劃 + VLA 執行」方案存在兩個核心缺陷:一是長程任務的探索成本隨階段數呈指數級增長,且難以定位失敗原因;二是缺乏對子任務轉換狀態的表徵,導致前序任務的結束狀態無法被後續任務有效識別。BATON 通過將探索單元從「完整任務」降維至「單個子任務」,將探索成本從指數級降低為線性級,並引入了包含驗證器、交接與前瞻機制的轉換感知記憶系統。在 RoboMemArena 基準測試中,BATON 將任務成功率提升了 11.6%,累計成功率提升了 14.9%,顯著優於現有最先進技術。

在机器人操控领域,长程任务(Long-horizon manipulation)通常涉及一系列复杂的接触密集型技能,这些技能必须按顺序精准执行才能完成最终目标。虽然当前的视觉-语言-动作(VLA)模型在执行单一技能方面表现出色,但在处理长链条任务时却显得力不从心。这种失效主要源于两个深层问题:首先是误差累积效应,即前序步骤中微小的偏差会随着任务链的延伸而不断放大,最终导致整体任务失败;其次是子任务之间的"断层"问题,即前一个子任务的结束状态往往无法满足下一个子任务的起始需求。现有的主流方案尝试通过引入大语言模型(LLM)作为规划器来解决此问题,即由 LLM 进行语言层面的规划,并在自由空间运动时使用解析原语,仅在需要接触的任务阶段调用 VLA。然而,这种方法在面对长程任务时会遭遇"指数级探索成本"的困境,且由于缺乏对任务转换(Transitions)的显式表征,导致任务链在衔接处极易崩溃。

BATON 框架正是为了打破这两大瓶颈而设计的,它试图通过重构探索机制与记忆结构,让机器人具备处理复杂、连续长程任务的能力。BATON 的核心技术创新在于其独特的"子任务探索"与"转换感知记忆"机制。针对探索成本过高的问题,BATON 改变了以往"尝试完成整个长程任务"的低效策略,转而将每个子任务视为独立的探索单元。在训练或探索阶段,系统会在短时程(Short-horizon)环境下对每个子任务进行单独探索,并将成功的解决方案存储在记忆库中。这样一来,长程任务的复杂度不再是各阶段成本的乘积,而是降阶为各阶段成本的加总,极大地提高了探索效率,并能精准定位失败发生的具体阶段。

在记忆管理方面,BATON 引入了三种关键的转换机制:首先是"验证器代理(Verifier Agent)",它通过观察手腕摄像头(Wrist view)来确认场景是否已达到触发 VLA 执行的就绪状态,确保了调用的准确性;其次是"交接转换(Handoff Transition)",它能够修复前序任务留下的残余影响,将环境状态恢复到后续任务所需的起始状态;最后是"前瞻转换(Lookahead Transition)",它能够预判不同策略的执行结果,从而选择最能被后续任务所继承的执行方案。值得注意的是,整个过程无需对模型参数进行任何更新,完全依赖于智能体对记忆的检索与逻辑推理。为了验证 BATON 的有效性,研究团队在长程操控基准测试 RoboMemArena 上进行了严苛的实验。实验结果表明,BATON 在处理复杂任务链时表现出了极强的鲁棒性。相比于目前的 SOTA(State-of-the-art)方案,BATON 将任务的单次成功率(Task Success Rate)提升了 11.6%,而更具代表性的累积成功率(Cumulative Success Rate)则提升了 14.9%。

消融实验进一步证实,这种性能提升主要归功于其将探索成本从指数级降至线性级的策略,以及通过转换感知记忆解决了子任务间的状态不匹配问题。实验数据清晰地表明,通过将长程任务拆解为可独立探索、可精准衔接的模块化单元,机器人能够以极低的计算和尝试成本,完成以往难以实现的复杂操作序列,这为解决机器人长程操控中的"组合爆炸"问题提供了切实可行的路径。BATON 的提出为具身智能(Embodied AI)领域的研究提供了全新的视角。它证明了在不增加底层模型参数量的前提下,通过优化任务的组织逻辑与记忆检索机制,可以显著提升机器人在复杂环境下的任务完成能力。对于工业界而言,这意味着机器人可以更灵活地应对多步骤、高精度的生产流程,而不仅仅局限于单一的重复动作。对于开源社区和后续研究者来说,BATON 提出的"子任务作为探索单元"的思想,为解决机器人学习中的样本效率问题提供了重要的理论支撑。随着 VLA 模型能力的不断增强,如何构建像 BATON 这样具备高效规划与精准衔接能力的"大脑"架构,将成为实现通用机器人智能的关键方向。这不仅推动了机器人从"技能学习"向"任务理解与执行"的跨越,也为构建具备长程逻辑推理能力的具身智能体指明了技术路线。

Sources

FAQ

BATON 框架解决了机器人操控中的哪些核心问题?

该框架主要解决了长程任务中的误差累积以及子任务衔接失效问题,通过将探索成本从指数级降低为线性级,显著提升了机器人的操控成功率。

为什么 BATON 框架在处理复杂任务时表现如此出色?

它通过子任务探索机制降低了学习复杂度,并引入了包含验证器、交接与前瞻机制的转换感知记忆系统,确保了任务链条的平稳过渡。

这项研究对具身智能的未来发展有何意义?

它证明了无需增加模型参数量,仅通过优化任务组织与记忆检索机制,即可显著提升机器人在复杂环境下的长程任务处理能力。