DARS:用双层信用分配破解指令图像编辑的强化学习难题

Published 2026-08-20 · AI Daily — AI-assisted deep research, methodology & disclosure

研究者针对基于指令的图像编辑任务提出名为 DARS 的强化学习框架,专门解决两阶段 planner-renderer 流水线中的信用分配难题。在该流水线中,视觉语言模型先根据指令生成编辑计划,扩散模型再执行该计划。仅依赖最终图像奖励训练效率低下,因为一次失败编辑无法告诉优化器该把重点放在 planner 还是 renderer 上,即便 planner 出错,也难以在自由形式的推理轨迹中定位问题。DARS 通过多计划、多渲染的 rollout 估计计划间与计划内的奖励波动,实现软性模块路由,并利用平均 rollout 奖励构造自适应课程。planner 内部采用四字段结构化输出,通过前缀门控奖励与 token 级优势重加权,将结果级反馈转化为局部化监督。在五个 benchmark 上的实验表明,DARS 在相同骨干、数据、奖励模型与 rollout 预算下全面优于 Joint RL 基线,且在推理密集型编辑上提升最大。

基于指令的图像编辑近年来成为计算机视觉中一个兼具实用价值与研究挑战的方向。这类任务通常采用 planner-renderer 的两阶段流水线:首先由一个视觉语言模型读取自然语言指令并转化为一份可执行的编辑计划,随后由扩散模型负责真正落地该计划,生成最终图像。这种拆分的好处在于职责清晰,但也带来一个根本性的优化难题,那就是信用分配。作者指出,如果仅仅使用最终图像的奖励来训练整个系统,效率会非常低。原因在于,一次失败的编辑结果并不能告诉优化器,应当把更多的优化资源投入到 planner 还是 renderer。换句话说,结果级别的反馈过于稀疏,无法区分问题究竟出在计划制定环节还是计划执行环节。更棘手的是,即便在 planner 主导的失败案例中,由于 planner 往往以自由形式的推理轨迹呈现,问题也很难被精确定位到具体的推理步骤。正是针对这一痛点,作者提出了 DARS 框架,其核心贡献在于为这种两阶段场景设计了一套双层信用分配机制,把原本笼统的结果奖励拆解为可在模块之间与 token 之间流动的监督信号。这一设计让训练信号得以精准地流向真正需要改进的部分,从而在整体上提升了编辑质量。在技术方法上,DARS 在模块层面采用了多计划、多渲染的 rollout 策略。具体而言,对于同一条指令,系统会生成多个候选编辑计划,并对每个计划执行多次渲染采样,由此得到一组丰富的轨迹。基于这批轨迹,作者估计了计划之间的奖励波动与计划内部的奖励波动。计划间的波动反映了不同计划方案的优劣差异,计划内的波动则反映了同一计划在不同渲染结果下的稳定性。这两种波动被用来构建软性的模块路由,使得系统能够根据当前样本的具体情况,动态地决定 planner 与 renderer 各自应当承担多少优化责任,而不是简单地一刀切。与此同时,rollout 的平均奖励被用作难度估计,进而构造了一门自适应的课程学习策略,让模型由易到难地逐步提升。在 planner 内部,作者引入了一个四字段结构化推理输出。这一设计的关键意义在于,它把原本自由发散、难以追踪的推理过程,转变为一个结构清晰、可被逐字段解析的表示。基于这种结构化输出,作者设计了前缀门控奖励机制,并结合 token 级优势重加权,把原本只发生在结果层面的反馈,细化并定位到具体的 token 与推理字段上。这样一来,结果级别的奖励便被转化为一种局部化的监督信号,能够明确指出 planner 在哪个环节、哪一步推理上出现了偏差,从而实现了真正意义上的信用精确定位。在实验设置方面,作者选择了五个 benchmark 对 DARS 进行系统评估,并选取了 Joint RL 作为主要基线。值得强调的是,这一对比是在严格控制变量的条件下进行的:两组方法使用了相同的骨干网络、相同的数据、相同的奖励模型以及相同的 rollout 预算,从而保证了对比的公平性。实验结果显示,DARS 在这五个基准上全面优于 Joint RL 基线。尤为突出的是,在推理密集型编辑任务上,DARS 获得了最大的性能提升。这一发现与作者的设计动机高度吻合,因为它恰恰说明,当编辑任务对 planner 的推理能力要求较高时,作者所提出的局部化信用分配机制能够发挥出更大的价值。消融层面的发现也进一步印证了双层信用分配与结构化推理设计的必要性。在行业意义与潜在影响方面,DARS 提供了一种可迁移的优化思路,即面对多阶段生成系统时,应当把稀疏的结果奖励拆解为可在不同粒度上流动的监督信号。这一思路不仅适用于图像编辑,也可能对视频生成、视频编辑以及更广泛的规划执行类系统具有启发意义。在开源社区层面,作者明确强调其方法在相同骨干、数据、奖励模型与 rollout 预算下取得优势,这意味着其他研究者可以在不增加额外算力的前提下,直接借鉴其信用分配与课程学习的设计,从而以较低成本提升既有系统的性能。在工业落地层面,图像编辑本身具有广泛的应用前景,而如何在有限预算下稳定提升编辑质量,正是产品化过程中最关心的工程问题。因此,DARS 所提出的双层信用分配框架,为后续研究提供了一条兼顾效果与效率的可行路径,具有较强的参考价值。

Sources