世界模型该忘记什么?分层保留让持续适应不再「一刀切」
这篇论文指出,持续学习把「旧数据上的性能下降」一律当作失败,但世界模型预测的是会变化的环境,过时的知识本来就该被改写。作者主张按「不变性时间尺度」分层保留:物理规律、物体恒存性等不变量绝不能改,实例级事实则应随环境变化尽快更新。标准遗忘指标分不清「正确修订」与「灾难性遗忘」,甚至把冻结模型排在第一。论文提出差异化保留:在整个适应流上同时报告不变量回归测试与修订延迟,且不做聚合。
这篇来自 arXiv(编号 2610.03713)的论文讨论的是一个看似细小、实则根本的问题:持续适应的世界模型到底应该忘记什么。作者的核心判断是,持续学习领域沿用多年的评价习惯,在世界模型身上并不成立。需要说明的是,本文只依据论文摘要写成。摘要没有给出任何具体的实验数字,下文也不会编造数字,只分析它提出的概念、机制与评测主张。 一、问题从哪里来 传统持续学习的设定里,预测目标是平稳的。一张猫的图片,今天是猫,十年后还是猫。在这种前提下,模型在旧任务上的准确率下降,就是明确的失败信号,学界称之为灾难性遗忘。几乎所有遗忘指标,比如平均遗忘量、后向迁移,都建立在这个前提之上:旧数据上的表现越接近当初,模型越好。 世界模型不同。它的预测目标是环境本身,而环境会变。仓库里的货架被重新摆放,路口新增了红绿灯,某个机器人的夹爪磨损后动力学发生改变。模型曾经学到的「货架在左边」在当时是正确的,现在就是错的。如果模型仍旧坚持旧知识,它才是真正出了问题。因此,遗忘在这里不是缺陷,而是必需的行为。 二、核心主张:按不变性时间尺度分层保留 作者认为,世界模型里的知识并不同质。有一类知识永远不该被修订,例如物理定律、重力方向、物体恒存性(东西被遮住并不等于消失)。另一类是实例层面的事实,例如某个房间的布局、某台设备的当前状态,它们应当在环境一变化时就被尽快改写。两类知识之间还有中间层,变化的速度各不相同。
这就是「分层保留」的含义:按照知识的不变性时间尺度,给不同层级设定不同的保留策略。越接近不变量,保留要求越严格,修订必须被禁止;越接近具体实例,保留要求越宽松,修订应被鼓励且要快。 论文还指出,这个问题在相邻领域已有研究。概念漂移文献研究非平稳的数据分布,语言模型的时间事实性研究讨论「现任总统是谁」这类会过期的事实。但这些工作没有被系统地表述到世界模型上,而世界模型有一个特殊之处:它同时编码了必须永不修订的知识。语言模型的事实大多可以过期,世界模型的物理常识却不能。 三、现有指标为什么会失灵 摘要里有一个很尖锐的论断:标准的遗忘指标无法区分两种完全不同的模型。一种是正确修订了过时知识的模型,另一种是遭受灾难性遗忘的模型。两者在旧数据上的表现都会下降,指标看到的是同一个信号。更糟的是,这类指标会把完全冻结的模型排在最高位,因为冻结模型在旧数据上一点都没变。一个从不适应环境的模型,反而拿了最高分,这显然违背了评测的初衷。 同样的问题也出现在现有的物理推理基准上。摘要指出,这些基准只评估冻结的检查点,也就是只看某一时刻的模型,而不看模型在一条持续的适应流里表现如何。这等于没有测到「持续适应」这件事本身。 四、差异化保留:两个指标,不做聚合 作者提出的评测方案叫差异化保留(differential retention)。它要求在整条适应流上,同时报告两样东西。 第一,不变量回归测试。在每一个适应阶段,都用一组针对物理规律、物体恒存性等不变量的测试检查模型,确认这些知识没有被破坏。这对应「该记住的必须记住」。 第二,修订延迟。环境发生变化之后,模型要多久才能把相关的实例级事实更新到位。这对应「该忘记的必须尽快忘记」。 关键在于「不做聚合」。如果把两项合成一个总分,一个模型可以靠牺牲其一来换取另一项的高分,比如完全冻结可以让不变量满分,却让修订延迟无穷大。分开报告,才能暴露这种取舍。这与近年评测领域对单一总分的警惕是一致的。
五、对开发者与企业的影响 对做机器人、自动驾驶、数字孪生和智能体仿真的团队来说,这个框架提供了一个可以落地的检查清单。第一,需要为自己的系统整理出「不变量集合」,并把它做成每次更新都要跑的回归测试。第二,需要设计「环境变更」的注入实验,测量模型的修订延迟。第三,在选择持续学习方法时,不能只看旧任务保持率,因为方法如果靠正则化把旧知识锁死,在这套评测下会暴露出修订延迟过高的问题。 对基准的制作者而言,意义更大:评测对象应当从静态检查点转向适应流,也就是模型随时间被不断更新的整个轨迹。这会提高评测的成本,因为要构造带有受控变化的环境序列,并且要为每个变化标注哪些知识该被改写、哪些不该。 六、局限与未解之处 首先,分层本身并不容易划定。哪些知识属于「永不修订」的不变量,哪些只是在很长时间尺度上稳定的事实,边界并不总是清楚。物理定律看似永恒,但模型学到的往往是它对物理的近似,而近似也可能需要修正。
其次,修订延迟的测量依赖对「环境何时改变」的明确标注。在真实部署中,变化常常是渐进的、隐蔽的,没有人告诉模型发生了什么。 第三,摘要只提出了概念框架和评测主张,并未给出数字化的实验结果。这类立场性工作的价值在于重新定义问题,而它的实际效果,需要后续在具体世界模型和具体环境上得到验证。读者在引用时应当注意这一点。 七、未来方向 可以预见的方向包括:为世界模型构建带有变更标注的适应流基准;研究在架构层面把不变量与实例知识分开存放,例如用不同的参数子空间或记忆模块;以及把修订延迟作为训练目标之一。更远一步,模型还需要自己判断哪些知识已经过期,也就是对「环境是否变了」的检测能力,这与概念漂移检测自然衔接。 总的来说,这篇论文没有提出新的网络结构,而是重新定义了问题与评分标准。它提醒我们:评价一个会自我更新的模型,不能再问「它忘了多少」,而要问「它忘了该忘的,还记着该记的吗」。