LEGO:免抬升的第三人称到第一人称视频生成,让合成器管结构、扩散模型管细节

Published · AI Daily — AI-assisted deep research, methodology & disclosure

LEGO(arXiv 2610.12442,2026-10-08)针对从单个第三人称视频生成第一人称视频的难题,放弃“估计深度、抬升为点云、再重投影”的显式管线,改用微调后的 LVSM 风格 Transformer 直接渲染第一人称视角,由学习到的对应分布完成跨视角匹配。其概率式映射保留结构、平均掉细纹理,恰好交给擅长恢复细节的视频扩散模型;分布的集中度还被用作区域置信度,既遮罩低置信区域,也在早期去噪步骤中引导布局。论文称其稳定优于当前最先进的显式管线,且无需重训即可迁移到其他数据集。

从单个第三人称(外中心)录像生成第一人称(自我中心)视频,是新视角合成里最棘手的情形之一。原因很直接:两台相机几乎没有重叠,目标视角里的大部分内容在输入里从未出现过。可这件事的价值很大。机器人模仿学习需要“手眼视角”的示范,AR/VR 和技能教学需要第一人称素材,而大规模采集第一人称数据既昂贵又麻烦,第三人称视频却随处可得。2026 年 10 月 8 日,Suhwan Cho 等人在 arXiv 发布了 LEGO(编号 2610.12442,cs.CV),给出了一条不同于主流的路线。 先看现有的最强方法怎么做。按论文摘要的描述,当前最先进的方法走的是显式重建:估计深度,把视频抬升成点云,再从第一人称相机的位置重新渲染,然后把渲染结果当作条件交给视频扩散模型。这是一个确定性映射,每个像素只会被投到唯一的一个位置。好处是纹理被保留得很好,坏处同样明显:深度估计只要有误差,错误就会原样变成错位的内容。在两台相机重叠极少的设定里,深度误差几乎不可避免,这条管线的上限因此被几何估计的质量卡住。更麻烦的是,这种错误是“自信”的:点云里的每个点都带着同样的确定性,下游的扩散模型无从分辨哪些位置可信,只能照单全收,于是错位的物体、拉伸的表面和空洞会被当作事实继续生成。这也是显式管线在跨视角差异极大的场景里容易翻车的原因。

LEGO 换了一个问法:视频扩散模型到底应该收到什么样的条件?它的回答是“免抬升”。作者微调了一个 LVSM 风格的 Transformer,称为学习式视角合成器,让它直接渲染第一人称视角,全程不使用深度、点云或重投影,跨视角的对应关系由网络内部自己解决。与显式管线的确定性映射相对,这里是概率式映射:对每个区域,合成器按照学到的对应分布,在多个候选源位置上做加权平均。结构因此被保留下来,而精细纹理在平均中被磨掉。画面会比重投影的结果更“糊”,但位置大体是对的。可以把它理解为一种“带不确定性的粗草图”:它不假装知道每个像素的精确来源,只表达“这里大概率来自源视频的哪几个位置”。对一个后续还要被扩散模型重写的条件来说,这种诚实的模糊,比一个精确却可能错误的点更有用。

作者没有回避这个代价,而是把它变成设计依据。他们的论点是:这种取舍恰好适合扩散生成器。去噪训练最擅长的事情就是恢复细节,所以一个有效的条件应当优先保证结构对齐,而不是追求锐度。换句话说,条件信号的任务是告诉生成器“东西在哪里、整体长什么样”,至于毛发、纹路这类细节,交给扩散模型自己补。摘要里的最后一句话概括了这个分工:合成器提供视角结构,扩散模型提供细节。这个思路和不少“粗到细”的系统很像,但它把粗的那一层从手工几何管线换成了端到端学出来的模块。这样做的另一个好处是责任划分清楚:结构错了,问题出在合成器;纹理不好,问题出在扩散模型。两部分可以分别训练、分别评估,也可以各自替换为更强的骨干网络,而不必重做整条几何管线。 LEGO 还额外利用了分布本身的信息。对应分布越集中,说明合成器对这个区域越有把握;越分散,说明候选位置很多、结果越不可靠。论文把这种集中度转成每个区域的置信度,并用在两个地方。其一是遮罩低置信区域,避免把不可靠的条件硬塞给生成器。其二是在去噪早期、也就是布局形成的那些步骤里,引导生成器偏向高置信区域,让整体构图先稳住,再去处理其余部分。这是一种很自然的做法:不确定的地方少听条件的,确定的地方多听条件的。 就结果而言,摘要称 LEGO 稳定优于当前最先进的显式管线,并且无需重新训练就能泛化到其他数据集。需要说明的是,摘要没有给出具体的指标数值,所以“优多少”要等读完全文的实验部分才能判断。另外有两点值得保持清醒。第一,被遮挡或从未被观察到的区域,最终仍然要靠生成来“想象”,置信度机制只能让系统更诚实地区分哪里可信,不能凭空变出真实信息。第二,跨数据集泛化的范围取决于论文测试了哪些数据集,这一点需要核对原文。即便如此,LEGO 的价值不只在这一个任务上:它提出了“条件应该为生成器的强项量身定做”的设计原则,对其他以几何条件驱动扩散模型的任务,例如视频编辑、单目重渲染和机器人世界模型,都有可借鉴之处。最后值得一提的是工程上的含义。免抬升意味着推理时不再依赖独立的深度估计器和点云渲染器,系统组件更少,失败点也更少;代价是需要一个足够强的视角合成器,其能力取决于训练数据的规模与多样性。对想把第三人称监控或教学视频转成第一人称示范数据的团队来说,这是一条值得跟踪的路线。至于是否真能降低总体成本,还要看合成器与扩散模型两部分的实际算力开销,摘要对此没有说明。

Sources

FAQ

LEGO 的“免抬升”具体指什么?

指不再估计深度、不再把视频抬升成点云、也不再做重投影。LEGO 微调一个 LVSM 风格的 Transformer,直接输出第一人称视角画面,跨视角的对应关系由网络内部解决,再把这个结果作为视频扩散模型的条件。

为什么“模糊”的条件反而对扩散模型更好?

论文的论点是,扩散模型的去噪训练本来就擅长恢复细节,所以条件最该提供的是结构对齐,而不是锐度。概率式映射把每个区域在候选源位置上取平均,结构得以保留,细纹理被抹平,正好由扩散模型补回。显式管线的确定性映射保留了纹理,却会把深度误差变成错位的内容。

区域置信度是怎么得到的,又用来做什么?

合成器为每个区域学到一个对应分布,分布越集中,说明该区域越确定。论文把这种集中度当作置信度,有两个用途:一是遮罩低置信区域,二是在早期、负责形成布局的去噪步骤里,引导生成器偏向高置信区域。