FixAnything:以视频生成先驗修復3D渲染偽影
這篇論文提出 FixAnything,一個能修復多種 3D 場景渲染偽影的通用模型。當輸入視角稀疏或目標視角遠離輸入時,使用高斯濺射(3DGS)、神經輻射場(NeRF)、網格或點雲等 3D 表示進行渲染會產生偽影。現有基於擴散生成先驗的方法通常針對單一表示定制架構或需要大量重訓。作者的關鍵洞察是,即便渲染帶噪聲,序列仍保留相機運動與粗略場景結構,因此可將修復建模為影片到影片的翻譯。為此引入標記乾淨像素的二進位遮罩,讓模型錨定高品質輸入並細化其餘部分。為鼓勵生成支持下游重建的 3D 一致渲染,作者用結構運動恢復的相機位姿精度作為獎勵信號,配合直接偏好優化(DPO)。在四種不同 3D 表示上,FixAnything 均以輕量微調持續提升渲染品質,證明單一通用影片先驗可替代多條專用修復流水線。
这篇论文聚焦一个普遍存在但长期被分散处理的问题:用 3D 场景表示进行渲染时,一旦输入视角稀疏,或者目标视角距离输入较远,渲染结果就会出现伪影。无论是高斯溅射、神经辐射场、网格还是点云,这类表示在稀疏输入或大角度目标视角下都容易暴露出结构混乱、模糊或错位的缺陷。作者指出,近年来基于扩散生成先验的方法能够有效缓解这类伪影,但它们往往针对某一种特定表示量身定制架构,或者需要大量重新训练,导致每个 3D 表示都要单独维护一条修复流水线。FixAnything 的核心贡献在于提出一个通用模型,能够修复一大类渲染伪影,而不是为每种表示各造一个专用工具。作者的核心洞察是,即便渲染序列带有噪声,它依然保留了相机的运动轨迹和粗略的场景结构,因此修复可以被重新表述为视频到视频的翻译任务。
这一视角转换让研究者可以直接复用已经训练好的视频生成模型,只需极少的架构改动和轻量微调,就能获得跨表示通用的修复能力。这一思路的价值在于把原本分散在多个表示上的工作,收敛到一个统一框架中,从而大幅降低后续维护与扩展的代价。在技术方法上,FixAnything 的关键做法是改造一个预训练的视频生成模型,利用它隐含的多视角先验,而不是从头设计网络结构。作者认为视频生成模型在大量视频数据上学到了场景随相机运动而变化的规律,这种规律天然包含多视角之间的一致性,因此可以直接迁移到 3D 渲染修复中。为了让模型知道哪些结构必须保留、哪些需要细化,作者引入一个二进制掩码,用来标记画面中已经干净的像素。
这个掩码的作用是锚定,它让模型把输出稳定绑定到高质量输入上,例如训练时使用的视角,同时把精力放在细化其余尚未修复的区域。这种设计既防止模型把原本正确的部分改坏,又避免它在模糊区域自由发挥导致结构失真。为了让修复结果不仅画面更好看,还能支持下游的 3D 重建任务,作者进一步用相机位姿的精度作为奖励信号,配合直接偏好优化来训练。相机位姿精度通过结构从运动中恢复,也就是说,如果修复后的渲染能被更准确地重建出相机轨迹,就认为它是更好的结果。这种将几何一致性纳入偏好优化的做法,把视觉质量与几何可靠性统一到了同一个训练目标中。
在实验设置上,论文在四种彼此不同的 3D 表示上评估 FixAnything,覆盖高斯溅射、神经辐射场、网格以及点云等主流方案,以验证其通用性。结果表明,在每种表示上,FixAnything 都通过轻量微调稳定提升渲染质量,而不是只在某一种表示上有效。这一跨表示的一致性正是该框架设计目标的直接体现,也说明单一通用视频先验确实可以替代多条专门设计的修复流水线。消融与机制层面的发现主要来自两个关键设计:二进制掩码的锚定作用,以及以相机位姿精度为奖励的直接偏好优化。掩码让模型在保留高质量像素的同时细化其余区域,避免过度生成带来的结构破坏;偏好优化则把下游重建所需的几何一致性显式地纳入训练,使修复结果不仅看起来干净,还能被后续重建流程可靠利用。
这些设计共同解释了为什么一个看似简单的视频到视频框架,能够同时兼顾画面质量与几何可靠性。作者也强调,这种简洁的框架意味着未来可以直接接入更强的视频生成模型,而不需要重新设计架构,从而把性能提升直接转化为即得的收益。从行业意义来看,FixAnything 的价值在于把原本分散、定制化的修复工作收敛到一个统一且轻量的框架中。对于开源社区而言,这种基于预训练视频模型再微调的思路,降低了复现与二次开发的门槛,也让后续研究者能够以较低成本尝试新的生成模型。对于工业落地而言,当渲染需要在稀疏视角或大角度目标视角下完成时,例如三维重建、可视化或内容生成,一个通用修复模型可以显著减少为不同表示分别维护流水线的人力与算力成本。对于后续研究而言,论文证明了视频生成模型隐含的多视角先验具有可迁移性,并展示了用几何一致性作为奖励信号的可行性,这为把生成先验与 3D 恢复任务更紧密地结合提供了可借鉴的路径。作者特别指出,框架的简洁性使其能够无缝接入未来更强的视频模型,无需任何架构重设计,这种面向演进的设计让当前的工作能够持续受益于整个视频生成领域的发展。
Sources
FAQ
FixAnything는 무엇인가요?
FixAnything는 가우시안 스플래팅(3DGS), 신경 방사장(NeRF), 메시, 포인트 클라우드 등 다양한 3D 장면의 렌더링 아티팩트를 사전 훈련된 영상 생성 사전 지식으로 수정하는 범용 모델입니다.
왜 중요한가요?
인페인팅을 영상에서 영상으로의 번역으로 재구성하여, 단일 범용 영상 사전 지식으로 여러 전용 inpainting 파이프라인을 대체할 수 있고 유지·확장 비용을 크게 절감할 수 있습니다.
앞으로 어떤 점에 주목해야 하나요?
프레임워크가 의도적으로 간결하게 설계되어, 향후 더 강력한 영상 생성 모델을 아키텍처 재설계 없이 통합할 수 있고 성능 상상이 그대로 얻어진다고 저자들은 말합니다.