WorldAlign: 분리형 4D 보상으로 세계 일관성을 갖춘 비디오 생성

Published · AI Daily — AI-assisted deep research, methodology & disclosure

WorldAlign은 정적 영역과 동적 주체를 의미적으로 분리하고, 각각에 맞는 세계 사전 분포로 보상을 준다. 정적 영역은 의미 마스크 재투영으로 기하 사전 분포에 정렬하고, 카메라 움직임 보상으로 정지에 가까운 해를 막는다. 동적 주체는 VLM이 샘플별 체크리스트로 평가한다. 사람의 선호 주석 없이 Wan2.1과 Wan2.2의 정적·동적 일관성을 함께 높이며 움직임도 유지한다.

비디오 생성 모델은 지난 몇 년간 주로 '진짜처럼 보이는' 방향으로 발전해 왔다. 질감은 더 정교해졌고, 조명은 더 매끄러워졌으며, 카메라 움직임도 안정되었다. 그러나 이 모델들을 로봇 사전 연습, 게임 장면, 체화된 에이전트의 훈련 환경 같은 세계 시뮬레이터로 쓰기 시작하면 질문이 달라진다. 시뮬레이터는 보기 좋은 것만으로는 부족하고, 스스로의 규칙을 지켜야 한다. 한쪽에서 본 벽은 카메라가 한 바퀴 돌아와도 모양이 그대로여야 한다. 십 초 동안 걷는 사람의 얼굴이나 옷이 슬며시 바뀌어서도 안 된다. WorldAlign 논문은 Jing He, Kaixin Ding, Xingye Tian, Guibao Shen, Wenhang Ge 등이 쓴 것으로, 이 요구를 4D 세계 일관성이라고 부른다. 3차원 공간의 구조가 안정되어야 하고, 시간 축에서 움직임과 외관도 안정되어야 한다. 앞의 것이 정적 일관성, 뒤의 것이 동적 일관성이다. 논문은 2026년 10월 8일 cs.CV 분야로 공개되었다.

일관성을 높이는 자연스러운 방법은 기하를 고려한 사후 학습이다. 생성기가 영상을 만들면 기하 모델이 깊이와 카메라 자세를 추정하고, 한 프레임을 다른 프레임으로 재투영해 오차를 잰다. 이 오차를 보상으로 삼아 생성기를 조정한다. 이 방식에는 알려진 약점이 둘 있다. 첫째, 대개 장면이 정지해 있다고 가정한다. 사람이 걷고 자동차가 달리는 장면에서는 재투영이 실제 움직임을 기하 오류로 오해하고, 좋은 영상에 필요한 동적 요소를 오히려 벌한다. 둘째, 동적 장면을 허용하는 방법도 정적 일관성에 대한 피드백이 믿을 만하지 못하다. 움직이는 픽셀과 정지한 픽셀이 하나의 오차에 섞이기 때문이다. 동적 일관성, 즉 움직임이 그럴듯하고 외관이 시간에 따라 유지되는지는 무시되거나 거친 지표로만 측정되는 경우가 많다.

WorldAlign의 핵심 아이디어는 단순하다. 정적 내용과 동적 내용은 따르는 전제가 다르므로 같은 자로 재서는 안 된다. 이 프레임워크는 먼저 화면을 의미적으로 정적 영역과 동적 주체로 나눈다. 그다음 각 부분을 그 전제에 맞는 세계 사전 분포에 정렬한다. 정적 영역의 사전 분포는 기하적이다. 의미 정보로 안내되는 마스크 재투영이, 정적으로 판정된 픽셀에서만 시점 간 기하 정렬을 계산한다. 움직이는 주체는 제외되므로 피드백이 더 깨끗하고 믿을 만하다. 저자들은 실용적인 보완책도 더했다. 기하 보상만 쓰면 영상을 거의 움직이지 않는 것이 가장 쉬운 길이 된다. 재투영 오차가 저절로 작아지기 때문이다. 최적화는 이 지름길을 찾아낸다. 그래서 보조 카메라 움직임 보상이 정지에 가까운 해를 벌하고, 기하 일관성을 유지하면서 실제로 시점을 바꾸도록 압박한다. 보상 해킹에 대한 전형적인 방어이며, 계산 가능한 단일 지표는 강한 최적화기에게 반드시 악용된다는 점을 일깨워 준다.

동적 주체에는 기하가 도움이 되지 않는다. 움직임이 그럴듯한지는 기하가 아니라 상식과 물리의 문제이기 때문이다. 저자들은 강력한 시각-언어 모델(VLM)을 동적 세계 사전 분포로 쓰고 심사위원 역할을 맡긴다. 핵심 설계는 샘플별 체크리스트다. 생성된 영상마다 구체적인 질문을 만들고, 동적성, 물리적 타당성, 형태 일관성, 질감 일관성이라는 네 관점에서 항목별로 채점한다. 동적성은 움직여야 할 것이 실제로 움직이는지 묻는다. 물리적 타당성은 동작이 중력, 접촉, 관성을 따르는지 묻는다. 형태와 질감은 주체가 시간에 따라 변형되거나 겉모습이 바뀌지 않는지 살핀다. 막연한 점수 하나보다 체크리스트가 낫다. 심사위원의 주의를 구체적인 근거에 묶어 두고, 보상을 점검하고 디버깅하기도 쉽다. 더 중요한 것은 이 모든 과정에 사람의 선호 주석이 필요 없다는 점이다. 두 보상 모두 사전 분포에서 나오므로 온라인 사후 학습이 가능하고 데이터 비용도 줄어든다.

논문은 사전 학습된 이미지-비디오 생성기 두 가지, Wan2.1과 Wan2.2에서 방법을 검증했다. WorldAlign은 정적·동적 일관성을 함께 개선했고, 전체 움직임이나 주체의 움직임을 억누르지 않았다고 보고한다. 이 마지막 점이 중요하다. 문헌의 많은 일관성 향상은 영상을 밋밋하게 만든 대가로 얻은 것이고, 장면을 얼려서 이기는 방법은 승리가 아니다. 다만 초록만으로는 정확한 수치, 절제 실험의 세부 사항, 계산 비용을 알 수 없다. 이는 전체 논문과 프로젝트 페이지(worldalign.github.io)에서 확인해야 한다. 방법 설계상 남는 의문도 있다. VLM 심사위원에게는 편향과 불안정성이 있고, 보상은 심사위원보다 나을 수 없다. 의미 분할이 정적과 동적을 잘못 나누면 마스크 재투영에 잡음이 끼어든다. 기하 사전 분포는 반사 면이나 투명한 물체, 극단적인 시점에서도 실패할 수 있다.

그럼에도 이 논문이 내놓은 원칙은 가치가 있다. 세계가 성질이 다른 부분들로 이루어져 있다면, 보상도 같은 선을 따라 나누고 각 부분을 알맞은 사전 분포에 정렬해야 한다. 이 생각은 더 긴 영상, 여러 주체의 상호작용, 나아가 엔지니어가 믿고 쓸 수 있는 시각적 세계 시뮬레이션으로 확장될 수 있다. 비디오 모델을 만드는 팀에게 주는 실용적 교훈은 정지된 장면이라는 가정 같은 숨은 전제가 보상에 없는지 점검하고, 각 보상 항을 가장 값싸게 만족시키는 방법으로부터 보호하라는 것이다.

Sources

FAQ

WorldAlign에서 '분리'는 정확히 무엇을 뜻하나요?

화면을 의미에 따라 정적 영역과 동적 주체로 나누고, 각각 다른 세계 사전 분포로 채점한다는 뜻입니다. 정적 영역은 기하 사전 분포로 시점 간 3D 구조를 확인합니다. 동적 주체는 VLM이 움직임, 물리, 형태, 질감을 확인합니다. 두 보상은 서로 간섭하지 않습니다.

왜 카메라 움직임 보상을 추가하나요?

정적 일관성 보상에는 지름길이 있습니다. 영상이 거의 움직이지 않으면 재투영 오차가 작아집니다. 모델은 정지에 가까운 영상을 만드는 법을 배울 수 있습니다. 보조 카메라 움직임 보상은 이런 해에 벌점을 주어, 기하 일관성을 지키면서 시점을 실제로 바꾸게 합니다.

왜 사람의 선호 주석이 필요 없나요?

정적 보상은 기하 사전 분포를 이용한 계산 가능한 재투영 정렬에서 나옵니다. 동적 보상은 강력한 VLM이 샘플별 체크리스트를 채점해 얻습니다. 둘 다 사람이 매긴 좋고 나쁨의 비교쌍이 필요 없어 온라인 사후 학습이 가능합니다. 대신 보상의 질은 이 사전 분포의 신뢰도에 달려 있습니다.