LEGO: 리프팅 없는 3인칭→1인칭 비디오 생성, 합성기는 구조를 맡고 확산 모델은 디테일을 맡는다
LEGO(arXiv 2610.12442)는 깊이 추정이나 포인트 클라우드 없이 3인칭 영상에서 1인칭 영상을 생성한다. LVSM 방식 트랜스포머가 구조를 만들고 확산 모델이 디테일을 복원하며, 대응 신뢰도가 노이즈 제거를 유도한다. 재학습 없이 다른 데이터셋에도 일반화된다고 보고한다.
단일 3인칭(외부 시점) 녹화에서 1인칭(자기 중심) 영상을 생성하는 일은 새로운 시점 합성 가운데서도 특히 까다로운 문제다. 두 카메라가 겹치는 영역이 거의 없어서 목표 시점의 대부분이 입력에 한 번도 나타나지 않기 때문이다. 그래도 가치는 크다. 로봇 모방 학습에는 행위자 본인의 시점에서 본 시연이 필요하고, AR과 VR, 기술 교육에도 1인칭 영상이 필요하다. 그런데 1인칭 데이터를 대규모로 모으는 일은 비용도 많이 들고 번거롭다. 반면 3인칭 영상은 어디에나 있다. 2026년 10월 8일 Suhwan Cho 등은 LEGO(arXiv 2610.12442, cs.CV)를 공개하며 주류와는 다른 길을 제안했다.
먼저 기존 최고 수준의 방법이 무엇을 하는지 보자. 논문 초록에 따르면 현재의 최신 방법은 장면을 명시적으로 재구성한다. 깊이를 추정하고, 영상을 포인트 클라우드로 끌어올리고, 1인칭 카메라 위치에서 다시 렌더링한 뒤, 그 결과를 비디오 확산 모델의 조건으로 넘긴다. 이것은 결정론적 사상이다. 각 픽셀은 하나의 재투영 위치에만 대응된다. 장점은 질감이 잘 보존된다는 것이다. 단점도 분명하다. 깊이 추정의 오류가 그대로 조건 속에서 엉뚱한 위치에 놓인 내용이 된다. 두 카메라가 거의 겹치지 않는 설정에서는 깊이 오류를 피하기 어렵고, 파이프라인 전체의 품질이 기하 추정의 품질에 묶인다.
LEGO는 질문을 바꾼다. 비디오 확산 모델은 조건으로 무엇을 받아야 하는가. 이들의 답이 '리프팅 없음'이다. 저자들은 학습형 시점 합성기라 부르는 LVSM 방식 트랜스포머를 미세 조정해 1인칭 시점을 직접 렌더링하게 한다. 깊이도, 포인트 클라우드도, 재투영도 쓰지 않는다. 시점 간 대응은 네트워크 내부에서 스스로 해결된다. 명시적 파이프라인이 결정론적인 데 비해 이 사상은 확률적이다. 합성기는 각 영역에 대해 학습된 대응 분포에 따라 여러 후보 원본 위치를 평균한다. 그 결과 구조는 보존되고 미세한 질감은 평균 과정에서 사라진다. 재투영보다 부드러운 이미지가 나오지만 내용은 대체로 맞는 위치에 놓인다.
저자들은 이 대가를 숨기지 않고 오히려 설계의 근거로 삼는다. 이 절충이 확산 생성기에 맞는다는 것이 주장이다. 확산 모델의 노이즈 제거 학습은 디테일 복원에 뛰어나다. 따라서 효과적인 조건은 선명도보다 구조 정렬을 우선해야 한다. 조건은 무엇이 어디에 있고 장면이 전체적으로 어떻게 보이는지를 알려 주고, 털이나 결, 표면 질감 같은 디테일은 생성기가 스스로 채우면 된다. 초록의 마지막 문장이 이 분업을 요약한다. 합성기는 시점 구조를 공급하고, 확산 모델은 디테일을 공급한다. 거친 단계에서 세밀한 단계로 나아가는 시스템은 많지만, 여기서는 거친 단계가 손으로 짠 기하 파이프라인이 아니라 과제에 맞게 end-to-end로 학습된 모듈이라는 점이 새롭다.
LEGO는 분포 자체에서도 정보를 더 끌어낸다. 대응 분포가 집중되어 있으면 합성기가 그 영역의 출처를 확신한다는 뜻이고, 분산되어 있으면 여러 후보가 경합해 결과를 믿기 어렵다는 뜻이다. 논문은 이 집중도를 영역별 신뢰도로 바꿔 두 곳에 쓴다. 하나는 저신뢰 영역을 가리는 것으로, 불확실한 신호를 생성기에 강요하지 않기 위해서다. 다른 하나는 전체 레이아웃이 형성되는 초기 노이즈 제거 단계에서 생성기를 고신뢰 영역으로 유도하는 것이다. 전체 구도가 확실한 곳에서 먼저 굳고 나머지가 뒤따른다. 조건이 확실한 곳에서는 더 따르고 불확실한 곳에서는 덜 따른다는 자연스러운 발상이다. 결과에 대해 초록은 LEGO가 최신 명시적 파이프라인을 일관되게 앞서며 재학습 없이 다른 데이터셋에도 일반화된다고 밝힌다. 다만 초록에는 구체적인 지표 값이 없어서, 향상 폭은 본문의 실험을 읽어야 판단할 수 있다. 두 가지는 짚어 둘 만하다. 첫째, 가려졌거나 한 번도 관찰되지 않은 영역은 결국 생성기가 상상으로 채워야 한다. 신뢰도는 어디까지 믿을 수 있는지를 시스템이 정직하게 구분하도록 도울 뿐, 입력에 없던 정보를 만들어 내지는 못한다. 둘째, 데이터셋 간 일반화가 어디까지 미치는지는 저자들이 시험한 데이터셋에 달려 있으므로 원문에서 확인해야 한다. 그럼에도 LEGO의 의의는 이 한 가지 과제에 그치지 않는다. 날카롭고 물리적으로 정확한 입력을 좇기보다 생성기의 강점에 맞춰 조건을 설계한다는 재사용 가능한 원칙을 내놓았기 때문이다. 영상 편집, 단안 재렌더링, 로봇 월드 모델처럼 기하 조건으로 확산 모델을 구동하는 과제들은 정확하지만 취약한 기하와 부드럽지만 견고한 구조 사이의 긴장을 똑같이 안고 있다. 실무자에게 주는 교훈은 구체적이다. 상류의 추정기가 자신 있게 틀려서 파이프라인이 무너진다면, 딱딱한 사상을 확률적 사상으로 바꾸고 그 불확실성을 유지한 채 디테일은 확산 모델에 맡겨 볼 만하다. LEGO는 영상에서 가장 제약이 적은 시점 합성 문제 중 하나에서 이 교체가 통할 수 있음을 보여 준다.
Sources
FAQ
LEGO에서 '리프팅 없음'은 무슨 뜻인가요?
깊이를 추정하지 않고, 포인트 클라우드를 만들지 않으며, 픽셀을 재투영하지 않는다는 뜻입니다. LVSM 방식 트랜스포머를 미세 조정해 1인칭 시점을 직접 렌더링하고, 시점 간 대응은 네트워크 내부에서 해결합니다. 이 결과가 비디오 확산 모델의 조건이 됩니다.
흐릿한 조건이 왜 확산 모델에 유리한가요?
저자들은 확산 모델의 노이즈 제거 학습이 디테일 복원에 뛰어나므로, 조건은 선명도보다 구조 정렬을 우선해야 한다고 주장합니다. 확률적 대응은 후보 원본 위치에 걸쳐 각 영역을 평균해 구조를 지키고 미세한 질감을 잃습니다. 명시적 파이프라인은 질감을 지키지만 깊이 오류를 엉뚱한 위치의 내용으로 바꿉니다.
영역별 신뢰도는 어떻게 얻고 어디에 쓰나요?
합성기는 영역마다 대응 분포를 학습하며, 분포가 집중될수록 내용의 출처를 더 확신한다는 뜻입니다. 논문은 이 집중도를 신뢰도로 삼아 저신뢰 영역을 가리는 데 쓰고, 레이아웃이 형성되는 초기 노이즈 제거 단계에서 생성기를 고신뢰 영역 쪽으로 유도하는 데에도 씁니다.