WOVEN: 시각적 세계 모델링을 멀티모달 LLM에 엮어 넣다
WOVEN은 시각적 전이 추론용 학습 데이터이자 벤치마크로, 20개 장면·5개 행동·8개 추론 유형의 36,076개 예제를 담았다. 38개 최신 MLLM은 모두 인간에 크게 못 미쳤다. 약 2,000개 부분집합 학습은 외부 벤치마크 26개 중 22개를 최대 27.3%p 개선했다.
멀티모달 대규모 언어 모델은 지난 두 해 동안 이미지 캡션, 문서 이해, 시각적 질의응답에서 빠르게 발전했다. 그러나 질문이 공간 관계, 체화된 상호작용, 물리 법칙, 시간의 흐름에 걸리는 순간 성능이 눈에 띄게 떨어진다. 로봇이 컵을 탁자 가장자리로 밀면 어떻게 되는가. 블록 탑에서 맨 아래 블록을 빼면 어떻게 되는가. 화면 속 물체는 1초 뒤 어디에 있는가. 이런 질문은 서로 달라 보이고, 오랫동안 독립된 약점으로 취급되어 각각 다른 벤치마크로 측정하고 다른 데이터로 보강해 왔다. 2026년 10월 8일 arXiv에 올라온 논문 WOVEN(2610.12417, 저자 Zheyu Fan, Yue Zhang, Mingkai Deng, Kangrui Wang, Qineng Wang 등)은 더 단순한 해석을 내놓는다. 이 실패들은 하나의 뿌리를 공유하며, 그것은 시각적 전이 추론의 결핍, 곧 어떤 행동이 장면에 가해진 뒤 화면이 어떻게 바뀔지 내부에서 추론하는 능력의 부족이라는 것이다.
이 가설의 가치는 새 능력에 이름을 붙인 데 있기보다 문제를 조직하는 방식을 바꾼 데 있다. 공간, 체화, 물리, 시간 추론의 실패가 실제로 같은 원천을 가진다면, 하위 과제마다 값비싼 라벨을 모을 필요가 없다. 시각적 전이 추론을 공유 학습 원시 요소로 삼아, 서로 다른 모델이 서로 다른 감독 원천에서 이를 배우고 서로 다른 과제에 재사용하면 된다. 논문의 목표는 바로 이 주장을 검증하고 체계적인 학습 레시피를 도출하는 것이다. 저자들은 기존 벤치마크가 결함을 따로따로 기록할 뿐 장면, 행동, 추론 연산을 가로지르는 통제된 비교를 허용하지 않는다고 지적한다. 따라서 평가만으로는 부족하고, 이 세 축으로 정리된 데이터원이 필요하다. WOVEN은 그 데이터원이며 벤치마크도 겸한다. 36,076개 예제로 이루어지며 20개 장면 유형, 5개 행동 유형, 8개 추론 유형에 걸쳐 있다. 자료는 비디오로 사전학습한 생성 모델이 만들어 낸 다양하고 사실적인 롤아웃에서 나온다. 생성 모델에 초기 프레임과 행동을 주면 결과를 펼쳐 보이고, 그렇게 얻은 프레임을 중심으로 질문을 만든다. 이 구조에는 실용적 이점이 있다. 두 축을 고정하고 나머지 한 축만 바꿀 수 있어, 전이의 성패를 결정하는 것이 장면인지, 행동인지, 추론 연산 자체인지 같은, 예전에는 답하기 어려웠던 질문을 던질 수 있다. 변수를 깔끔하게 분리한 것이 이 논문에서 방법론적으로 가장 배울 만한 선택이라고 본다.
평가 결과는 결함이 크고, 체계적이며, 끈질기다는 것을 보여 준다. 저자들은 GPT-5.4와 Qwen3-VL-235B-A22B를 포함한 38개 최첨단 멀티모달 모델을 시험했다. 가장 강한 모델도 인간에 크게 못 미친다. 같은 실패가 모델 계열을 넘나들며 반복되므로 특정 학습 파이프라인의 버릇이 아니다. 게다가 실패는 규모를 키워도 남는다. 이 마지막 점이 가장 중요하다. 파라미터와 범용 데이터를 늘리는 것만으로는 시각 상태의 변화를 추론하는 능력이 저절로 생기지 않는다는 뜻이기 때문이다. 이는 물리적 상식과 공간 추론에 관한 최근 평가들과 맞아떨어지며, 전용 감독 신호가 필요하다는 주장을 뒷받침한다. 학습 실험은 더 쓸모 있는 긍정적 결과를 내놓는다. 저자들은 여러 규모의 멀티모달 모델을 WOVEN으로 학습시켰고, 모델이 폭넓게 전이되는 공유 능력을 배운다는 것을 확인했다. 각각 약 2,000개 항목뿐인 학습 부분집합이 합쳐서 외부 벤치마크 26개 중 22개를 개선했고, 최대 27.3%p 향상되었다. 엔지니어링 팀에 더 실용적인 수치는, WOVEN 데이터가 과제 고유 학습 데이터의 30~50%를 비슷한 정확도로 대체할 수 있다는 점이다. 라벨이 비싼 체화 과제나 공간 과제에서는 감독의 일부를 범용 전이 추론 데이터가 맡을 수 있다는 뜻이다. 다만 주의가 필요하다. 이 수치는 저자들이 직접 보고한 것이며 26개 중 4개는 개선되지 않았으므로, 의존하기 전에 자체 과제에서 재검증해야 한다.
마지막으로 논문은 보류된 벤치마크에서 전향적으로 검증한 학습 레시피를 제시한다. 첫째 규칙은 감독 데이터를 보여 주는 행동, 장면, 도메인이 아니라 가르치는 추론 연산으로 고르는 것이다. 이는 통념과 어긋난다. 많은 팀은 로봇 과제를 개선하려면 로봇 장면 데이터를 모아야 한다고 생각하지만, WOVEN은 전이를 좌우하는 것이 예제가 어떤 추론 연산을 훈련시키는가라고 시사한다. 둘째 규칙은 시각 상태의 변화가 더 큰 예제를 우선하는 것이며, 이는 더 견고한 능력을 낳는다. 산업에 주는 함의는 데이터 큐레이션의 단위를 도메인에서 추론 연산으로 옮겨야 한다는 것이다. 월드 모델 학습이 영상 생성에만 의존할 필요도 없으며, 멀티모달 언어 모델이 전이 추론을 직접 배우게 하는 길도 투자할 가치가 있다. 한계는 남는다. 데이터가 생성 롤아웃에서 나오므로 그 생성기의 물리적 충실도가 감독 품질의 상한을 정하며, 후속 연구가 이 상한을 계속 검증해야 한다.
Sources
FAQ
시각적 전이 추론이란 무엇인가?
현재 장면과 행동이 주어졌을 때 행동 이후 장면이 어떻게 바뀔지 추론하는 능력이다. 밀린 물체가 어디로 구르는지, 블록을 빼면 탑이 무너지는지 같은 질문이 예다. WOVEN은 공간·체화·물리·시간 추론의 실패가 이 공통 결함에서 나온다고 가정한다.
WOVEN 학습 레시피의 핵심은 무엇인가?
보류된 벤치마크로 전향적으로 검증된 두 원칙이다. 첫째, 감독 데이터는 보여 주는 행동·장면·도메인이 아니라 가르치는 추론 연산으로 고른다. 둘째, 시각 상태 변화가 더 큰 예제를 우선해 견고성을 높인다.
이 연구에서 유의할 한계는 무엇인가?
데이터가 비디오 사전학습 생성 모델의 롤아웃에서 나오므로 그 물리적 충실도가 감독 품질을 제한한다. 개선 수치는 저자가 보고한 26개 벤치마크 중 22개이며 전부가 아니다. 도입 전 자체 과제에서 재검증해야 한다.