Where-OPD: 합성 장면의 공간 단서로 유도하는 멀티모달 모델의 온폴리시 자기 증류

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Where-OPD는 합성 기하 장면에서 얻은 물체의 좌표와 개수를 고정 교사에게만 제공한다. 학생은 자신이 생성한 접두 시퀀스에서 교사의 토큰 분포를 학습하고 추론 때는 이미지와 질문만 사용한다. 논문은 세 모델에서 계수·도표·문서 이해의 향상을 보고한다. Qwen3.5-4B의 실제 이미지 평가 7종 평균은 3.23%포인트 올랐지만 일부 지표는 하락했고, 주의력 시각화만으로 기제를 입증할 수 없다.

배경과 문제 정의

멀티모달 모델이 시각 질문에 틀리는 이유는 답을 문장으로 만드는 단계보다 앞선 증거 수집에 있을 수 있다. 개수를 세려면 조건에 맞는 물체를 빠짐없이 찾아야 하고, 도표를 읽으려면 범례와 축, 떨어진 데이터 값을 연결해야 한다. 한 영역을 확대하는 방법은 작은 글씨를 읽는 데 유용하지만 여러 영역을 종합하는 능력과 동일하지 않다. Where-OPD는 교사에게 질문 관련 물체의 위치를 글로 제공하는 방법을 시험한다. 훈련 데이터는 겹치지 않는 색깔 도형의 단순한 합성 장면이다. 따라서 실제 사진으로의 전이는 지정된 평가에서 관측한 결과이지, 모든 실제 환경에 대한 보장은 아니다.

핵심 구조와 기술 원리

장면 생성기는 렌더링 전에 각 물체의 색상·모양 범주, 반지름, 중심 좌표와 배경색을 알고 있다. 존재하는 목표 범주를 고르고 해당 물체의 좌표를 모두 모아 문장 힌트를 만든다. 힌트에는 좌표뿐 아니라 최종 개수도 포함된다. 학생은 이미지와 질문만 받고, 고정된 동종 교사는 이 힌트까지 받는다. 현재 학생이 답변 시퀀스를 생성하면 교사는 학생이 실제 방문한 각 접두 상태에서 다음 토큰의 확률 분포를 계산한다. 학생 분포를 그 분포에 가깝게 학습시키므로 별도의 교사 답변만 모방하는 것보다 학생 자신의 진행 경로를 감독한다. 추론 때 교사와 힌트는 필요 없다.

그러나 교사가 정답 개수도 본다는 점은 가장 중요한 해석상의 한계다. 본 실험만으로 학생이 위치 탐색을 배웠는지, 정답이 담긴 교사의 답변 양식을 익혔는지 구분할 수 없다. 논문은 정답만 제공한 경우와 위치만 제공하되 합계를 뺀 경우를 따로 비교한다. 시험한 설정에서는 교사를 고정했을 때 평균이 가장 높고, 지수 이동 평균으로 교사를 갱신하면 대체로 떨어졌다. 또한 훈련에는 학생의 샘플 생성과 교사의 채점이 모두 필요하므로 일반적인 지도 미세조정과 비용을 같게 볼 수 없다.

실전 평가와 결과

평가 모델은 Qwen3.5-4B, Qwen3.5-9B, Qwen3-VL-4B이다. 기본 평가는 사고 모드를 끄고 탐욕 디코딩을 사용한다. Qwen3.5-4B의 15개 벤치마크 비가중 평균은 73.86에서 78.31로 4.45포인트 상승했다. CountQA는 32.00에서 34.53, ChartQA는 79.32에서 86.52, EvoChart는 68.32에서 78.43, OCRBench는 87.30에서 89.23이 됐다. 실제 이미지 평가 7종의 평균 개선 3.23포인트는 이 4B 모델과 해당 평가 집합에 관한 수치다. 다른 두 모델의 대응하는 평균 개선은 1.07과 1.29포인트로 보고됐다.

하락 사례도 있다. 4B 모델의 HR-Bench 4K는 0.63포인트 낮아졌다. 9B 모델은 CVBench, BLINK, ZoomBench에서 각각 0.05, 0.62, 0.32포인트 하락했다. 비교 방식인 Vision-OPD는 4B 모델의 V*와 ZoomBench를 각각 8.90, 14.56포인트 높였지만 CountQA를 10.73포인트 낮췄다. 동일한 합성 장면 3천 개로 학습한 7개 평가의 평균은 원본 69.63, 지도 미세조정 69.70, GRPO 69.56, 정답만 제공한 증류 71.27, 위치만 주고 합계를 뺀 증류 72.35, 완전한 Where-OPD 72.94이다. 이는 위치 정보가 정답만의 효과보다 더 기여함을 시사하지만 합계의 추가 효과도 남는다. 주의력 지도 몇 장은 설명 자료이지 인과적 탐색의 증명이 아니다.

산업적 의미와 향후 과제

이 방식의 실용적 출발점은 장면 생성기가 이미 가진 구조화된 정답을 임시 교사 정보로 바꾸는 데 있다. 물체마다 사람이 경계 상자를 그리거나 별도 위치 교사를 만드는 부담을 줄일 수 있다. 여러 영역을 함께 읽는 계기판, 문서, 도표로 확장할 가치는 있으나 가림, 작은 글씨, 낯선 배치에서의 운영 성능은 아직 확인되지 않았다. 다음 검증은 샘플별 개선과 악화를 짝지어 기록하고 누락·중복 계수, 좌표 오차와 합계 교란에 따른 변화를 측정해야 한다. 훈련 비용과 취약한 하위 집단의 성능도 필요하다. 현재 확인 가능한 결론은 논문에 명시된 조건에서 합성 계수 학습이 지정된 실제 이미지 평가로 전이됐다는 것이다.

[원문](https://arxiv.org/html/2610.02117v1)

Sources

FAQ

교사만 받는 정보는 무엇인가?

생성기에서 얻은 목표 물체의 좌표와 전체 개수를 적은 문장이다. 학생은 추론할 때 이를 받지 않는다.

3.23포인트는 무엇을 뜻하는가?

Qwen3.5-4B의 실제 이미지 평가 7종에서 보고된 평균 향상 폭이다.