SCoR 시각적 RAG: 에이전트를 통한 명시적 맥락 선택과 증거 통합

Published · AI Daily — AI-assisted deep research, methodology & disclosure

이 연구는 시각적检索增强生成(VRAG)에서 증거를 활용하는 어려움에 초점을 맞춥니다. 기존 방법은 두 가지 도전에 직면합니다. 첫째, 답변 관련 시각적 증거가 희소하여 한 페이지의 지역적 영역에 집중되거나 여러 페이지에 분산될 수 있습니다. 둘째, 기존 에이전트 방법은 주로 원본 탐색 궤적이나 압축된 텍스트 기억을 기반으로 답변하므로, 명시적으로 조직된 지원 이미지 집합이 부족해 답변이 탐색 노이즈에 취약하고 증거 추론 체감이 가려집니다. 저자들은 병목이 증거 발견뿐만 아니라 답변 생성 전 증거 보존과 조직에 있다고 생각합니다. 그래서 탐색 단계에서 쿼리 관련 관측과 출처 포인터만 유지해 텍스트 원장에 기록해 시각적 맥락을 유계로 유지하고, 종료 시 원본 이미지를 다시 불러와 질서 있는 증거로 통합해 최종 추론과 탐색 시행착오를 분리하는 통합 에이전트 루프 'SCoR'을 제안합니다. 훈련에서는 필터링된 콜드스 tart 궤적 증류와 증거 인식 강화학습을 결합하고, 보상 함수로 증거 커버리지, 통합 압축성, 답변 정확성을 모두 고려합니다.

배경

시각적检索增强生成, 일명 VRAG는 이미지가 풍부한 문서를 탐색하고 관련 페이지 이미지를 시각적 증거로 검색한 뒤 그 내용을 추론하여 사용자 질문에 답하는 방식을 취합니다. 문서 질문답변이나 차트 이해 등에서 큰 잠재력을 지닌 이 패러드는 존재하지만, 실제로 검색된 시각적 증거를 어떻게 효과적으로 활용할 것인가는 오랫동안 두 가지 구조적 장벽에 묶여 있었습니다. 첫 번째로 답과 진정으로 연관된 증거는 극도로 희소합니다. 한 페이지의 국소적 소규모 영역에만 집중되어 있기도 하고 여러 페이지에 흩어져 분포하기도 하여 검색과 위치 파악을 어렵게 합니다. 두 번째로 기존 에이전트 방식은 명시적으로 조직되고 추적 가능한 지원 이미지 집합보다는 원본 탐색 궤적이나 압축된 텍스트 기억에 의존해 답합니다. 이로 인해 답이 탐색 과정에서 발생하는 노이즈에 취약해지고, 분명해야 할 증거 기반 추론 체가 가려집니다.

저자들은 진짜 병목이 증거 발견에만 있는 것이 아니라 답변 생성 전에 증거를 어떻게 보존하고 조직하느냐에 있다고 진단합니다. 이 관전 전환은 단순 검색 성능을 넘어 증거의 보존, 구조화, 추적 가능한 활용으로 연구 초점을 이동시킵니다. SCoRE는 바로 이 같은 통찰에서 출발한 통합 에이전트 루프框架로, 명시적 증거 선택과 통합을 하나로 묶어 증거 희소성과 조직된 증거의 부재라는 두 난제를 한 메커니즘으로 해결하려 합니다.

심층 분석

SCoRE는 명시적 증거 선택과 통합을 결합한 통합 에이전트 루프가 핵심 기여입니다. 탐색 단계에서 모델은 문서를 탐색하고 검색하지만 모든 원본 관측을 바로 최종 추론에 넣지 않습니다. 대신 쿼리 관련 관측과 출처 포인터만 남겨 지속적으로 유지되는 텍스트 원장에 기록합니다. 이렇게 하면 초기에 발견된 중요한 증거는 보존하면서도 시각적 맥락을 유계 범위 안에 가둘 수 있어, 페이지가 너무 많아져 발생하는 맥락 폭발을 막습니다.

탐색이 끝나고 답변 단계로 들어가면 시스템은 원장指针를 따라 인용된 원본 이미지를 다시 불러와 논리적으로 정렬된 증거 집합으로 통합한 뒤 최종 답을 생성합니다. 이 설계는 두 가지 중요한 해방을 이룹니다. 첫째 최종 추론을 탐색의 시행착오와 분리하여 답이 탐색 노이즈로부터 직접적으로 오염되는 것을 막습니다. 둘째 색인화된 논증-이미지 링크를 통해 모든 결론을 해당 원본 이미지로 역추적할 수 있어 엄격한 시각적接地를 보장합니다.

훈련은 통합 roll-out의 엔드투엔드 최적화 방식으로, 필터링된 콜드스tart 궤적 증류와 증거 인식 강화학습을 결합합니다. 콜드스tart 단계는 어느 정도 품질을 갖춘 기초 궤적을 제공하고 이후 비효율적이거나 잘못된 샘플을 걸러내 신뢰할 수 있는 학습 시작점을 마련합니다. 강화학습 단계는 증거 충분히지, 통합된 증거의 압축성, 최종 답 정확성이라는 세 목표를 동시에 추진하는 특별히 설계된 보상 함수를 사용해 탐색과 통합 사이의 균형을 맞춥니다.

산업 영향

이 작업은 VRAG를 위한 재사용 가능한 설계 패러드를 제시합니다. 연구 초점을 '증거를 검색할 수 있느냐'에서 '증거를 보존하고 조직하며 추적할 수 있느냐'로 확장함으로써, 이미지가 풍부하고 방대한 실제 문서 처리에 현실적 의미를 갖습니다. 색인화된 논증-이미지 링크를 결합한 텍스트 원장은 맥락 비용을 통제하면서도 결론의 해석 가능성과 검증 가능성을 보장하여, 기업 문서 지능, 계약 검토, 기술 매뉴얼 질문답변 등 신뢰도에 대한 요구가 높은 배포 환경에 매우 적합합니다.

증류와 증거 인식 강화학습을 결합한 훈련 패러드는 에이전트형 모델의 엔드투엔드 최적화를 위한 참고 경로를 제공하며, 훈련 난도를 낮추고 안정성을 높이는 데 도움이 될 수 있습니다. 오픈소스 커뮤니티에서는 통합 에이전트 루프와 증거 통합 접근법이 시각적 추론, 멀티모달 에이전트, 장문서 이해 등 방향에서 새로운 기준선과 개선 공간을 제공할 것입니다.

전망

실험은 시각적 질문답변이라는 핵심 작업을 중심으로 관련 데이터셋과 벤치마크에서 전반적 성과와 각 설계의 유효성을 검증합니다. 지표는 답 수준의 정확성뿐만 아니라 증거 수준의 커버리지와 통합 품질을 모두 포함하여, 모델이 실제로 관련 증거를 찾았는지, 압축적으로 조직했는지, 신뢰할 수 있는 답을producing하는지 측정합니다.消融 실험은 텍스트 원장이 시각적 맥락을 통제하면서 중요한 증거를 보존하는지, 증거 재불러오고 통합이 시각적接地를 향상시키는지, 각 보상 목표가 독립적으로 기여하는 정도를 분리해 검증합니다.

실험결과는 명시적 선택과 통합을 통해 모델이 희소 증거 상황에서도 안정적인 답 품질을 유지하며, 탐색 노이즈가 최종 결론에 미치는 간섭이 크게 줄어들고, 증거 기반 추론 체가 더 명확하고 추적 가능해진다는 것을 보여줍니다. 이러한 발견은 증거 활용 효율성과 추론 신뢰성이라는 이중 이점을 검증하며, 높은 stakes 환경에서 더 신뢰할 수 있는 멀티모달 문서 이해 방향으로 나아갈 것임을 시사합니다.

Sources

FAQ

SCoRE란 무엇인가요?

SCoRE는 시각적 RAG를 위한 통합 에이전트 루프입니다. 탐색 중에는 쿼리 관련 관측과 출처 포인터만 텍스트 원장에 기록하고, 종료 시 원본 이미지를 다시 불러와 정리된 증거로 통합해 답변합니다.

SCoRE가 왜 중요한가요?

희소하거나 여러 페이지에 흩어진 시각적 증거 문제를 해결하고, 텍스트 원장으로 맥락을 제한해 탐색 노이즈와 최종 추론을 분리하며, 각 결론을 원본 이미지에 근거시켜 정확성과 추적 가능성을 높입니다.

앞으로 무엇을 주목해야 하나요?

기업 문서 QA, 계약 검토, 장문서 추론 같은 실용 영역과, 증류 및 증거 인식 강화학습 훈련 방식의 오픈소스 확산 여부, 그리고 다중모달 에이전트 연구의 새로운 기준선이 주목할 만합니다.