EyeRobot 2.0: 능동 응시로 손목 카메라 없이 정밀 조작

Published · AI Daily — AI-assisted deep research, methodology & disclosure

EyeRobot 2.0은 스테레오 카메라 하나로 사람처럼 두 눈 시점을 3차원 응시점으로 돌리고, 이미지 중심에 더 많은 시각 토큰을 줍니다. 계층적 강화학습이 시선을 제어하고, 그리퍼 동작은 응시 기준 SE(3) 좌표계로 표현합니다. 수동 스테레오는 실제 성공률이 52%에서 27%로 떨어지지만, 이 방법은 그보다 40% 높습니다. 손목 시야가 깨끗하면 ego+손목 방식과 비슷하고(69% 대 64%), 물체가 손목 카메라를 가리면 두 배 넘게 앞섭니다(48% 대 22%).

연구 배경: 로봇은 왜 "어디를 볼지" 정해야 하는가

정밀한 양손 조작에서는 시각 입력의 구성 방식이 정책의 성능 한계를 좌우합니다. 일반적인 구성은 머리(ego) 카메라에 양쪽 손목 카메라를 더하는 것입니다. 손목 카메라는 그리퍼에 가까워 파지와 삽입의 세부를 보여 줍니다. 하지만 대가가 있습니다. 추가 하드웨어, 배선, 캘리브레이션이 필요합니다. 더 까다로운 문제도 있습니다. 잡은 물체가 손목 카메라의 시야를 가리는 일이 흔합니다.

EyeRobot 2.0은 다른 길을 택했습니다. 사람의 시각에서 영감을 얻어 스테레오 카메라 하나만 쓰고, 사람처럼 장면 속 3차원 한 점을 "응시"하게 합니다. 논문은 이 방식을 능동 시각 응시(Active Visual Fixation, AVF)라고 부릅니다. 핵심 발상은 단순합니다. 모든 각도를 덮으려고 카메라를 늘리는 대신, 카메라 한 쌍을 그 순간 가장 중요한 곳으로 향하게 합니다.

핵심 구조: 함께 작동하는 세 요소

물리적 응시. 시스템은 3차원 응시점을 고르고, 좌우 두 "눈" 시점을 돌려 두 시선이 그 점에 모이게 합니다. 이미지를 잘라내는 것이 아니라 실제 기계적 회전입니다.

중심와(fovea)식 처리. 이미지를 네트워크에 넣을 때 중심부에 더 많은 시각 토큰을, 주변부에는 더 적게 배정합니다. 중앙은 고해상도, 가장자리는 저해상도인 사람의 중심와와 비슷합니다. 계산 자원이 작업과 관련된 특징에 집중됩니다.

계층적 시선 제어. 시선은 마음대로 움직일 수 없고 작업 진행과 맞아야 합니다. 논문은 두 단계 구조를 씁니다. 하위는 목표 물체를 조건으로 하는 시선 서보 정책으로, 눈을 그 물체로 향하게 합니다. 상위는 목표 선택기로, 작업 진행에 따라 다음 응시 목표를 내놓습니다.

학습 방식: 두 모듈 모두 실제 데이터 위의 강화학습

시선 서보 정책은 조밀한 기하 보상을 쓰는 강화학습으로 훈련합니다. 보상은 시선과 목표의 기하학적 정렬 정도를 직접 잽니다. 신호가 조밀해서 실제 로봇 학습에 적합합니다.

더 흥미로운 쪽은 상위 목표 선택기입니다. 이것은 행동 복제(BC) 그리퍼 정책과 함께 훈련됩니다. "어디를 봐야 하는가"에 대한 사람의 라벨은 없습니다. 선택기는 그리퍼 정책과 함께 최적화되는 과정에서 응시 순서를 스스로 찾아냅니다. 저자들은 이 순서가 사람이 같은 작업을 할 때의 응시 순서와 닮을 수 있다고 보고합니다. 시선 행동이 작업 성공이라는 목표만으로 자연스럽게 나타날 수 있음을 시사합니다.

행동 표현: 응시 기준 SE(3) 좌표계

EyeRobot 2.0은 응시점을 이용해 행동 학습도 단순하게 만듭니다. 그리퍼 정보를 응시 기준 SE(3) 좌표계로 정규화합니다. 그리퍼 자세는 로봇 베이스가 아니라 현재 응시점을 기준으로 표현됩니다.

이렇게 하면 학습할 행동 분포가 작아집니다. 위치와 방향의 변동 범위가 좁아져 정책이 더 쉽게 맞춥니다. 규모가 제한된 실제 원격 조작 데이터에서는 이 압축이 특히 유용합니다.

실험 설계와 주요 결과

저자들은 실제 작업 7개와 시뮬레이션 작업 6개의 원격 조작 데이터를 모았고, 1000회가 넘는 실제 시도와 1800회의 시뮬레이션 시도를 했습니다. 비교 대상은 같은 데이터로 훈련한 수동 스테레오 정책과 ego+손목 카메라 정책입니다. 주요 결과는 다음과 같습니다. - 손목 카메라를 빼면 표준 정책은 큰 손해를 봅니다. 수동 스테레오만 쓰면 실제 성공률이 52%에서 27%로 떨어집니다.

  • EyeRobot 2.0은 스테레오만으로 이 격차를 메웁니다. 수동 스테레오보다 실제에서 40%, 시뮬레이션에서 20% 높습니다.
  • 손목 시야가 깨끗할 때는 ego+손목 정책과 비슷합니다. 성공률은 69% 대 64%입니다.
  • 잡은 물체가 손목 카메라를 가릴 때는 48%를 기록하고, ego+손목 정책은 22%입니다. 두 배 이상입니다.

마지막 결과가 가장 많은 것을 말해 줍니다. 가림 상황에서 손목 카메라가 실패하는 것은 물리적 한계입니다. 능동 응시 카메라는 물체 바깥에 있어서 알맞은 각도로 접촉 영역을 계속 볼 수 있습니다.

비용과 지연의 절충

하드웨어 면에서는 손목 카메라를 없애고 스테레오 한 쌍만 남깁니다. 대신 두 시점을 돌리는 기구가 추가됩니다. 카메라 수를 기계적 자유도와 맞바꾸는 셈입니다. 계산 면에서는 중심와식 토큰 배정이 계산을 이미지 중심에 모아 주변부 비용을 원리상 줄입니다. 다만 초록에는 지연이나 연산량 수치가 없으므로 이런 이점은 전체 논문의 데이터로 확인해야 합니다. 시선 서보도 작업 내내 계속 돌아야 하므로 제어 루프가 더 복잡해집니다.

개발자와 산업에 주는 의미

로봇 팀에게 이 연구는 센서를 단순화하는 현실적인 방안입니다. 손목 카메라의 배선, 보정, 유지보수, 가림 문제는 양산과 장기 운용에서 실제 비용입니다. 회전하는 스테레오 한 쌍으로 같거나 더 나은 성공률이 나온다면 부품 목록이 짧아집니다.

학습 방법 면에서는 "인지도 행동"이라는 관점의 가치를 보여 줍니다. 시선은 수동적 입력이 아니라 학습하고 최적화할 수 있는 결정입니다. 응시 기준 행동 표현은 다른 모방 학습 프레임워크도 가져다 쓸 수 있습니다.

한계와 향후 방향

조심할 점이 몇 가지 있습니다. 첫째, 로봇 머리에 움직이는 눈 기구가 필요해서 기존 플랫폼에 그대로 달 수는 없습니다. 둘째, 실제 작업 7개는 탄탄한 규모이지만 아직 실험실 수준이며, 열린 환경으로의 일반화는 검증이 필요합니다. 셋째, 목표 선택기는 BC 정책과의 공동 훈련에 의존하므로 데이터 품질이 응시 순서의 품질에 영향을 줍니다. 넷째, 시선이 옮겨 가는 동안의 짧은 시각 불안정을 어떻게 다루는지는 전체 논문에서 확인할 부분입니다.

향후 방향으로는 능동 응시와 대형 비전-언어-행동 모델의 결합, 언어 지시로 응시 목표를 이끄는 방식, 더 긴 작업과 이동 조작에서의 검증, 더 가벼운 눈 기구 설계가 있습니다. 전체적으로 EyeRobot 2.0은 분명한 주장을 합니다. 로봇에게 어디를 볼지 가르치는 것이 카메라를 더 다는 일을 대신할 수 있다는 것입니다.

Sources