Gemini Robotics ER 2 공개: 영상 이해, 작업 오케스트레이션, 다중 로봇 협업으로 로봇의 상위 두뇌를 구현

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Google DeepMind가 가장 뛰어난 체화 추론 모델 Gemini Robotics ER 2를 공개했다. 로봇의 상위 두뇌로서 대화, 물리 세계 이해, 다단계 계획을 맡고 모터 실행은 하위 VLA 모델에 넘긴다. 연속 영상으로 진행을 추적해 실수를 바로잡으며 다중 로봇 협업을 처음 지원한다. Gemini API와 Google AI Studio에서 쓸 수 있고 기업용은 비공개 프리뷰다.

Google DeepMind는 로봇공학용으로 자사에서 가장 뛰어난 '체화 추론(embodied reasoning)' 모델이라며 Gemini Robotics ER 2를 공개했다. 공식 블로그 글은 Steven Hansen과 Peng Xu가 작성했고 페이지 날짜는 2026년 7월 30일이다. 위치는 분명하다. 모터를 직접 구동하는 모델이 아니라 로봇의 '상위 두뇌'다. 발표 내용 구글 설명에 따르면 Gemini Robotics ER 2를 쓰면 로봇이 사람과 대화하고, 물리 세계를 이해하고, 여러 단계로 된 작업을 계획할 수 있다. 구체적인 모터 실행은 임의의 하위 비전-언어-행동(VLA) 모델에 넘긴다. Google 검색 같은 도구와 사용자 정의 함수도 기본으로 호출할 수 있다. 이전 세대인 Gemini Robotics ER 1.6보다 크게 개선됐다고 하며, 핵심은 연속 영상 이해, 도구와 작업의 오케스트레이션, 그리고 처음 도입된 다중 로봇 협업이다.

제공 방식은 이렇다. Gemini API와 Google AI Studio를 통해 개발자에게 공개 제공되고, Gemini Enterprise Agent Platform에서는 비공개 프리뷰다. 모델 설정 방법과 더 쓸모 있는 물리 AI 작업을 위한 프롬프트 예시도 함께 공개됐다. 작동 방식: 위에서는 추론, 아래에서는 제어 구글은 일상 환경에서 사람을 돕는 로봇에는 정확한 공간 추론만으로 부족하다고 말한다. 로봇은 빠르게 생각하고 물리 세계의 실시간 속도에 맞춰 결정 시점을 잡아야 한다. 그래서 ER 2는 현재 동작을 수행하는 동안 다음에 할 일을 동시에 생각할 수 있게 설계됐다.

개발자가 쓰는 방식은 에이전트 구성이다. VLA 모델이나 내비게이션 API 같은 저수준 제어 인터페이스를 도구로 선언하고, 멀티모달 영상·음성·텍스트를 모델에 직접 스트리밍한다. ER 2는 어떤 도구를 어떤 인자로 호출할지, 보이는 상황에 따라 다음에 무엇을 할지 결정한다. 소프트웨어 에이전트가 쓰는 함수 호출 방식과 같지만, 도구가 움직이고 물건을 잡는 물리 시스템이라는 점이 다르다. 구글은 ER 2가 Gemini Live API에 통합돼 있다고도 밝혔으나, 확인한 원문 발췌는 이 문장에서 끊겨 있어 자세한 내용은 공식 문서를 봐야 한다. 이런 계층 구조에는 실용적인 이점이 있다. 추론 모델과 제어 정책을 따로 개선할 수 있다. 로봇 제조사는 동작 모델을 다시 학습하지 않고도 계획 능력을 높일 수 있고, 상위 논리를 고치지 않고 하위 제어기를 바꿀 수 있다. 영상 피드백 루프 기존의 '계획 후 실행' 방식은 명령을 보내면 성공했다고 가정하기 쉽다. ER 2는 연속 영상 피드를 본다. 덕분에 로봇은 자신의 진행 상황을 추적하고, 문제가 생기면 방식을 조정하고, 다음 단계로 넘어갈 시점을 정확히 안다. 물건이 미끄러지거나, 문이 덜 닫히거나, 사람이 목표물을 옮기는 물리 세계에서 이는 중요하다. 결과를 보는 상위 모델만이 이런 어긋남을 알아채고 바로잡을 수 있다.

오케스트레이션 평가 방식 구글은 모델을 시뮬레이션 속 로봇, 실제 로봇 제어, 그리고 사람이 원격으로 로봇을 조종하는 구성과 짝지어 평가할 수 있다고 설명한다. 발표된 결과는 실제 VLA, 시뮬레이션 VLA, 사람 원격 조종의 세 가지 제어 모드 모두에서 ER 2가 도구 오케스트레이션에서 ER 1.6을 일관되게 앞선다는 것이다. 정확히 말하면 확인한 발췌에는 구체적인 벤치마크 점수, 지연 시간, 가격이 없다. 따라서 개선 폭을 수치로 판단할 수 없다. 다중 로봇 협업 ER 2는 다중 로봇 협업을 도입했다. 로봇들이 공유 공간에서 함께 일하며 로봇 한 대로는 해낼 수 없는 복잡한 워크플로를 완수한다. 원리상 하나의 상위 모델이 작업을 나누고 역할을 배정해 여러 로봇을 순차 또는 병렬로 조율할 수 있다. 물류 창고, 공장, 실험실 자동화에서는 단일 로봇 시연에서 협업 작업 셀로 넘어가는 한 걸음이다. 발췌에는 조율 메커니즘이나 대수 상한이 나오지 않으므로 개발자가 직접 검증해야 한다. 개발자와 기업에 주는 의미 개발자에게는 진입 장벽이 낮아진다. Gemini API로 영상을 이해하고 도구를 호출하는 플래너를 쓸 수 있어, 체화 추론 스택을 처음부터 만들 필요가 없다. 기업에는 비공개 프리뷰가 안전성, 규정 준수, 통합 비용을 통제된 조건에서 평가할 기회가 된다. 생태계 전체로는 상위 추론과 하위 제어가 분리되면서 분업이 뚜렷해진다. 모델 업체는 범용 두뇌를 제공하고, 로봇 제조사와 VLA 연구자는 동작과 조작 능력에 집중한다.

과제와 전망 남은 질문이 몇 가지 있다. 먼저 지연 시간이다. 클라우드 API로 호출하는 상위 모델이 매우 빠른 반응이 필요한 작업을 감당할 수 있는지 실측이 필요하다. 다음은 신뢰성과 안전이다. 영상 판단이 틀리면 로봇이 잘못된 믿음으로 계속 움직일 수 있어 하드웨어 안전 한계와 사람의 감독이 여전히 필수다. 비용과 규모도 변수다. 다중 로봇 구성은 추론 호출을 늘리므로 가격과 할당량이 사업성을 좌우한다. 마지막으로 체화 추론 모델을 비교할 공개적이고 재현 가능한 벤치마크가 업계에 필요하다. 종합하면 Gemini Robotics ER 2는 로봇의 계획, 감독, 협업 능력을 호출 가능한 서비스로 묶었다. 어수선한 실제 현장에서 약속을 지킬 수 있을지는 독립적인 평가와 초기 고객의 후기에 달려 있다.

Sources