SafeHarness: 코딩 에이전트가 장애물을 피하게 하는 하네스

Published · AI Daily — AI-assisted deep research, methodology & disclosure

arXiv 논문(2609.20822)은 언어 모델이 제어기를 쓰는 로봇 코딩 에이전트가 안전 제약이 있는 과제 대부분에서 장애물에 부딪힌다고 밝힌다. 저자들은 경로 검증과 접촉 방향 선택을 하는 두 하네스 SafeHarness를 제안한다. GPT-6에서 SafeLIBERO 과제 성공률 71.9%, 충돌 회피율 87.5%를 달성했다.

논문이 보고하는 내용

arXiv의 새 논문 arXiv:2609.20822(분류 cs.RO, 2026년 9월 17일 제출)는 Bingxin Xu(USC), Yuzhang Shang(UCF), Zhen Dong(UCSB), Emilio Ferrara(USC)가 썼습니다. 저자들은 기존 연구가 던지지 않았다고 보는 질문을 제기합니다. 로봇 조작의 「코딩 에이전트」 방식에서는 언어 모델이 로봇 제어기를 프로그램으로 작성합니다. 이런 에이전트는 이제 로봇 전용 학습 없이도 로봇을 다룹니다. 그렇다면 이 방식은 안전할까요?

이를 확인하기 위해 저자들은 안전 제약 아래에서 코딩 에이전트를 평가합니다. 각 과제는 조작 목표 하나와, 로봇이 건드려서는 안 되는 장애물 하나를 짝지은 것입니다. 에이전트는 목표를 추구하다가 대부분의 경우 장애물에 부딪혔습니다. 그래서 논문은 에이전트 주변에 두 가지 「장애물 인식 하네스」를 두는 SafeHarness를 제안합니다. GPT-6을 기반 모델로 쓰면 SafeHarness는 SafeLIBERO 벤치마크에서 과제 성공률 71.9%, 충돌 회피율 87.5%에 도달합니다. 논문에 따르면 이는 기존 최고 수준보다 각각 6.5%, 27.0% 높고, 하네스가 없는 같은 에이전트보다 각각 2.3배, 1.5배 높습니다.

배경: 안전이 측정되지 않았던 이유

논문은 자신이 기대는 연구 흐름을 정리합니다. Code as Policies가 틀을 세웠습니다. 모델이 지각과 제어 API를 조합해 프로그램을 만들고, 그 프로그램이 곧 정책입니다. 이후의 에이전트는 실패한 뒤 제어기 코드를 다시 쓰고, 잘 통한 기술의 라이브러리를 유지하며, 신뢰성을 높이려고 테스트 시점의 계산을 더 씁니다. Harness VLA는 에이전트가 장면을 탐색하고, 잘 통한 방법을 기술 메모리로 저장하며, 과제가 접촉이 많은 단계로 넘어갈 때만 고정된 시각-언어-행동(VLA) 정책을 호출하게 합니다.

저자들은 이런 연구가 한 번의 실행을 목표에 도달했는지로만 채점하며, 로봇이 도중에 무엇을 건드렸는지는 전혀 측정하지 않는다고 주장합니다. 또한 성공이 안전을 뜻하지 않는다는 점을 보이려고 기존 연구를 인용합니다. 모델 세대가 바뀌는 동안 둘은 반대 방향으로 움직일 수 있고, 충돌 없는 시연 데이터를 열 배로 늘려 같은 정책을 학습시켜도 충돌률은 3포인트 미만만 낮아집니다. 저자들의 표현으로는, 과제를 끝내는 것과 다른 것을 건드리지 않는 것은 하나의 요구를 이루는 두 절반입니다.

진단: 제약이 우선순위가 되지 못한다

저자들은 먼저 로봇 안전 벤치마크에서 코딩 에이전트를 평가합니다. 에이전트는 과제를 완수하지만 대부분의 경우 장애물에 부딪힙니다. 논문은 쉽게 떠올릴 두 가지 설명을 배제합니다. 지각이 문제가 아닙니다. 에이전트는 장애물을 정확히 식별하고 추론 과정에서도 언급합니다. 지시가 문제도 아닙니다. 프롬프트가 이미 접촉을 금지하고 있습니다. 에이전트는 제약을 되풀이해 말한 다음 그것을 어깁니다.

논문은 결함이 계획에 있다고 보고, 각 조작 단계를 두 부분으로 나눕니다. 자유 공간을 지나는 경로에서 모델은 장애물을 비켜 가는 경로라는 개념이 없어서 가장 짧은 경로를 택합니다. 선택한 경로가 도중에 실행 불가능해질 때 다시 계획한다는 개념도 없습니다. 단계 끝의 접촉 순간에는 접촉 자체가 같은 안전 제약을 받는다는 사실을 모델이 인식하지 못합니다. 4.3절의 절제 실험에 따르면 더 강한 계획기를 써도 이 격차는 메워지지 않습니다.

3.4절은 한 가지 설명을 내놓습니다. 한 에피소드는 수백 단계로 이어지는 하나의 긴 대화입니다. 도구 호출과 이미지가 추가될 때마다 컨텍스트가 커져 수만 토큰에 이르지만, 장애물을 지목한 그 한 문장은 처음 부근에 머물러 있습니다. 저자들은 컨텍스트가 길어질수록 중간 내용의 회상, 지시 따르기, 시스템 프롬프트 준수가 모두 나빠진다는 연구를 인용합니다. 그들의 실행 기록에서 제약은 처음 몇 단계의 추론에는 나타나다가 이후에는 사라졌습니다.

SafeHarness의 작동 방식

SafeHarness는 접촉 사건을 경계로 과제를 여러 단계로 나누고, 두 하네스를 단계마다 한 번씩 실행합니다.

장애물 인식 경로 계획은 계획, 검증, 실행의 순환으로 돌아갑니다. 분할 모델(SAM-3)이 목표와 장애물을 경계 상자로 잡아냅니다. 언어 모델은 경유점으로 이루어진 꺾은선 경로를 제안하며, 이 경로는 목표에서 끝나야 하고 장애물 상자를 가로지르면 안 됩니다. 그런 다음 언어 모델 밖에 있는 검사가 경로를 상자와 대조합니다. 검사 대상은 그리퍼이고, 물체를 들고 있으면 물체도 포함합니다. 상자에 침범하는 경로는 거부되고 모델은 다시 계획합니다. 실행 중에도 재계획이 일어납니다. 예를 들어 팔이 걸려 멈추면 멈춘 자세에서 새 경로를 계획합니다. 하네스는 실행 중 경로 계획 이미지를 읽을 수 있는 횟수도 제한합니다. 같은 이미지를 되풀이해 읽어 봐야 컨텍스트만 길어지기 때문입니다.

장애물 인식 접촉 실행은 장애물과 접촉 대상이 인접한지 검사하는 것으로 시작합니다. 인접한 장애물이 없으면 어떤 전략이든 허용됩니다. 있으면 그리퍼는 간격을 유지하는 방향에서 접근하며, 그 가운데 장애물에서 가장 먼 방향을 고릅니다. 가능한 방향이 하나도 없으면 그리퍼를 돌려 열림 축이 장애물에 접하도록 하고, 짐을 수직으로 내립니다. 집는 곳과 놓는 곳 모두에서 같은 검사를 합니다.

벤치마크와 결과

SafeLIBERO는 LIBERO의 Spatial, Goal, Object, Long 스위트에서 각각 네 개의 과제를 가져와 장애물을 하나씩 더합니다. 장애물은 모카포트, 수납 상자, 우유팩, 와인병, 머그컵, 책 가운데 하나입니다. 과제 문장에는 장애물이 나오지 않습니다. 각 과제는 두 단계 수준으로 등장합니다. Level I에서는 장애물이 목표 가까이에 있어 집기나 놓기를 방해합니다. Level II에서는 목표에서 떨어져 있지만 운반 경로 위에 있습니다. 논문은 32개 과제에 과제당 10개의 시드를 사용하며, Harness VLA의 코딩 에이전트 루프, 고정된 π0.5 정책, 원래의 기술 메모리를 모두 그대로 재사용합니다. 따라서 차이는 두 하네스뿐입니다. 지표는 과제 성공률(TSR)과 충돌 회피율(CAR)입니다.

표 1의 평균 결과(퍼센트, TSR 다음 CAR)는 다음과 같습니다. OpenVLA-OFT는 26.2와 5.7, π0.5는 57.8과 17.1, AEGIS(π0.5 위에 장벽 함수 안전 계층을 얹은, 가장 강한 기존 방법)는 67.5와 68.9, GPT-5.5 기반 SafeHarness는 70.0과 86.0, GPT-6 기반 SafeHarness는 71.9와 87.5입니다. Long 스위트에서 AEGIS의 TSR은 46.3으로, 그것이 감싼 고정 정책의 54.3보다 낮습니다.

표 2의 절제 실험은 세 종류의 에이전트를 비교합니다. GPT-6에서 모델만 쓰면 TSR 6.0, CAR 50.0입니다. 저자들은 이 CAR이 의미가 없다고 말합니다. 팔이 일찍 실패하면 아무것도 건드리지 않기 때문입니다. 기술과 고정 VLA를 더하면 31.0과 59.0이 되고, 하네스를 더하면 71.9와 87.5가 됩니다. GPT-5.5에서는 기술만 있고 하네스가 없으면 28.0과 31.0, SafeHarness는 70.0과 86.0입니다. 논문의 결론은 여기서 안전성이 그것을 감싸는 모델이 아니라 하네스의 속성이라는 것입니다.

우리의 분석

눈여겨볼 점이 세 가지 있습니다. 첫째, 핵심 아이디어는 오래된 엔지니어링 습관을 새로운 자리에 적용한 것입니다. 프롬프트에 한 번 적힌 규칙을 믿지 말고, 중요한 순간에 도구로 다시 확인하라는 것입니다. 논문은 검증 도구가 대화에 대해 상태를 갖지 않으며, 긴 에피소드 동안 유지되어야 하는 불변 조건을 나르는 수단으로는 프롬프트보다 도구 인터페이스가 더 믿을 만하다고 말합니다.

둘째, 숫자는 꼼꼼히 읽어야 합니다. 6.5%와 27.0%는 표 1의 상대 차이(71.9 대 67.5, 87.5 대 68.9)와 맞아떨어지며, 포인트 차이가 아닙니다. 포인트 차이는 약 4.4와 18.6입니다. 어느 쪽으로 읽어도 향상은 있지만, 과제 성공률의 포인트 차이는 작습니다. 논문이 하네스 없는 같은 에이전트와 비교한 결과(40.9포인트와 28.5포인트)가 더 강한 증거입니다.

셋째, 절제 실험은 유용한 구분을 보여 줍니다. 더 강한 계획기는 어느 쪽에서 접근할지 같은 국소적 결정을 개선합니다. 기술만 있는 설정에서 Level I의 회피율은 18.8에서 69.0으로 오릅니다. 반면 Level II의 경로 안전에는 도움이 적어 향상이 6포인트에 그칩니다. 하네스를 더하면 계획기 사이의 차이가 줄어듭니다.

한계와 남은 질문

저자들은 스스로 한계를 밝힙니다. 평가는 SafeLIBERO를 따르므로 장면마다 장애물이 하나이고, 장애물 모델은 축에 정렬된 상자 하나입니다. 접촉 측면 검사는 평행 조 그리퍼에 맞춰 조정되었습니다. 그라운딩 품질은 분할 모델에서 오며, 그라운딩 실패는 충돌이 아니라 경로 거부로 나타납니다. 에피소드마다 계획에 몇 분이 듭니다. 평가는 우선 시뮬레이션에서 이루어집니다.

SafeHarness도 충돌이 전혀 없는 것은 아닙니다. 여전히 대략 여덟 에피소드에 한 번은 장애물을 움직입니다. 과제 성공률은 Level II에서 계속 더 낮습니다(GPT-5.5에서 64.0 대 76.0, GPT-6에서 62.5 대 81.2). 저자들은 검증된 우회 경로가 고정된 단계 예산 아래에서 에피소드를 길게 만들기 때문일 가능성이 가장 높다고 봅니다. 이는 검증된 결과가 아니라 추측입니다.

독자로서 우리의 한계도 있습니다. 우리는 논문 본문만 보았고 코드는 보지 못했으며, 일부 표의 값은 서술된 실험 절차와 맞춰 볼 수 없었습니다. 결과는 단일 벤치마크에서 나왔고, 실제 로봇 시험은 보고되지 않았습니다.

독자를 위한 실용적 시사점

물리 시스템이나 위험도가 높은 시스템용 LLM 에이전트를 만드는 팀은 세 가지 교훈을 가져갈 수 있습니다. 첫째, 목표 달성만이 아니라 부작용을 측정하십시오. 둘째, 엄격한 제약은 프롬프트 문장에만 두지 말고 에이전트가 반드시 통과해야 하는 검증기에 두십시오. 셋째, 실행 전에 계획을 검사하고, 검사기가 보지 못하는 상황을 위해 재계획 경로를 남겨 두십시오. 논문은 이런 도구 기반 접근이 작업 공간 제한과 힘 제한으로도 확장되리라고 기대하지만, 이는 기대일 뿐 결과가 아닙니다. 어떤 배포에 앞서서도 여러 장애물, 다른 그리퍼, 실제 하드웨어로 시험해야 합니다.

Sources

FAQ

이 논문은 어떤 문제를 다루나요?

로봇 조작용 코딩 에이전트가 안전한지 묻습니다. 각 과제에 건드리면 안 되는 장애물을 더하면, 에이전트는 목표를 추구하다가 대부분의 경우 장애물에 부딪힙니다.

SafeHarness는 에이전트에 무엇을 더하나요?

두 가지 장애물 인식 하네스입니다. 경로 계획은 물체를 경계 상자로 잡고, 모델이 경유점을 제안하게 하며, 모델 밖에서 경로를 검증하고 필요하면 다시 계획합니다. 접촉 실행은 장애물이 접촉 대상 옆에 있는지 검사하고 그에 따라 접근 방향을 고릅니다.

논문은 어떤 결과를 보고하나요?

GPT-6에서 SafeHarness는 SafeLIBERO에서 과제 성공률 71.9%, 충돌 회피율 87.5%를 달성합니다. 기술은 있지만 하네스가 없는 같은 에이전트는 31.0과 59.0입니다. 논문은 평가가 우선 시뮬레이션에서 이뤄졌고 SafeHarness가 여덟 에피소드에 한 번쯤은 여전히 장애물을 움직인다고 밝힙니다.