쓸모없다고 판단하고도 계속 질의한다: 도구 사용 에이전트는 자신의 증거 판단을 정지 결정으로 바꾸지 않는다

Published · AI Daily — AI-assisted deep research, methodology & disclosure

의도적으로 실패하는 정보원이 있는 검색 환경에서 에이전트 7개를 시험한 실증 연구입니다. 에이전트는 쓸모없는 결과를 97~100% 비율로 쓸모없다고 판정했지만 대부분 질의를 계속했고, 판단이 정지 결정으로 이어지지 않았습니다. 프롬프트, 메모리, 추론 모드, 예산은 멈추는 시점만 바꾸고 기준은 바꾸지 못했습니다. 쓸모없는 결과가 연속 5번 나오면 반드시 답하게 하는 통합 단계만이 정지를 증거와 정렬했습니다. 새 질문 300개의 사전 등록 재현 실험이 이를 확인했습니다.

논문이 던지는 질문

이 논문은 Chubin Zhang, Zhenglin Wan, Xingrui Yu, Jingxuan Wu, Yaxin Zhou, Ivor Tsang, Bo An이 쓴 것으로, 2026년 10월 5일 arXiv(2610.06191)에 제출되었습니다. 질문은 단순합니다. 도구가 쓸모없는 결과만 계속 돌려줄 때, 에이전트는 그 도구에 기대는 것을 멈출까요? 상식적으로는 멈출 것 같습니다. "이 결과는 쓸모없다"고 판단할 수 있는 에이전트라면, 같은 판단이 여러 번 이어진 뒤에는 방향을 바꾸거나 가진 정보로 답해야 합니다. 그러나 저자들은 대부분의 에이전트가 그렇게 하지 않는다는 것을 보였습니다.

연구팀은 검색 환경에서 에이전트 7개를 시험했습니다. 환경에는 일부러 실패하도록 만든 정보원이 있어, 도구가 가치 없는 내용을 계속 반환합니다. 에이전트는 이런 결과를 97%에서 100%의 비율로 "쓸모없음"이라고 판정했습니다. 증거에 대한 판단은 거의 정확했던 셈입니다. 그런데도 대부분은 계속 질의했습니다. 논문 제목은 이 현상을 "쓸모없다고 판단하고도 계속 질의한다"로 요약합니다.

핵심 발견: 판단과 행동의 단절

핵심어는 단절입니다. 에이전트의 무의미한 반복은 흔히 도구 출력을 읽지 못하거나 결과의 질을 평가하지 못해서라고 설명되어 왔습니다. 이 논문은 시험한 에이전트에 대해서는 그 설명을 배제합니다. 97%~100%라는 판정률은 모델이 결과가 쓸모없다는 것을 안다는 뜻입니다. 문제는 그다음 단계, 즉 판단이 "멈춘다"는 행동으로 이어지지 않는 데 있습니다.

판단과 행동을 따로 재기 위해, 저자들은 쓸모없다고 판정된 결과가 길게 이어진 뒤의 정지 행동과 짧게 이어진 뒤의 정지 행동을 비교했습니다. 에이전트가 자신의 판단으로 결정한다면, 쓸모없는 결과가 길게 이어질수록 더 멈추기 쉬워야 합니다. 논문은 대부분의 에이전트에서 이런 증거 민감성이 나타나지 않았다고 보고합니다. 이 설계의 장점은 "언제 멈추는 것이 옳은가"를 외부 라벨에 의존하지 않고, 에이전트의 행동이 에이전트 자신의 판정과 일치하는지를 직접 검증한다는 점입니다.

통하지 않은 개입과 통한 개입

저자들은 흔한 완화책을 시도했습니다. 프롬프트 속 안내 문구, 메모리 접근, 서로 다른 추론 모드, 예산 제약입니다. 결과는 신중한 편입니다. 이 방법들은 멈추는 시점은 바꾸었지만 멈추는 기준은 바꾸지 못했습니다. 더 일찍 또는 더 늦게 멈출 수는 있어도, 증거가 쌓여서 멈추는 것은 아닙니다. 예산 상한이 가장 분명한 예입니다. 반복을 강제로 끊지만 증거와는 무관합니다. 에이전트 자신의 결정이 아니라 바깥에서 거는 브레이크입니다.

효과가 있었던 것은 "강제 통합 단계"였습니다. 쓸모없는 결과가 연속 다섯 번 나오면, 에이전트는 이미 가진 정보로 반드시 답해야 합니다. 정지 결정을 에이전트의 재량에서 실행 환경의 규칙으로 옮긴 것입니다. 논문에 따르면 이로써 정지 행동이 증거와 정렬되었습니다. 이어서 저자들은 새로운 질문 300개로 사전 등록된 재현 실험을 수행했고, 단절이 실재한다는 점과 개입이 효과적이라는 점을 모두 확인했습니다. 사전 등록은 가설과 분석 계획을 데이터를 보기 전에 고정하므로, 결과를 골라 보고할 위험을 낮춥니다.

작동 원리에 대한 합리적 해석

초록은 메커니즘을 완전히 설명하지 않습니다. 아래는 보고된 결과에 근거한 우리의 추정이며 저자의 주장이 아닙니다. 한 가지 가능성은, 학습 데이터에 "한 번 더 물어봐도 해롭지 않았던" 궤적이 많아서 도구를 다시 부르는 것이 기본 행동이 되었다는 것입니다. "쓸모없다"는 평가는 글로 쓴 문장일 뿐이어서 다음 행동의 확률을 자동으로 바꾸지는 않습니다. 또 다른 가능성은, 판정은 개별 결과에 대한 국소적 작업인 반면 정지는 궤적 전체의 누적을 따져야 해서 작은 모델에는 더 어렵다는 것입니다. 통합 단계가 통하는 것은 누적 관리를 외부 카운터에 맡기고 모델에게는 답만 요구하기 때문일 수 있습니다.

개발자와 기업에 주는 영향

첫째, 비용입니다. 불필요한 도구 호출은 지연과 비용을 늘립니다. 검색 증강 생성, 웹 탐색, 코드 검색에서 헛도는 반복은 곧바로 청구서에 나타납니다. 둘째, 신뢰성입니다. 죽은 정보원에서 헛도는 에이전트는 시간 초과에 빠지거나 마지막 순간에 근거가 빈약한 답을 내놓을 수 있습니다. 셋째, 설계 방침입니다. 모델이 스스로 멈출 때를 알아내리라 기대하지 말고, 오케스트레이션 층에 "쓸모없는 결과가 N번 이어지면 답을 강제한다" 같은 결정적 규칙을 넣는 것이 현실적입니다. 구현이 쉽고 어떤 에이전트 프레임워크에도 적용되며 재학습이 필요 없습니다.

평가에도 시사점이 있습니다. 많은 에이전트 벤치마크는 최종 답의 정오만 보고 낭비된 호출은 거의 재지 않습니다. 이 논문의 방법은 먼저 판정이 정확한지, 다음으로 행동이 판정을 따르는지를 확인하는 재사용 가능한 진단입니다. 둘을 나누면 실패 원인이 오독인지 불이행인지 가를 수 있습니다.

한계와 남은 질문

몇 가지 한계는 분명히 짚어야 합니다. 초록에 따르면 시험 대상은 70억~80억 파라미터 규모의 모델이며 구체적인 이름은 나와 있지 않습니다. 따라서 더 큰 최첨단 모델에도 결과가 적용되는지는 전문을 확인하거나 후속 연구를 기다려야 합니다. 실험 환경은 일부러 실패시킨 정보원이고, 현실의 실패는 더 모호합니다. 부분적으로 유용한 결과나 때에 따라 품질이 달라지는 정보원에서는 고정된 "다섯 번" 기준이 너무 이르거나 늦을 수 있습니다. 강제로 답하게 하면 증거가 부족한 채로 답하게 되므로 답변 품질에 미치는 영향은 과제별로 살펴야 합니다. 마지막으로, 프롬프트와 예산이 시점만 바꾼다는 결과가 더 나은 방법이 없다는 증명은 아닙니다. 증거에 따른 정지를 강화학습으로 직접 보상하는 훈련은 자연스러운 다음 단계입니다.

정리

이 논문은 "에이전트가 루프에 빠졌다"는 막연한 불만을 두 부분으로 나눕니다. 모델은 판단할 수 있지만 자기 판단대로 행동하지 않는다는 것입니다. 저자들이 제안한 해법은 단순하고 재현 가능합니다. 엔지니어에게 주는 교훈은, 정지 결정을 에이전트 설계의 일급 요소로 다루고 모델의 양식에 맡기지 말라는 것입니다.

Sources