CAFE: 자기진화하는 검색 에이전트는 공진화하는 피드백이 필요합니다

Published 2026-08-25 · AI Daily — AI-assisted deep research, methodology & disclosure

본 논문은 강화학습에서 결과 감독형 검색 에이전트가 직면하는 근본적인 문제를 연구합니다. 이러한 에이전트는 언제 어떻게 증거를 검색해야 할지 배워야 하지만, 최종 보상은 중간 단계의 오차를 위치시킬 수 없고 오차가 누적되기 전에 진행 중인 궤적을 수정할 수 없습니다. 저자들은 수정 피드백을 학습된 궤적 내 개입으로 보며, 이를 통해 에이전트와 비평가라는 두 역할을 결합합니다. 에이전트는 언제 피드백을 요청하고 사용할지 결정해야 하고, 비평가는 결과가 혼재되어 있으며 에이전트의 개선에 따라 실패 패턴이 변하는 궤적에서 유용한 수정을 추론해야 합니다. 이를 위해 저자들은 공유 매개변수 모델을 사용하여 검색 에이전트와 비평가 역할을 번갈아 사용하는 CAFE(Coupled Agent-Feedback Evolution, 결합형 에이전트-피드백 진화) 프레임워크를 제안합니다. CAFE는 베이스 에이전트의 실패를 중심으로 구성된 궤적에서 피드백 조건부 복원을 초기화하고 온라인 및 오프라인 최적화를 결합합니다. 온라인 강화학습 단계에서는 프롬프트 수준의 호출-건너뛰기 성공 격차가 피드백 요청에 대한 보상을 형성하고, 피드백 이점의 재가중화로 피드백 전후의 토큰 이점을 조정합니다. 오프라인 단계에서는 매칭된 성공 및 실패 궤적을 통해 피드백을 학습합니다. 일곱 개 agentic 검색 벤치마크에서 CAFE는 평가된 강화학습 기반 검색 에이전트보다 평균적으로 우위를 차지하며, 여섯 개의 도메인 외 벤치마크에서 이점을 유지하고 답변 수준의 환각을 줄입니다. 단측 아블레이션은 에이전트 또는 비평가 중 하나만 개선하면 정체되기 쉽지만, 두 역할을 번갈아 업데이트하면 지속적인 개선이 이루어진다는 것을 보여줍니다.

배경

결과 감독형 검색 에이전트는 언제 어떻게 증거를 검색해야 할지 배워야 하지만, 최종 보상은 마지막 답변에만 점수를 매긴다. 중간 검색 단계에서 어떤 오류가 발생했는지 특정할 수 없고, 오류가 누적되어 잘못된 답이 되기 전에 진행 중인 궤적을 수정할 기회도 주어지지 않는다. 이 때문에 추론 과정에서 수정 신호가 전혀 도달하지 않는 넓은 공백이 존재한다.

저자들은 수정 피드백을 학습된 궤적 내 개입으로 재정의하며, 이를 통해 에이전트와 비평가라는 두 역할을 결합한다. 에이전트는 언제 피드백을 요청하고 사용할지 결정해야 하고, 비평가는 결과가 혼재되어 있으며 실패 패턴이 에이전트의 개선에 따라 변하는 궤적에서 유용한 수정을 추론해야 한다. 에이전트가 좋아질수록 그가 하는 실수의 종류가 바뀌므로, 고정된 비평가는 빠르게 실제 필요와 어긋나게 된다.

이러한 문제에 대응해 저자들은 CAFE(Coupled Agent-Feedback Evolution, 결합형 에이전트-피드백 진화)를 제안한다. 이 프레임워크는 검색 에이전트와 비평가 역할을 번갈아 사용하는 공유 매개변수 모델을 통해 피드백과 정책이 각기 독립적으로 최적화되지 않고 함께 진화하도록 강제한다. 핵심 주장은 자기진화하는 검색 에이전트는 자신이 이끄는 전략과 발맞춰 진화하는 피드백을 필요로 한다는 것이다.

심층 분석

CAFE는 베이스 에이전트의 실패를 중심으로 구성된 궤적에서 피드백 조건부 복원을 초기화하여, 피드백 신호가 에이전트가 실제로 보여주는 실패 패턴을 정확히 겨냥하게 한다. 온라인과 오프라인 최적화는 하나의 순환으로 결합되는데, 온라인 탐색이 궤적을 생성하고 오프라인 처리가 이를 통해 선호도를 추출한다.

온라인 강화학습 단계에서는 비교성 피드백 추정을 도입한다. 프롬프트 수준의 호출-건너뛰기 성공 격차는 피드백을 요청했을 때의 성공률과 건너뛰었을 때의 성공률을 비교해 피드백 요청에 대한 보상을 형성한다. 별도로 피드백 이점의 재가중화가 적용되어 피드백 전후의 토큰 수준 이점을 조정함으로써 신용을 보다 정밀하게 배분한다.

오프라인 단계에서는 롤아웃에서 유도된 매칭된 성공 및 실패 궤적을 통해 선호도 최적화로 피드백을 학습한다. 모델은 긍정과 부정 예시를 나란히 대비시켜 효과적인 수정과 그렇지 않은 것을 구분하도록 배운다. 이러한 순환은 최종 감독 특유의 희박한 보상 문제를 피하고 수정이 조기에 개입할 수 있게 한다.

산업 영향

CAFE는 일곱 개 agentic 검색 벤치마크에서 평가되었으며,此前 평가된 강화학습 기반 검색 에이전트와 비교되었다. 평균적으로 이를 상회했을 뿐만 아니라 여섯 개의 도메인 외 벤치마크에서도 이점을 유지하여, 개선이 단일 작업 분포에 과적합된 것이 아니라 도메인을 가로질러 일반화됨을 보여준다. 또한 답변 수준의 각도를 줄여 검색과 추론 사이의 일관성이 더 단단해졌음을 시사한다.

단측 아bl레이션은 이러한 결합이 왜 중요한지를 보여준다. 에이전트와 비평가 중 하나만 개선하면 정체되기 쉽지만, 두 역할을 번갈아 업데이트하면 지속적인 개선이 이루어진다. 이는 피드백과 정책은 반드시 공진화해야 하며, 임의의 단일 지점 최적화는 결국 한계에 부딪힌다는 논문의 핵심 주장을 직접적으로 지지한다.

오픈소스 자기진화 에이전트 연구에서 이 프레임워크는 피드백을 정적 외부 신호가 아니라 정책과 함께 진화해야 할 것으로 재정의한다. 피드백 조건부 복원과 비교성 피드백 추정이라는 아이디어는 온라인 결정이 필요한 다른 강화학습 환경으로도 전이될 수 있다.

전망

단측 개선은 정체되는 반면 번갈아 업데이트는 개선을 유지한다는 발견은 연구자들을 구성요소를 고립시켜 최적화하는 대신 에이전트와 비평가 사이의 동적 관계를 모델링하는 방향으로 이끈다. 이는 시간이 지남에 따라 진짜로 자기진화하는 에이전트를 구축하기 위한 방법론적 토대를 제공한다.

검색과 추론을 결합한 에이전트가 질문 답변, 연구, 코딩 등으로 확장되면서 자기진화 능력은 중심적인 공학적 과제가 된다. CAFE는 공유 매개변수와 결합된 최적화를 통해 그 개선을 지속시킬 수 있는 재사용 가능한 템플릿을 제공한다.

도메인 외 벤치마크에서 보여준 안정성과 각도 감소는 신뢰성이 중요한 현실 환경에서 이러한 시스템을 배포해야 한다는 주장을 강화한다. 다음 단계는 공진화 순환이 더 큰 규모와 더 요구가 심한 agentic 작업에서도 견디는지 테스트하는 것이다.

Sources

FAQ

CAFE는 무엇이며 어떤 문제를 해결합니까?

CAFE(결합형 에이전트-피드백 진화)는 공유 매개변수 모델로 검색 에이전트와 비평가 역할을 번갈아 사용하여 피드백과 정책이 함께 진화합니다.

왜 피드백은 정책과 함께 진화해야 합니까?

에이전트가 개선되면 실패 패턴이 바뀌어 정적인 비평가는 맞지 않게 됩니다. 단측 개선은 정체되지만 두 역할을 번갈아 업데이트하면 지속적으로 개선됩니다.

CAFE의 성능은 어떠다음 단계는 무엇입니까?

CAFE는 일곱 개 agentic 검색 벤치마크에서 평가된 강화학습 검색 에이전트를 평균적으로 능가하고, 여섯 개의 도메인 외 벤치마크에서 이점을 유지하며 답변 수준 환각을 줄입니다.