AI4AI-Bench: 에이전트가 훈련 알고리즘을 설계하여 재귀적 자기개선 능력 평가
이 논문은 재적 자기개선(RSI)에서 가장 중요하면서도 가장 간과된 측면에 초점을 맞춥니다. AI 시스템이 AI 시스템을 생성하는 훈련 알고리즘을 개선할 수 있느냐는 것입니다. 저자는 더 나은 목적 함수나 업데이트 규칙이 매 실행에서 연산 능력과 능력의 교환율을 높일 수 있기 때문에 RSI의 실현 가능성은 에이전트가 훈련 알고리즘을 설계할 수 있는지에 달려 있다고 지적합니다. 기존 평가 스위트는 데이터를 수집하여 이기든 하이퍼매개변수를 조정하여 이기든 이 능력을 독립적으로 측정할 수 없으며, 실행 방법의 변경과 모델 학습 방법의 변경을 구분하지 못합니다. 이 문제를 해결하기 위해 저자는 10개의 동결된 연구 저장소에서 10종의 훈련 알고리즘을 아우르는 AI4AI-Bench를 제안합니다. 각 작업에서 에이전트는 단일 B300 GPU에서 4시간 동안 훈련 알고리즘을 재작성합니다. 이후 코드는 최대 12시간 동안 처음부터 다시 실행되며 에이전트에게 숨겨진统一 스코어로 채점됩니다. 29개의 구성, 6개의 시스템, 10개의 작업에서 평균 점수는 0.166이었고 가장 강력한 시스템은 0.250에 도달했습니다. 대부분의 제출은 모델 학습 방법을 변경하지 않았고, 변경한 소수는 평균 0.226 대 0.126이었습니다. 추론 노력의 증가는 주로 변경을 원하는 의욕을 산 것에 불과했으며 변경 비율은 8%에서 64%로 높아졌습니다. 저자는 작업 스위트, 평가기, 채점된 모든 제출을 오픈 소스로 공개했습니다.
배경
재적 자기개선(RSI)은 AI 안전과 능력의 최전선에서 오랫동안 정의적인 질문 중 하나로 다뤄져 왔다. 이는 AI 시스템을 생성하는 그 과정 자체를 개선할 수 있는 AI 시스템을 요구하며, 다음 세대가 그 향상을 직접 물려받도록 한다. 그 과정의 핵심에는 훈련 알고리즘이 있다. 더 나은 목적 함수나 업데이트 규칙은 매 실행에서 연산 능력과 능력의 교환율을 높이며, 다음 에이전트 자체를 생성하는 실행을 포함한다. 따라서 RSI의 실현 가능성은 궁극적으로 에이전트가 훈련 알고리즘을 설계할 수 있는지에 달려 있다.
새로운 논문 AI4AI-Bench는 이런 능력을 모호한 토론에서 정밀하게 측정 가능한 척도로 끌어낸다. 저자들은 기존 평가 스위트가 문제의 기술을 고립시켜 측정할 수 있다고 본다. 이들은 더 많은 데이터를 수집하거나 하이퍼매개변수를 조정하여 이기 때문에, 실행 방법이 변경되는 것과 모델 학습 방법이 변경되는 것을 구분할 수 없다. 이런 혼동은 RSI가 의존하는 정확한 능력을 가린다.
심층 분석
이 간극을 메우기 위해 저자들은 열 개의 동결된 연구 저장소에서 열 종류의 훈련 알고리즘 가족을 아우르는 AI4AI-Bench를 구축했다. 저장소를 동결하는 것은 중요한 설계 선택이다. 이는 훈련 알고리즘을 제외한 모든 것을 일정하게 유지하여 점수가 설정의 부수적 차이가 아니라 알고리즘 자체를 반영하게 한다. 각 작업에서 에이전트는 단일 B300 GPU에서 4시간 동안 훈련 알고리즘을 재작성한다. 수정된 코드는 이후 최대 12시간 동안 처음부터 다시 실행되며, 에이전트에게 숨겨진统一 스코어로 채점된다. 이 채점은 해당 저장소의 원본 알고리즘을 동일한 파이프라인으로 실행한 결과와 비교된다.
가장 기술적으로 정교한 요소는 지표 간 정규화다. 열 개의 작업은 서로 호환되지 않는 가족과 지표를 사용하므로 원본 결과를 직접 더하거나 비교할 수 없다. 따라서 각 작업은 0이 무정보적 모델을, 0.1이 저장소와 함께 제공되는 알고리즘을, 1.0이 작업의 최적해를 나타내는 공유 척도로 매핑된다. 이로써 각 에이전트가 도달 가능한 최선의 결과에서 얼마나 떨어져 있는지 즉시 명확해진다.
산업 영향
평가 파이프라인은 훈련 알고리즘을 유일한 변수로 유지하기 위해 엄격하게 제약된다. 스코어는 전체 과정에 걸쳐 숨겨지고, 코드는 캐시되거나 과거 상태의 영향을 배제하기 위해 처음부터 다시 실행되며, 통제 실행은 원본 알고리즘을 사용한다. 29개의 구성, 6개의 시스템, 열 개 작업 전체에서 평균 점수는 0.166이었고 가장 강력한 시스템은 0.250에 도달했다. 이 숫자는 stark하다. 최선의 시스템조차 기존 알고리즘부터 최적해까지의 거리의 5분의 1도 채 채우지 못했다.
이 거리가 어디에 소비되었는지 분해하면, 대부분의 제출은 모델이 학습하는 방식을 변경하지 않았고, 변경한 소수는 0.226의 평균을 기록한 반면 나머지는 0.126이었다. 따라서 격차는 에이전트가 얼마나 많은 코드를 작성했는지에서가 아니라 훈련 알고리즘 자체에 손을 대고자 하는 의지에서 나왔다. 추론 노력 실험은 이 발견을 더 날카롭게 했다. 추론 예산을 늘리는 것은 주로 변경을 원하는 의지를 사서, 학습 방법을 변경한 제출의 비율을 8%에서 64%로 높이고 평균 점수를 0.094에서 0.196으로 끌어올렸다.
전망
이것은 논의를 부족한 에이전트 능력에서 부족한 시도 의지로 재구성한다. 재적 자기개선 맥락에서 동기부여와 용기가 순수한 기술보다 더 중요할 수 있음을 시사한다. 오픈 소스 커뮤니티에게, 동결된 저장소와 숨겨진 스코어의 조합은 어떤 새로운 시스템도 동일한 척위에서 검증받을 수 있는 재현 가능한 평가 패러다임을 제공한다. 저자들은 작업 스위트, 평가기, 채점된 모든 제출을 오픈 소스로 공개하여, 이런 시스템이 진화함에 따라 측정을 반복적으로 수행하고 비교할 수 있게 했다.
산업 팀에게 이 작업은 훈련 알고리즘 자체가 연산 능력과 능력의 교환율의 핵심 레버라는 것을 상기시킨다. 그리고 에이전트가 그 알고리즘을 개선하도록 하는 것은 동시에 가장 어렵고 레버 효과가 가장 큰 단계다. 후속 연구에게, 기술보다 우선하는 의지 패턴은 더 강한 훈련 알고리즘 에이전트를 설계하는 방향으로 나아간다. 아마도 추론 노력을 높이고 에이전트가 코드 생성 능력을 단순히 쌓는 것이 아니라 훈련 알고리즘에 진정으로 관여하도록 독려하는 것일 것이다.
궁극적으로 AI4AI-Bench는 벤치마크 그 이상이다. 이는 AI가 자신을 개선할 수 있는지에 대한 정량적 탐구이며, 앞으로의 가장 중요한 질문 중 하나에 대해 반복적으로 재교정할 수 있는 자를 설립한다.
Sources
FAQ
AI4AI-Bench는 정확히 무엇을 평가합니까?
에전트가 AI 시스템을 생성하는 훈련 알고리즘을 재작성할 수 있는지 평가합니다. 10개의 동결 저장소에서 B300 으로 4 시간, 코드 최대 12 시간 재실행, 숨겨진 스코어로 채점합니다.
왜 이 벤치마크가 중요한가요?
대부분의 제출은 학습 방법을 변경하지 않았고, 변경한 소수는 0.226 대 0.126이었습니다. 가장 강력한 시스템도 0.250에 불과합니다. 훈련 알고리즘이 핵심 레버입니다.
앞으로 어떤 점을 주목해야 하나요?
추론 노력을 늘리면 변경을 원하는 의욕만 8%에서 64%로 높아집니다. 의욕이 기술보다 중요합니다. 작업 스위트, 평가기, 채점된 모든 제출이 오픈 소스로 공개되었습니다.