RRSI(Regularized Recursive Self-Improvement of Agent Harnesses)는 Google Cloud AI Research와 대학 연구진이 제안한 AI 에이전트의 반복적 자기 개선 방법입니다. 모델 가중치는 고정하고 프롬프트·실행 흐름·도구·메모리·문맥 관리로 이루어진 하네스(harness)를 수정한 뒤, 평가 결과를 바탕으로 변경을 선택합니다.
여기서 정규화는 같은 평가 과제에만 맞춘 변경이 쌓이는 과적합을 줄이기 위한 제약입니다. 한 번에 바꾸는 양과 변경 이력, 평가 문제에 특화된 로직, 성능 변동과 토큰 비용을 함께 고려합니다.
개념과 원논문
-
RRSI 공식 프로젝트 · 영문
하네스 개선의 과적합 문제와 제안·선택 단계의 제약, 실험 결과와 단계별 변경 사례를 소개합니다.
-
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses — Xia 외 · 영문
변경량 제한·변경안 심사·불필요한 구성 제거를 결합하고, 코딩·문서 작업·공학 설계에서 개선에 사용한 과제와 별도 평가 과제의 성능을 비교한 논문입니다.
-
google-research/rrsi — 공식 저장소 · 영문
Git worktree에서 변경안을 생성·평가하는 반복 구조와 설치·실행·확장 방법을 제공하며, 구글이 공식 지원하는 제품이 아닌 연구 구현임을 명시합니다.
변경량과 개선 이력 관리
-
회차별 변경량 제한 — schedule.py · 영문 코드
초기에는 여러 변경을 묶어 탐색하고 후반에는 개별 변경의 영향을 구분하기 쉽도록 후보당 독립적인 변경 수의 상한을 줄이는 구현입니다.
-
변경 이력과 탐색·제거 대상 관리 — history.py · 영문 코드
변경 가설·점수·비용·채택 여부를 기록하고, 정체 시 아직 시도하지 않은 구성으로 탐색을 넓히거나 최근 이득이 없는 구성을 제거 대상으로 정하는 구현입니다.
과적합 심사와 성능 및 비용 평가
-
변경안 사전 심사 — critic.py · 영문 코드
평가 전에 패턴 검사와 LLM 검토로 과제별 정답·식별자에 의존하는 변경, 채점기 조작과 실행 간 메모리 누출 등을 심사합니다.
-
변경안 채택 기준 — selection.py · 영문 코드
평가 변동성을 반영한 성능 하한과 비용·새 구성 요소에 대한 기준, 분야별 필수 조건으로 후보를 걸러낸 뒤 통과한 후보의 점수를 비교합니다.
분야별 실행과 평가
-
코딩 에이전트 — Coding instance · 영문
Terminal-Bench에서 하네스를 개선하고 SWE-bench Verified로 다른 과제에 대한 성능을 평가하는 환경과 실행 절차를 안내합니다.
-
문서 작업 에이전트 — Agentic-workspace instance · 영문
Harvey LAB의 개선용·별도 평가용 과제를 분리하고 JobBench·GDPval·APEX-Agents로 평가를 확장하는 구성을 설명합니다.
-
공학 설계 에이전트 — Engineering-design instance · 영문
EngDesign 과제의 검증기로 설계를 평가하고 유효한 설계 비율·미제출 비율을 별도 조건으로 검사하는 환경과 추가 평가 절차를 안내합니다.