AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

구글 연구진, RRSI 공개

구글 연구진, RRSI 공개

HuggingFace·2026년 9월 23일 (수)
  • •구글 연구진이 LLM 에이전트 하네스의 정규화된 재귀적 자기개선 기법 RRSI를 공개했다
  • •RRSI는 재귀적 하네스 진화가 학습 과제를 암기하며 생기는 과적합을 겨냥한다
  • •RRSI는 8개 벤치마크에서 최대 14.1점 향상되고 정책 토큰을 30% 덜 썼다
  • •구글 연구진이 LLM 에이전트 하네스의 정규화된 재귀적 자기개선 기법 RRSI를 공개했다
  • •RRSI는 재귀적 하네스 진화가 학습 과제를 암기하며 생기는 과적합을 겨냥한다
  • •RRSI는 8개 벤치마크에서 최대 14.1점 향상되고 정책 토큰을 30% 덜 썼다
  • •구글 연구진이 LLM 에이전트 하네스의 정규화된 재귀적 자기개선 기법 RRSI를 공개했다
  • •RRSI는 재귀적 하네스 진화가 학습 과제를 암기하며 생기는 과적합을 겨냥한다
  • •RRSI는 8개 벤치마크에서 최대 14.1점 향상되고 정책 토큰을 30% 덜 썼다
  • •구글 연구진이 LLM 에이전트 하네스의 정규화된 재귀적 자기개선 기법 RRSI를 공개했다
  • •RRSI는 재귀적 하네스 진화가 학습 과제를 암기하며 생기는 과적합을 겨냥한다
  • •RRSI는 8개 벤치마크에서 최대 14.1점 향상되고 정책 토큰을 30% 덜 썼다

구글 연구진은 Sep 21 RRSI: Regularized Recursive Self-Improvement of Agent Harnesses를 공개했고, 펑샤는 Sep 22 이를 Hugging Face Papers에 제출했다. 이 논문은 arxiv:2609.24972로 등록됐고 130개 추천을 받아 #1 Paper of the day로 표시됐으며, 고정된 기반 모델 주변의 프롬프트, 제어 흐름, 도구, 메모리, 컨텍스트 관리로 구성되는 하네스가 LLM 에이전트 성능에 어떤 영향을 주는지 분석했다.

저자들은 최근 시스템이 구성요소 수준의 수정을 반복적으로 제안하고 선택해 하네스 개선을 이미 자동화한다고 밝혔다. 이는 에이전트 시스템 수준의 RSI, 즉 Recursive Self-Improvement(시스템이 자기 개선 절차를 개선하는 방식)를 만든다. 핵심 문제는 과적합이다. 재귀적 진화가 학습 과제를 암기하면 학습 분포 안에서는 큰 성능 향상이 나오지만, 학습 설정과 다른 과제가 포함된 분포 밖 벤치마크에서는 그 효과가 줄거나 사라질 수 있다.

RRSI는 후보 제안과 후보 선택을 모두 제어해 하네스 자기개선에 Regularization(과적합을 줄이는 제약)을 더한다. 제안기는 시간에 따라 완화되는 예산을 사용해 후보 하나가 묶을 수 있는 수정 수를 제한하고, 진화 이력을 바탕으로 아직 충분히 탐색되지 않은 경로를 장려한다. 선택기는 비평기와 가지치기 장치를 사용한다. 비평기는 벤치마크별 제안을 걸러내고, 가지치기 장치는 너무 작거나 비용이 크거나 더 이상 유용하지 않은 변경을 제거한다.

코딩, 에이전트형 작업공간, 엔지니어링 설계 과제를 포함한 8개 벤치마크에서 RRSI는 진화 대상 분할에서 최대 14.1점, 5개 분포 밖 벤치마크에서 최대 4.7점 향상됐다. 저자들은 또한 정규화하지 않은 진화보다 정책 토큰을 30% 덜 쓰는 하네스를 보고했다. 코드는 https://github.com/google-research/rrsi에서 제공되며, 프로젝트 페이지는 https://regularized-rsi.com/이다.

구글 연구진은 Sep 21 RRSI: Regularized Recursive Self-Improvement of Agent Harnesses를 공개했고, 펑샤는 Sep 22 이를 Hugging Face Papers에 제출했다. 이 논문은 arxiv:2609.24972로 등록됐고 130개 추천을 받아 #1 Paper of the day로 표시됐으며, 고정된 기반 모델 주변의 프롬프트, 제어 흐름, 도구, 메모리, 컨텍스트 관리로 구성되는 하네스가 LLM 에이전트 성능에 어떤 영향을 주는지 분석했다.

저자들은 최근 시스템이 구성요소 수준의 수정을 반복적으로 제안하고 선택해 하네스 개선을 이미 자동화한다고 밝혔다. 이는 에이전트 시스템 수준의 RSI, 즉 Recursive Self-Improvement(시스템이 자기 개선 절차를 개선하는 방식)를 만든다. 핵심 문제는 과적합이다. 재귀적 진화가 학습 과제를 암기하면 학습 분포 안에서는 큰 성능 향상이 나오지만, 학습 설정과 다른 과제가 포함된 분포 밖 벤치마크에서는 그 효과가 줄거나 사라질 수 있다.

RRSI는 후보 제안과 후보 선택을 모두 제어해 하네스 자기개선에 Regularization(과적합을 줄이는 제약)을 더한다. 제안기는 시간에 따라 완화되는 예산을 사용해 후보 하나가 묶을 수 있는 수정 수를 제한하고, 진화 이력을 바탕으로 아직 충분히 탐색되지 않은 경로를 장려한다. 선택기는 비평기와 가지치기 장치를 사용한다. 비평기는 벤치마크별 제안을 걸러내고, 가지치기 장치는 너무 작거나 비용이 크거나 더 이상 유용하지 않은 변경을 제거한다.

코딩, 에이전트형 작업공간, 엔지니어링 설계 과제를 포함한 8개 벤치마크에서 RRSI는 진화 대상 분할에서 최대 14.1점, 5개 분포 밖 벤치마크에서 최대 4.7점 향상됐다. 저자들은 또한 정규화하지 않은 진화보다 정책 토큰을 30% 덜 쓰는 하네스를 보고했다. 코드는 https://github.com/google-research/rrsi에서 제공되며, 프로젝트 페이지는 https://regularized-rsi.com/이다.

원문 보기 (영어)·2026년 9월 23일
#rrsi#recursive self improvement#agent harness#regularization#llm agent#google research#out of distribution#policy tokens