AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

AgentGarten, 에이전트용 인터랙티브 세계 구축

AgentGarten, 에이전트용 인터랙티브 세계 구축

HuggingFace·2026년 10월 9일 (금)
  • •시뮬레이터와 게임 엔진, 공통 신경망 렌더러를 결합해 에이전트 훈련 환경 구성
  • •숨바꼭질 실험에서 역할에 따라 4라운드와 10라운드 만에 전술 학습
  • •일반 강화학습 방식의 수백만 라운드와 비교해 4라운드 경험으로 학습했다고 연구진 보고
  • •시뮬레이터와 게임 엔진, 공통 신경망 렌더러를 결합해 에이전트 훈련 환경 구성
  • •숨바꼭질 실험에서 역할에 따라 4라운드와 10라운드 만에 전술 학습
  • •일반 강화학습 방식의 수백만 라운드와 비교해 4라운드 경험으로 학습했다고 연구진 보고
  • •시뮬레이터와 게임 엔진, 공통 신경망 렌더러를 결합해 에이전트 훈련 환경 구성
  • •숨바꼭질 실험에서 역할에 따라 4라운드와 10라운드 만에 전술 학습
  • •일반 강화학습 방식의 수백만 라운드와 비교해 4라운드 경험으로 학습했다고 연구진 보고
  • •시뮬레이터와 게임 엔진, 공통 신경망 렌더러를 결합해 에이전트 훈련 환경 구성
  • •숨바꼭질 실험에서 역할에 따라 4라운드와 10라운드 만에 전술 학습
  • •일반 강화학습 방식의 수백만 라운드와 비교해 4라운드 경험으로 학습했다고 연구진 보고

연구진은 실시간 상호작용 가상 세계에서 에이전트를 훈련하는 프레임워크 AgentGarten을 공개했습니다. 관련 논문은 10월 8일 발표됐고, 10월 9일 Hugging Face Papers에 제출됐습니다. 시스템은 각 세계의 상태와 규칙을 유지하는 시뮬레이터·게임 엔진에 공통 신경망 렌더러를 결합합니다. 렌더러는 에이전트가 사용하는 시각 정보를 생성합니다. 연구진은 훈련 환경에 일관된 상태와 규칙, 역학뿐 아니라 실제 세계의 시각적 분포를 닮은 관찰 정보도 필요하다고 설명했습니다.

AgentGarten은 사전 훈련된 비디오 모델을 기하 조건에 맞게 조정한 뒤, 정확한 재생을 통해 과거 정보 입력을 미분 가능하게 만드는 방법인 Adversarial Forcing으로 증류합니다. 이를 통해 이후 예측의 오류가 렌더러의 이전 관찰 정보 인코딩 방식에도 반영됩니다. 시각 품질을 높이기 위해 실제 데이터 기반의 적대적 감독도 활용합니다. 렌더러는 공통 인터페이스를 통해 구조화된 조건을 받고, 시뮬레이션 백엔드는 코드로 정의된 상호작용 규칙을 실행합니다.

에이전트는 렌더링된 화면을 인식하고 실시간으로 환경에 행동하며, 각 라운드의 경험을 플레이북으로 정리해 다음 에이전트가 이어받고 개선하도록 합니다. 숨바꼭질 실험에서 숨는 역할은 4라운드 만에 은신처를 만들었고, 찾는 역할은 10라운드 만에 경사로를 활용했습니다. 연구진은 에이전트가 4라운드의 경험으로 학습했다고 보고했으며, 일반 강화학습 방식의 비교 대상은 수백만 라운드를 거쳤다고 밝혔습니다. 새 세계를 코드로 작성하고 같은 인터페이스로 렌더링할 수 있어, 에이전트의 발달에 맞춰 환경의 수와 난도를 높일 수 있습니다.

연구진은 실시간 상호작용 가상 세계에서 에이전트를 훈련하는 프레임워크 AgentGarten을 공개했습니다. 관련 논문은 10월 8일 발표됐고, 10월 9일 Hugging Face Papers에 제출됐습니다. 시스템은 각 세계의 상태와 규칙을 유지하는 시뮬레이터·게임 엔진에 공통 신경망 렌더러를 결합합니다. 렌더러는 에이전트가 사용하는 시각 정보를 생성합니다. 연구진은 훈련 환경에 일관된 상태와 규칙, 역학뿐 아니라 실제 세계의 시각적 분포를 닮은 관찰 정보도 필요하다고 설명했습니다.

AgentGarten은 사전 훈련된 비디오 모델을 기하 조건에 맞게 조정한 뒤, 정확한 재생을 통해 과거 정보 입력을 미분 가능하게 만드는 방법인 Adversarial Forcing으로 증류합니다. 이를 통해 이후 예측의 오류가 렌더러의 이전 관찰 정보 인코딩 방식에도 반영됩니다. 시각 품질을 높이기 위해 실제 데이터 기반의 적대적 감독도 활용합니다. 렌더러는 공통 인터페이스를 통해 구조화된 조건을 받고, 시뮬레이션 백엔드는 코드로 정의된 상호작용 규칙을 실행합니다.

에이전트는 렌더링된 화면을 인식하고 실시간으로 환경에 행동하며, 각 라운드의 경험을 플레이북으로 정리해 다음 에이전트가 이어받고 개선하도록 합니다. 숨바꼭질 실험에서 숨는 역할은 4라운드 만에 은신처를 만들었고, 찾는 역할은 10라운드 만에 경사로를 활용했습니다. 연구진은 에이전트가 4라운드의 경험으로 학습했다고 보고했으며, 일반 강화학습 방식의 비교 대상은 수백만 라운드를 거쳤다고 밝혔습니다. 새 세계를 코드로 작성하고 같은 인터페이스로 렌더링할 수 있어, 에이전트의 발달에 맞춰 환경의 수와 난도를 높일 수 있습니다.

원문 보기 (영어)·2026년 10월 9일
#agentgarten#agent training#neural renderer#adversarial forcing#interactive environments#hide and seek#reinforcement learning