수면 모방 기법으로 LLM 추론 및 기억력 개선
arXiv
2026년 5월 27일 (수)
- •연구진이 LLM의 장기 작업 효율을 높이는 수면 유사 통합 메커니즘을 개발했다.
- •해당 모델은 문맥을 빠른 가중치로 변환하고 주기적인 오프라인 단계에서 키-값 캐시를 비운다.
- •실험 결과, 이 방식은 표준 모델보다 복잡한 추론에서 우수한 성능을 보였으며 수면 시간과 성능 개선이 직결됐다.
상윤 리(Sangyun Lee), 션 맥레이시(Sean McLeish), 톰 골드스타인(Tom Goldstein), 줄리아 판티(Giulia Fanti) 연구진은 2026년 5월 25일 제출된 논문을 통해 거대언어모델(LLM)을 위한 수면 유사 통합 메커니즘을 공개했다. 이번 기법은 트랜스포머 기반 모델이 긴 문맥 길이를 다룰 때 효율성이 떨어지는 문제를 해결하고자 고안되었다. 제안된 시스템은 주기적으로 최근 입력을 지속적인 빠른 가중치로 변환한 뒤, 모델의 키-값 캐시를 비워 메모리를 효율적으로 관리한다.
수면 유사 단계 동안 모델은 학습된 로컬 규칙을 사용해 상태 공간 모델(SSM) 블록 내의 빠른 가중치를 업데이트하며, 축적된 문맥에 대해 N번의 오프라인 순환 패스를 수행한다. 이러한 접근 방식은 연산 집약적인 작업을 오프라인 단계로 이전함으로써, 모델이 활성 상태인 예측 단계에서 낮은 지연 시간을 유지할 수 있도록 지원한다.
셀룰러 오토마타, 다중 홉 그래프 검색, 복잡한 수학 추론 등 합성 작업 테스트에서 해당 통합 방식은 표준 트랜스포머 및 SSM-어텐션 하이브리드 모델보다 뛰어난 성능을 나타냈다. 연구진은 수면 시간을 늘릴수록 모델 성능이 직접적으로 향상됨을 확인했으며, 특히 심층적인 추론 능력이 요구되는 작업에서 가장 뚜렷한 개선 효과가 나타났다.