AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

TRACE, FP4 강화학습 롤아웃 최대 5.4배 가속

TRACE, FP4 강화학습 롤아웃 최대 5.4배 가속

HuggingFace·2026년 10월 7일 (수)
  • •롤아웃 경로의 양자화 결과로 FP4 학습 반올림 결정 안내
  • •4개 MoE 언어 모델의 추론·코딩·장기 강화학습 과제 평가
  • •BF16 롤아웃과 비슷한 강화학습 성능, 최대 5.4배 속도 향상 보고
  • •롤아웃 경로의 양자화 결과로 FP4 학습 반올림 결정 안내
  • •4개 MoE 언어 모델의 추론·코딩·장기 강화학습 과제 평가
  • •BF16 롤아웃과 비슷한 강화학습 성능, 최대 5.4배 속도 향상 보고
  • •롤아웃 경로의 양자화 결과로 FP4 학습 반올림 결정 안내
  • •4개 MoE 언어 모델의 추론·코딩·장기 강화학습 과제 평가
  • •BF16 롤아웃과 비슷한 강화학습 성능, 최대 5.4배 속도 향상 보고
  • •롤아웃 경로의 양자화 결과로 FP4 학습 반올림 결정 안내
  • •4개 MoE 언어 모델의 추론·코딩·장기 강화학습 과제 평가
  • •BF16 롤아웃과 비슷한 강화학습 성능, 최대 5.4배 속도 향상 보고

신 왕(Xin Wang), 하오 위(Hao Yu), 정양 주거(Zhengyang Zhuge) 연구진은 전문가 혼합형(MoE) 언어 모델의 강화학습(RL) 훈련을 위한 FP4 양자화 프레임워크 TRACE를 제안했습니다. 논문은 2610.07767번으로 arXiv에 공개됐으며, 10월 6일 Hugging Face에도 등록됐습니다. 연구진은 강화학습 훈련에 쓰이는 모델 출력인 롤아웃을 생성할 때 발생하는 연산 및 메모리 부담을 해결하려 했습니다. 기존 FP4 방식은 훈련 경로와 롤아웃 경로의 양자화 정확도를 각각 최적화해 두 경로 간 차이를 직접 줄이지 않았습니다.

TRACE는 롤아웃 경로의 양자화 결과를 활용해 훈련 경로의 FP4 반올림 결정을 안내하는 양자화 인식 훈련 방식을 씁니다. 또한 더 깊은 층에서 선택한 가수부와 스케일 정보를 캐싱해 안내 정보의 저장 및 통신 부담을 줄입니다. 연구진은 추론, 코딩, 장기 강화학습 과제에서 대규모 MoE 언어 모델 4개를 평가했습니다.

연구진에 따르면 TRACE는 FP4 가중치와 활성값, FP4 KV 캐시 롤아웃을 지원하며, 강화학습 성능은 BF16 롤아웃과 비슷했습니다. 롤아웃 속도는 최대 5.4배 향상됐고, BF16으로 훈련한 정책에 사후 FP4 양자화를 적용한 경우보다 최종 FP4 성능도 높았습니다. 다니엘 왕(Daniel Wang)은 10월 7일 논문을 Hugging Face에 제출했으며, 해당 페이지는 제공된 목록의 게시 시점에 오늘의 논문 3위와 추천 38개를 기록했습니다.

신 왕(Xin Wang), 하오 위(Hao Yu), 정양 주거(Zhengyang Zhuge) 연구진은 전문가 혼합형(MoE) 언어 모델의 강화학습(RL) 훈련을 위한 FP4 양자화 프레임워크 TRACE를 제안했습니다. 논문은 2610.07767번으로 arXiv에 공개됐으며, 10월 6일 Hugging Face에도 등록됐습니다. 연구진은 강화학습 훈련에 쓰이는 모델 출력인 롤아웃을 생성할 때 발생하는 연산 및 메모리 부담을 해결하려 했습니다. 기존 FP4 방식은 훈련 경로와 롤아웃 경로의 양자화 정확도를 각각 최적화해 두 경로 간 차이를 직접 줄이지 않았습니다.

TRACE는 롤아웃 경로의 양자화 결과를 활용해 훈련 경로의 FP4 반올림 결정을 안내하는 양자화 인식 훈련 방식을 씁니다. 또한 더 깊은 층에서 선택한 가수부와 스케일 정보를 캐싱해 안내 정보의 저장 및 통신 부담을 줄입니다. 연구진은 추론, 코딩, 장기 강화학습 과제에서 대규모 MoE 언어 모델 4개를 평가했습니다.

연구진에 따르면 TRACE는 FP4 가중치와 활성값, FP4 KV 캐시 롤아웃을 지원하며, 강화학습 성능은 BF16 롤아웃과 비슷했습니다. 롤아웃 속도는 최대 5.4배 향상됐고, BF16으로 훈련한 정책에 사후 FP4 양자화를 적용한 경우보다 최종 FP4 성능도 높았습니다. 다니엘 왕(Daniel Wang)은 10월 7일 논문을 Hugging Face에 제출했으며, 해당 페이지는 제공된 목록의 게시 시점에 오늘의 논문 3위와 추천 38개를 기록했습니다.

원문 보기 (영어)·2026년 10월 7일
#trace#fp4 quantization#reinforcement learning#mixture of experts#language models#rollout guidance#kv cache#bf16