AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

Miles v0.1, 후학습 시스템 출시

Miles v0.1, 후학습 시스템 출시

LMSYS·2026년 8월 19일 (수)
  • •Miles v0.1은 롤아웃, 학습, 가중치 업데이트 루프를 갖춘 프로덕션 후학습 시스템으로 출시됐다
  • •완전 비동기식 RL은 트레이너가 완료된 trajectory 그룹을 소비하는 동안 롤아웃 생성을 계속 유지한다
  • •P2P 전송은 Kimi-K2 1T 가중치 업데이트 시간을 53.3초에서 7.2초로 줄였다
  • •Miles v0.1은 롤아웃, 학습, 가중치 업데이트 루프를 갖춘 프로덕션 후학습 시스템으로 출시됐다
  • •완전 비동기식 RL은 트레이너가 완료된 trajectory 그룹을 소비하는 동안 롤아웃 생성을 계속 유지한다
  • •P2P 전송은 Kimi-K2 1T 가중치 업데이트 시간을 53.3초에서 7.2초로 줄였다
  • •Miles v0.1은 롤아웃, 학습, 가중치 업데이트 루프를 갖춘 프로덕션 후학습 시스템으로 출시됐다
  • •완전 비동기식 RL은 트레이너가 완료된 trajectory 그룹을 소비하는 동안 롤아웃 생성을 계속 유지한다
  • •P2P 전송은 Kimi-K2 1T 가중치 업데이트 시간을 53.3초에서 7.2초로 줄였다
  • •Miles v0.1은 롤아웃, 학습, 가중치 업데이트 루프를 갖춘 프로덕션 후학습 시스템으로 출시됐다
  • •완전 비동기식 RL은 트레이너가 완료된 trajectory 그룹을 소비하는 동안 롤아웃 생성을 계속 유지한다
  • •P2P 전송은 Kimi-K2 1T 가중치 업데이트 시간을 53.3초에서 7.2초로 줄였다

Miles Team은 2026년 8월 18일 Miles v0.1을 frontier post-training을 위한 풀스택 프로덕션 준비 시스템으로 공개했다. 이 시스템은 첫 Miles 릴리스를 계승하고 slime의 간결한 설계를 기반으로 하며, 강화 학습 루프를 롤아웃, 학습, 가중치 업데이트 단계에 맞췄다. SGLang 엔진은 trajectory를 생성하고, NVIDIA Megatron-LM 또는 PyTorch FSDP는 RL 손실을 계산해 정책을 업데이트하며, 새 가중치는 롤아웃 fleet으로 동기화돼 중단을 최소화한다.

Miles는 멀티턴 세션, 도구 실행, 샌드박스 환경, 토큰 충실 trajectory 캡처를 포함한 agentic rollout에 SGLang을 사용한다. DP attention이 활성화되면 SGLang 라우터는 한 세션의 모든 턴을 같은 엔진과 DP rank에 유지하고, 새 세션은 부하가 가장 낮은 rank에 배정한다. 또한 긴 세션을 위해 KV-cache 용량을 예약해 롤아웃 동시성과 cache-hit 비율을 높게 유지한다.

Miles의 완전 비동기식 RL은 트레이너가 완료된 그룹을 소비하고 모델을 업데이트하는 동안에도 롤아웃 엔진이 생성을 계속하게 해, 느린 trajectory 때문에 생기는 트레이너 유휴 시간을 피한다. 스케줄링은 sample 단위로 작동하고 완료된 그룹은 제한된 data buffer에 들어가며, 사용자는 스케줄링 코드를 바꾸지 않고 오래된 sample을 유지, 재시도, 폐기, 거부할 수 있다. 평가는 3개 모드를 제공한다. 작은 디버그 세트를 위한 shared-engine evaluation, checkpoint snapshot에서 로드되는 별도 GPU fleet의 dedicated evaluation, 사용자 제공 evaluator를 통한 external evaluation이다.

Agentic environment에서 Miles는 각 작업에 격리된 sandbox를 제공한다. coding agent는 이곳에서 명령을 실행하고, 파일을 편집하고, 출력을 읽고, verifier로부터 reward를 받을 수 있다. 이 시스템은 Harbor, HUD, NeMo Gym, OpenEnv, Prime Intellect Verifiers 통합을 제공하고, AgentENV, Daytona, E2B, Modal 등 sandbox backend를 지원하며, agentic coding과 terminal task를 위한 유지보수형 end-to-end recipe도 포함한다.

Miles는 멀티턴 도구 사용 workflow에서 모델이 생성한 정확한 token ID를 보존하는 session server인 Token-In-Token-Out, 즉 TITO를 추가했다. TITO는 새로 추가된 message만 tokenize한 뒤 기존 prefix와 병합해 전체 trajectory를 하나의 연속된 training sample로 만들며, 모델이 생성하지 않은 token은 masking한다. Rollout Routing Replay, 즉 R3는 롤아웃 중 SGLang expert routing 결과를 기록하고 학습 중 이를 replay해 혼합 전문가 모델(MoE)의 routing mismatch, 즉 expert 선택 차이를 줄인다.

Miles는 NVFP4, MXFP4, MXFP8, FP8 롤아웃을 지원하고, NVFP4, MXFP8, FP8용 end-to-end recipe와 대부분 모델을 위한 INT4 양자화 인식 학습도 제공한다. Blackwell-native MXFP8 및 NVFP4 recipe는 end-to-end precision contract, hardware blockwise scaling, per-token MoE expert-weight quantization, online activation scaling, bit-exact quantizer contract, fine-grained BF16 flag를 사용한다. reward curve는 BF16 baseline을 따라가면서 rollout time을 줄였다.

Miles는 CPU 또는 node-local NVMe optimizer offload, per-bucket optimizer-state streaming, 기타 reduction으로 대형 모델의 memory 및 synchronization 병목을 처리했다. GLM-5.2 run에서는 GPU당 30+ GB HBM memory와 node당 수백 GB CPU memory를 절감했다. 예시에서 NVMe optimizer-state streaming은 16 nodes에서 744B-parameter model을 비동기 학습하는 동안 GLM-5.2 optimizer가 32 GB300 GPUs의 training engine 옆에 들어갈 수 있게 했다.

가중치 업데이트에서 Miles는 P2P weight transfer와 disk-delta update를 제공한다. P2P는 weight bucket을 다시 shard하고 RDMA를 통해 필요한 shard만 rollout-rank memory에 써넣어 Kimi-K2 1T weight-update time을 53.3 seconds에서 7.2 seconds로 줄였다. Disk-delta update는 보통 BF16 rollout에서 parameter의 2%, FP4 rollout에서 0.5%만 포함한다. GLM-4.7-Flash run에서는 각 update payload를 62.4 GB에서 0.69–0.83 GB로 줄이면서 generation pause를 3–5 seconds 안에 유지했다.

Miles Team은 2026년 8월 18일 Miles v0.1을 frontier post-training을 위한 풀스택 프로덕션 준비 시스템으로 공개했다. 이 시스템은 첫 Miles 릴리스를 계승하고 slime의 간결한 설계를 기반으로 하며, 강화 학습 루프를 롤아웃, 학습, 가중치 업데이트 단계에 맞췄다. SGLang 엔진은 trajectory를 생성하고, NVIDIA Megatron-LM 또는 PyTorch FSDP는 RL 손실을 계산해 정책을 업데이트하며, 새 가중치는 롤아웃 fleet으로 동기화돼 중단을 최소화한다.

Miles는 멀티턴 세션, 도구 실행, 샌드박스 환경, 토큰 충실 trajectory 캡처를 포함한 agentic rollout에 SGLang을 사용한다. DP attention이 활성화되면 SGLang 라우터는 한 세션의 모든 턴을 같은 엔진과 DP rank에 유지하고, 새 세션은 부하가 가장 낮은 rank에 배정한다. 또한 긴 세션을 위해 KV-cache 용량을 예약해 롤아웃 동시성과 cache-hit 비율을 높게 유지한다.

Miles의 완전 비동기식 RL은 트레이너가 완료된 그룹을 소비하고 모델을 업데이트하는 동안에도 롤아웃 엔진이 생성을 계속하게 해, 느린 trajectory 때문에 생기는 트레이너 유휴 시간을 피한다. 스케줄링은 sample 단위로 작동하고 완료된 그룹은 제한된 data buffer에 들어가며, 사용자는 스케줄링 코드를 바꾸지 않고 오래된 sample을 유지, 재시도, 폐기, 거부할 수 있다. 평가는 3개 모드를 제공한다. 작은 디버그 세트를 위한 shared-engine evaluation, checkpoint snapshot에서 로드되는 별도 GPU fleet의 dedicated evaluation, 사용자 제공 evaluator를 통한 external evaluation이다.

Agentic environment에서 Miles는 각 작업에 격리된 sandbox를 제공한다. coding agent는 이곳에서 명령을 실행하고, 파일을 편집하고, 출력을 읽고, verifier로부터 reward를 받을 수 있다. 이 시스템은 Harbor, HUD, NeMo Gym, OpenEnv, Prime Intellect Verifiers 통합을 제공하고, AgentENV, Daytona, E2B, Modal 등 sandbox backend를 지원하며, agentic coding과 terminal task를 위한 유지보수형 end-to-end recipe도 포함한다.

Miles는 멀티턴 도구 사용 workflow에서 모델이 생성한 정확한 token ID를 보존하는 session server인 Token-In-Token-Out, 즉 TITO를 추가했다. TITO는 새로 추가된 message만 tokenize한 뒤 기존 prefix와 병합해 전체 trajectory를 하나의 연속된 training sample로 만들며, 모델이 생성하지 않은 token은 masking한다. Rollout Routing Replay, 즉 R3는 롤아웃 중 SGLang expert routing 결과를 기록하고 학습 중 이를 replay해 혼합 전문가 모델(MoE)의 routing mismatch, 즉 expert 선택 차이를 줄인다.

Miles는 NVFP4, MXFP4, MXFP8, FP8 롤아웃을 지원하고, NVFP4, MXFP8, FP8용 end-to-end recipe와 대부분 모델을 위한 INT4 양자화 인식 학습도 제공한다. Blackwell-native MXFP8 및 NVFP4 recipe는 end-to-end precision contract, hardware blockwise scaling, per-token MoE expert-weight quantization, online activation scaling, bit-exact quantizer contract, fine-grained BF16 flag를 사용한다. reward curve는 BF16 baseline을 따라가면서 rollout time을 줄였다.

Miles는 CPU 또는 node-local NVMe optimizer offload, per-bucket optimizer-state streaming, 기타 reduction으로 대형 모델의 memory 및 synchronization 병목을 처리했다. GLM-5.2 run에서는 GPU당 30+ GB HBM memory와 node당 수백 GB CPU memory를 절감했다. 예시에서 NVMe optimizer-state streaming은 16 nodes에서 744B-parameter model을 비동기 학습하는 동안 GLM-5.2 optimizer가 32 GB300 GPUs의 training engine 옆에 들어갈 수 있게 했다.

가중치 업데이트에서 Miles는 P2P weight transfer와 disk-delta update를 제공한다. P2P는 weight bucket을 다시 shard하고 RDMA를 통해 필요한 shard만 rollout-rank memory에 써넣어 Kimi-K2 1T weight-update time을 53.3 seconds에서 7.2 seconds로 줄였다. Disk-delta update는 보통 BF16 rollout에서 parameter의 2%, FP4 rollout에서 0.5%만 포함한다. GLM-4.7-Flash run에서는 각 update payload를 62.4 GB에서 0.69–0.83 GB로 줄이면서 generation pause를 3–5 seconds 안에 유지했다.

원문 보기 (영어)·2026년 8월 18일
인프라#miles v0 1#sglang#reinforcement learning#post training#tito#r3#megatron lm#fsdp#mxfp8#nvfp4