AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

NVIDIA, MoE 파인튜닝 가속화하는 NeMo AutoModel 공개

NVIDIA, MoE 파인튜닝 가속화하는 NeMo AutoModel 공개

HuggingFace Blog·2026년 6월 25일 (목)
  • •NVIDIA가 HuggingFace Transformers v5와 통합해 MoE 모델 파인튜닝 속도를 높이는 NeMo AutoModel을 출시했다.
  • •이 라이브러리는 30B MoE 모델에서 기존 대비 3.4~3.7배 높은 학습 처리량과 29~32% 적은 메모리 사용량을 기록했다.
  • •Expert Parallelism을 활용해 16개 노드 H100 클러스터에서 550B 규모의 거대 모델을 전면 파인튜닝할 수 있다.
  • •NVIDIA가 HuggingFace Transformers v5와 통합해 MoE 모델 파인튜닝 속도를 높이는 NeMo AutoModel을 출시했다.
  • •이 라이브러리는 30B MoE 모델에서 기존 대비 3.4~3.7배 높은 학습 처리량과 29~32% 적은 메모리 사용량을 기록했다.
  • •Expert Parallelism을 활용해 16개 노드 H100 클러스터에서 550B 규모의 거대 모델을 전면 파인튜닝할 수 있다.

NVIDIA는 HuggingFace Transformers v5 생태계와 통합하여 MoE 모델의 파인튜닝을 가속화하는 오픈소스 라이브러리인 NeMo AutoModel을 발표했다. NeMo AutoModel은 Expert Parallelism(EP), DeepEP 융합 디스패치 커널, 그리고 TransformerEngine을 결합해 기본 Transformers v5 설정 대비 3.4~3.7배 향상된 학습 처리량과 29~32% 감소한 GPU 메모리 사용량을 제공한다. 특히 기존 HuggingFace와 API 호환성을 유지하여, 단 한 줄의 import 코드 수정만으로도 사용자는 네이티브 Transformers에서 NeMo AutoModel로 손쉽게 전환할 수 있다.

Expert 가중치를 다수의 GPU에 분산하는 방식을 통해, NeMo AutoModel은 기존 라이브러리가 감당하기 어려운 초대형 모델의 학습을 지원한다. 8개의 H100 80GB GPU가 탑재된 단일 노드 벤치마크 결과, Qwen3-30B-A3B 모델 기준 GPU당 초당 11,340 토큰(TPS)의 학습 처리량을 기록하며 기존 3,075 TPS를 크게 앞질렀다. 이때 메모리 점유율 또한 68.2 GiB에서 48.1 GiB로 줄었다. Nemotron 3 Nano 30B-A3B 모델에서도 유사하게 15,421 TPS의 성능과 42.5 GiB의 메모리 사용량을 보이며 기존 62.1 GiB 대비 개선된 효율을 증명했다.

대규모 환경에서는 Mamba2와 LatentMoE 등 하이브리드 아키텍처를 포함한 550B 규모의 Nemotron 3 Ultra 550B A55B 모델도 전면 파인튜닝이 가능하다. 16개의 H100 노드(총 128개 GPU)에서 Expert Parallelism을 64로 설정해 테스트한 결과, GPU당 815 TPS와 293 TFLOP/s의 성능을 보였다. NeMo AutoModel은 Transformers v5의 동적 가중치 로딩 시스템을 기반으로 작동하며, 이를 통해 내보낸 모델은 vLLM이나 SGLang 같은 표준 추론 도구와도 완벽하게 호환된다. 이 라이브러리는 현재 Qwen3, Nemotron, GPT-OSS, DeepSeek V3 등 주요 아키텍처에 최적화되어 있다.

NVIDIA는 HuggingFace Transformers v5 생태계와 통합하여 MoE 모델의 파인튜닝을 가속화하는 오픈소스 라이브러리인 NeMo AutoModel을 발표했다. NeMo AutoModel은 Expert Parallelism(EP), DeepEP 융합 디스패치 커널, 그리고 TransformerEngine을 결합해 기본 Transformers v5 설정 대비 3.4~3.7배 향상된 학습 처리량과 29~32% 감소한 GPU 메모리 사용량을 제공한다. 특히 기존 HuggingFace와 API 호환성을 유지하여, 단 한 줄의 import 코드 수정만으로도 사용자는 네이티브 Transformers에서 NeMo AutoModel로 손쉽게 전환할 수 있다.

Expert 가중치를 다수의 GPU에 분산하는 방식을 통해, NeMo AutoModel은 기존 라이브러리가 감당하기 어려운 초대형 모델의 학습을 지원한다. 8개의 H100 80GB GPU가 탑재된 단일 노드 벤치마크 결과, Qwen3-30B-A3B 모델 기준 GPU당 초당 11,340 토큰(TPS)의 학습 처리량을 기록하며 기존 3,075 TPS를 크게 앞질렀다. 이때 메모리 점유율 또한 68.2 GiB에서 48.1 GiB로 줄었다. Nemotron 3 Nano 30B-A3B 모델에서도 유사하게 15,421 TPS의 성능과 42.5 GiB의 메모리 사용량을 보이며 기존 62.1 GiB 대비 개선된 효율을 증명했다.

대규모 환경에서는 Mamba2와 LatentMoE 등 하이브리드 아키텍처를 포함한 550B 규모의 Nemotron 3 Ultra 550B A55B 모델도 전면 파인튜닝이 가능하다. 16개의 H100 노드(총 128개 GPU)에서 Expert Parallelism을 64로 설정해 테스트한 결과, GPU당 815 TPS와 293 TFLOP/s의 성능을 보였다. NeMo AutoModel은 Transformers v5의 동적 가중치 로딩 시스템을 기반으로 작동하며, 이를 통해 내보낸 모델은 vLLM이나 SGLang 같은 표준 추론 도구와도 완벽하게 호환된다. 이 라이브러리는 현재 Qwen3, Nemotron, GPT-OSS, DeepSeek V3 등 주요 아키텍처에 최적화되어 있다.

원문 보기 (영어)·2026년 6월 24일
인프라#nemo automodel#nvidia#moe#fine tuning#transformer#expert parallelism#huggingface