AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

Amazon SageMaker, NVIDIA Nemotron 3 모델 서버리스 커스텀 지원

Amazon SageMaker, NVIDIA Nemotron 3 모델 서버리스 커스텀 지원

AWS ML Blog·2026년 7월 11일 (토)
  • •Amazon SageMaker AI에서 NVIDIA Nemotron 3 Nano 및 Super 모델에 대한 서버리스 커스텀 기능을 지원한다.
  • •Nemotron 3 아키텍처는 Mamba-Transformer 기반 Mixture-of-Experts 설계를 통해 처리량과 정확도를 최적화했다.
  • •SageMaker AI는 인프라 관리 없이 SFT, RLVR, RLAIF를 활용한 모델 파인튜닝을 지원한다.
  • •Amazon SageMaker AI에서 NVIDIA Nemotron 3 Nano 및 Super 모델에 대한 서버리스 커스텀 기능을 지원한다.
  • •Nemotron 3 아키텍처는 Mamba-Transformer 기반 Mixture-of-Experts 설계를 통해 처리량과 정확도를 최적화했다.
  • •SageMaker AI는 인프라 관리 없이 SFT, RLVR, RLAIF를 활용한 모델 파인튜닝을 지원한다.

Amazon SageMaker AI가 NVIDIA Nemotron 3 오픈 웨이트 모델 제품군에 대한 서버리스 커스텀 기능을 제공한다. 이를 통해 기업은 인프라를 직접 관리할 필요 없이 특정 업무 환경에 맞춰 모델을 파인튜닝할 수 있다. 지원 모델은 Nemotron 3 Nano(총 30B 파라미터, 3B 활성)와 Nemotron 3 Super(총 120B 파라미터, 12B 활성)다. 기업은 지도 미세 조정(SFT), 검증 가능한 보상을 활용한 강화학습(RLVR), AI 피드백을 활용한 강화학습(RLAIF) 기법을 사용하여 데이터와 도메인에 최적화된 모델을 구축할 수 있다.

NVIDIA Nemotron 3 아키텍처는 최대 1M 토큰의 컨텍스트 길이를 지원하는 하이브리드 Mamba-Transformer Mixture-of-Experts(MoE) 구조를 채택했다. 해당 구조는 시퀀스 처리를 위한 Mamba-2 계층, 리콜 성능 향상을 위한 트랜스포머 어텐션 계층, 토큰 압축을 위한 LatentMoE 계층이 혼합되어 있다. Super 모델의 경우 전체 120B 파라미터 중 12B만 활성화하는 방식 등으로 연산 비용을 절감하면서도 높은 처리량과 정확도를 달성한다. 이 모델들은 다중 환경 강화학습 프레임워크인 NeMo Gym을 통해 정렬되어 복잡한 에이전트 작업 수행이 가능하다.

사용자는 Amazon SageMaker Studio 콘솔이나 SageMaker Python SDK를 통해 커스텀 작업을 시작할 수 있다. JSON Lines(JSONL) 형식의 데이터가 필요하며, SageMaker는 연산 자원 할당과 학습 과정을 자동 조율한다. 학습 중에는 MLflow를 통해 손실값, 그래디언트 노름, 보상 신호 등을 모니터링할 수 있다. 학습 완료 후에는 Amazon Bedrock 모델을 활용한 'LLM-as-a-Judge' 평가 방식이나 MMLU, BBH, MATH와 같은 학술 벤치마크를 통해 모델 성능을 측정한다.

학습된 모델은 SageMaker 추론 엔드포인트에 바로 배포하거나 Amazon S3 버킷에서 가중치를 다운로드할 수 있다. 이때 저차원 적응(LoRA) 어댑터를 병합하여 추론 효율을 높일 수 있다. 예를 들어, Nemotron 3 Nano 30B 모델은 NVIDIA L40S Tensor Core GPU를 탑재한 ml.g6e 인스턴스에 배포 가능하다. 비용은 커스텀 단계에서 실제 사용한 연산량에 따라 결정된다.

Amazon SageMaker AI가 NVIDIA Nemotron 3 오픈 웨이트 모델 제품군에 대한 서버리스 커스텀 기능을 제공한다. 이를 통해 기업은 인프라를 직접 관리할 필요 없이 특정 업무 환경에 맞춰 모델을 파인튜닝할 수 있다. 지원 모델은 Nemotron 3 Nano(총 30B 파라미터, 3B 활성)와 Nemotron 3 Super(총 120B 파라미터, 12B 활성)다. 기업은 지도 미세 조정(SFT), 검증 가능한 보상을 활용한 강화학습(RLVR), AI 피드백을 활용한 강화학습(RLAIF) 기법을 사용하여 데이터와 도메인에 최적화된 모델을 구축할 수 있다.

NVIDIA Nemotron 3 아키텍처는 최대 1M 토큰의 컨텍스트 길이를 지원하는 하이브리드 Mamba-Transformer Mixture-of-Experts(MoE) 구조를 채택했다. 해당 구조는 시퀀스 처리를 위한 Mamba-2 계층, 리콜 성능 향상을 위한 트랜스포머 어텐션 계층, 토큰 압축을 위한 LatentMoE 계층이 혼합되어 있다. Super 모델의 경우 전체 120B 파라미터 중 12B만 활성화하는 방식 등으로 연산 비용을 절감하면서도 높은 처리량과 정확도를 달성한다. 이 모델들은 다중 환경 강화학습 프레임워크인 NeMo Gym을 통해 정렬되어 복잡한 에이전트 작업 수행이 가능하다.

사용자는 Amazon SageMaker Studio 콘솔이나 SageMaker Python SDK를 통해 커스텀 작업을 시작할 수 있다. JSON Lines(JSONL) 형식의 데이터가 필요하며, SageMaker는 연산 자원 할당과 학습 과정을 자동 조율한다. 학습 중에는 MLflow를 통해 손실값, 그래디언트 노름, 보상 신호 등을 모니터링할 수 있다. 학습 완료 후에는 Amazon Bedrock 모델을 활용한 'LLM-as-a-Judge' 평가 방식이나 MMLU, BBH, MATH와 같은 학술 벤치마크를 통해 모델 성능을 측정한다.

학습된 모델은 SageMaker 추론 엔드포인트에 바로 배포하거나 Amazon S3 버킷에서 가중치를 다운로드할 수 있다. 이때 저차원 적응(LoRA) 어댑터를 병합하여 추론 효율을 높일 수 있다. 예를 들어, Nemotron 3 Nano 30B 모델은 NVIDIA L40S Tensor Core GPU를 탑재한 ml.g6e 인스턴스에 배포 가능하다. 비용은 커스텀 단계에서 실제 사용한 연산량에 따라 결정된다.

원문 보기 (영어)·2026년 7월 10일
인프라#sagemaker#nemotron#fine tuning#llm#moe#lora