AWS, Cosmos 3 모델 팩토리 구축
- •AWS는 NVIDIA Cosmos 3와 Amazon SageMaker HyperPod를 활용한 Physical AI 모델 팩토리 구성을 설명했다
- •Cosmos3-Nano는 16B 매개변수, Cosmos3-Super는 64B, Cosmos3-Edge는 온디바이스용 4B 계층이다
- •세 가지 워크로드는 8x NVIDIA H200 GPU를 갖춘 p5en.48xlarge 노드와 실제 체크포인트에서 실행됐다
AWS는 2026년 9월 4일 머신러닝 블로그에서 NVIDIA Cosmos 3와 Amazon SageMaker HyperPod를 활용해 Physical AI 모델 팩토리를 구축하는 방법을 공개했다. 이 구성은 단일 학습 작업이 아니라 합성 데이터 생성, 모델 사후 학습, 폐쇄 루프 시뮬레이션, 배포, 새로운 실제 데이터 수집을 계속 순환해야 하는 로보틱스와 자율주행차 팀을 겨냥한다.
게시물에 따르면 Cosmos 3는 비디오, 이미지, 행동, 소리를 하나의 토큰 스트림으로 처리하는 개방형 옴니모달 월드 파운데이션 모델이다. Mixture-of-Transformers 구조는 모든 계층에서 결합된 두 전문가를 쓰며, 하나는 다음 토큰을 예측하는 추론기이고 다른 하나는 비디오, 오디오, 행동의 노이즈를 제거하는 생성기다. 로봇 배포 시 같은 모델은 더 적은 노이즈 제거 단계를 실행하고 비디오 디코딩을 건너뛰지만, 내부적으로는 행동 토큰을 고정하기 위한 비디오 잠재 표현을 만든다.
Cosmos 3는 어떤 토큰을 노이즈로 시작하느냐에 따라 세 가지 행동 모드로 작동한다. 순방향 동역학은 행동을 깨끗하게 유지하고 비디오를 노이즈 상태로 둬 합성 미래 비디오를 생성한다. 역방향 동역학은 비디오를 깨끗하게 유지하고 행동을 노이즈 상태로 둬 시각 변화의 원인이 된 행동에 라벨을 붙인다. 정책 모드는 3-view 이미지와 고유수용감각(몸 위치 감지)을 조건으로 삼아 32개 미래 관절 위치를 출력하며, 예측 비디오 프레임은 근거 부산물로 나온다.
모델군은 dense 8B 매개변수 Qwen3-VL 백본을 쓰는 16B 매개변수 Cosmos3-Nano, dense 32B 매개변수 Qwen3-VL 백본을 쓰는 64B 매개변수 Cosmos3-Super, 온디바이스 배포용 compact 4B 계층인 Cosmos3-Edge로 구성된다. NVIDIA는 Cosmos 3를 Linux Foundation의 OpenMDW-1.1 라이선스로 공개했고, Cosmos 3 기술 보고서에서 구조를 설명했다.
AWS는 Physical AI 파이프라인에 전용 용량이 필요하다고 주장한다. 팀이 단계별로 GPU를 확보할 때 GPU 가용성, 리드타임, Availability Zone, Region이 달라질 수 있기 때문이다. 비용 지표는 GPU goodput으로, 게시물은 이를 전체 루프에서 예약 GPU-hour당 유용한 파이프라인 진행량으로 정의한다. 예약 용량은 파이프라인이 실제로 진전되지 않아도 비용이 발생한다는 이유에서다.
Amazon EKS 기반 Amazon SageMaker HyperPod는 하나의 지속 GPU 풀과 하나의 제어 평면을 위한 클러스터 계층으로 제시됐다. 생성은 vLLM-Omni 서버에서 실행되고, 사후 학습은 FSDP2와 Ulysses context parallelism을 적용한 torchrun 기반 cosmos-framework에서 실행된다. 평가는 단일 GPU 정책 서버에서 수행된다. Amazon S3가 데이터 저장소 연결로 뒷받침하는 Amazon FSx for Lustre는 한 번 마운트되어 생성, 사후 학습, 평가가 같은 스토리지 경로를 공유한다.
루프는 네 단계로 구성된다. DROID, BridgeData2, AV 센서 로그 같은 Physical AI 데이터를 Amazon S3와 Amazon FSx for Lustre로 수집·정제하고, Cosmos3-Super 교사 모델로 합성 데이터를 생성한다. 이어 결합된 말뭉치로 배포 가능한 Cosmos3-Nano 정책을 사후 학습하며 Nano와 Super 전반에서 비전 미세조정을 수행한다. 마지막으로 폐쇄 루프 시뮬레이션에서 정책을 평가해 실패 사례를 새 생성 목표로 전환한다.
게시물은 SageMaker HyperPod가 결함 노드를 지속적으로 감지하고 재부팅하거나 교체한다고 설명한다. 관리형 작업 자동 재개 기능은 Kubeflow PyTorchJob이 pod gang을 다시 만들고, NCCL이 다시 구성되며, cosmos-framework가 최신 PyTorch Distributed Checkpoint에서 재개되도록 한다. 명시된 복구 비용은 다시 수행해야 하는 작업이 최대 하나의 체크포인트 간격이며, 여기에 노드 교체와 재스케줄 지연시간이 더해진다.
솔루션은 세 가지 대표 워크로드를 사후 학습하고 생성과 평가를 끝까지 실행한다. 세 워크로드 모두 8x NVIDIA H200 GPU를 갖춘 p5en.48xlarge 노드와 실제 체크포인트에서 실행됐다. 세부 항목은 약 16B 매개변수 Cosmos3-Nano 기반 DROID 로봇 정책, 약 16B 매개변수 Cosmos3-Nano 기반 비전 지도 미세조정 워크로드, 약 64B 매개변수 Cosmos3-Super 기반 비전 Low-Rank Adaptation 워크로드다.