AWS, Kimi K3 배포 가이드 공개
- •AWS 가이드는 SageMaker HyperPod 또는 독립형 Amazon EKS 클러스터로 Kimi K3를 배포한다
- •Kimi K3는 2.8 trillion parameters, 896 experts, 1 Million Tokens context를 갖췄다
- •배포에는 8 NVIDIA B300 Blackwell Ultra GPUs가 탑재된 ml.p6-b300.48xlarge가 필요하다
AWS는 2026년 7월 30일 Moonshot AI의 Kimi K3를 AWS 인프라에서 실행하는 배포 가이드를 공개했다. Kimi K3는 2026년 7월 27일 공개된 2.8 trillion parameter 오픈 웨이트 모델이다. 가이드는 Inference Operator를 쓰는 Amazon SageMaker HyperPod와 독립형 Amazon Elastic Kubernetes Service 클러스터라는 2가지 배포 경로를 제시한다. AWS는 오픈 웨이트 모델이 이제 다단계 에이전트 워크플로, 고급 추론, 장기 코딩 작업을 처리하기 때문에 multi-trillion parameter 아키텍처 호스팅에는 목적형 인프라, 고성능 GPU 컴퓨트, 최적화된 서빙 프레임워크가 필요하다고 밝혔다.
Kimi K3는 혼합 전문가 모델(MoE), Kimi Delta Attention, Gated Multi Head Latent Attention, Stable LatentMoE 프레임워크를 사용한다. 이 모델은 896개 specialist experts에 분산된 2.8 trillion total parameters를 갖지만, 토큰당 16 experts만 활성화해 단일 forward pass에서 약 104 billion parameters만 작동한다. AWS는 이 설계가 Kimi K2보다 scaling efficiency를 2.5x 개선한다고 설명했다. 또한 Kimi K3는 1 Million Tokens context window, Text + Vision을 위한 Native Multimodal 지원, native tool calling, structured output, 다단계 문제 해결을 위한 always-on thinking mode를 제공한다.
Kimi K3 가중치는 Hugging Face의 moonshotai/Kimi-K3로 제공되며, 메모리 효율적 추론을 위한 4-bit numeric format인 MXFP4로 배포된다. AWS는 현재 Kimi K3 서빙에 vLLM day-0 inference container가 필요하며, 관련 커밋은 vllm/vllm-openai:kimi-k3에서 사용할 수 있다고 밝혔다. AWS는 해당 커밋이 향후 릴리스에서 main vLLM container로 이동할 예정이라고 설명했다. vLLM은 MoE 아키텍처, 텐서 병렬화, MXFP4 quantization을 지원하기 때문에 권장된다.
AWS에 따르면 Kimi K3에는 SageMaker 기준 ml.p6-b300.48xlarge로 표시되는 p6-b300 인스턴스가 필요하다. 이 인스턴스는 8 NVIDIA B300 Blackwell Ultra GPUs와 high-bandwidth interconnects를 갖춰 모델의 expert pool 전반에서 tensor-parallel inference를 수행한다. AWS는 2가지 용량 옵션도 제시했다. Flexible Training Plans는 SageMaker HyperPod에서 지속 워크로드용 committed capacity를 예약하며, EC2 Capacity Blocks는 정해진 기간 GPU 인스턴스를 예약해 Amazon EKS 워크로드에서 사용할 수 있다.
SageMaker HyperPod 경로에서 사용자는 Amazon EKS로 오케스트레이션되는 HyperPod 클러스터를 만들고, Quick setup 또는 Custom setup을 선택한 뒤 default Helm charts와 add-ons를 활성화한다. 이후 ml.p6-b300.48xlarge를 쓰는 worker group을 추가하고, Flexible Training Plan을 연결하거나 생성하며, Target Availability Zone을 예약 용량과 일치시킨다. 배포는 kubectl apply -f kimi-k3.yaml로 InferenceEndpointConfig manifest를 적용하는 방식이다. Inference Operator는 Hugging Face에서 모델을 내려받고 컨테이너를 스케줄링하며, health checks를 수행한 뒤 endpoint가 준비되면 OpenAI compatible API를 노출한다.
독립형 Amazon EKS 경로는 AI on EKS Kimi K3 recipe를 따른다. 이 recipe는 Terraform modules로 VPC networking, managed node groups, IAM roles를 포함한 GPU 최적화 EKS 클러스터를 만든다. EKS 흐름은 p6-b300.48xlarge Capacity Blocks를 예약하고 NVIDIA drivers와 Kubernetes device plugin을 설치한 뒤, tensor-parallel size of 8, MXFP4 load format, MoE backend settings로 vLLM container를 배포한다. 이후 LoadBalancer 또는 Ingress controller를 통해 port 8000을 노출해 OpenAI compatible /v1/chat/completions endpoint를 제공한다. AWS는 OpenAI Python SDK 또는 curl로 배포를 검증할 수 있으며, 정리 작업에는 Kubernetes resources, clusters 또는 node groups, 사용하지 않는 capacity reservations 삭제가 필요하다고 밝혔다.