Moonshot AI, Kimi K3 공개
- •Moonshot AI가 2.8T 파라미터 MoE 모델 Kimi K3를 공개했다
- •Kimi K3는 네이티브 비전 기능과 1-million-token 컨텍스트 창으로 긴 시퀀스 작업을 지원한다
- •저자들은 Kimi K3가 Kimi K2보다 전체 스케일링 효율을 약 2.5x 개선했다고 밝혔다
Moonshot AI는 Jul 27 개방형 프런티어 지능 모델 Kimi K3를 공개했다. Hugging Face 논문 페이지는 taesiri가 Jul 28 제출했으며, 이날 #1 Paper로 올랐다. Kimi Team과 380명 이상의 추가 저자는 Kimi K3를 2.8T 파라미터 Mixture-of-Experts 모델(선택된 전문가 하위망만 라우팅)로 설명했다. 이 모델은 104 billion 활성 파라미터, 네이티브 비전 기능, 1-million-token 컨텍스트 창을 갖췄다.
초록에 따르면 Kimi K3는 Kimi Delta Attention과 Attention Residuals를 사용해 시퀀스 길이와 모델 깊이에 걸친 정보 흐름을 개선한다. 또한 Stable Latent MoE를 적용해 토큰마다 896개 라우팅 전문가 중 16개를 활성화하며, 정교화된 학습 방식과 데이터 레시피도 함께 사용한다. 저자들은 이러한 변화로 Kimi K2 대비 전체 스케일링 효율이 약 2.5x 향상됐다고 밝혔다.
Kimi K3의 사후 학습은 일반, 에이전트형, 코딩 영역 전반의 강화 학습에 초점을 두며, 여러 단계의 추론 노력 수준을 포함한다. 논문은 이 설정이 조합적 일반화와 안정적인 장기 실행을 가능하게 한다고 설명했다. 2.8T 규모에서 저자들은 KDA를 위한 알고리즘-시스템 공동 설계, 효율적 메모리 관리를 갖춘 균형 잡힌 전문가 병렬 학습, 지속적 롤아웃과 샌드박스 상태를 사용하는 million-token 에이전트형 RL, 배포 혁신 등 인프라 진전을 언급했다.
저자들은 광범위한 평가에서 Kimi K3가 장기 코딩, 에이전트형, 지식, 추론, 비전 작업 전반에서 프런티어 수준 성능에 도달했다고 보고했다. 전체 성능은 초록에 언급된 가장 강력한 독점 모델인 Claude Fable 5와 GPT-5.6 Sol에는 아직 뒤처진다. 다만 논문은 Kimi K3가 평가된 제품군에서 다른 개방형 및 독점 모델을 일관되게 앞선다고 밝혔다. Moonshot AI는 향후 연구와 프런티어 지능의 더 넓은 배포 및 채택을 지원하기 위해 Kimi K3 전체 모델 가중치를 공개했다.