NCP-ArchPreview, 잠재공간 언어모델 진전
- •NCP-ArchPreview는 잠재공간 언어모델링을 위해 next-token과 Next Concept Prediction 목표를 함께 학습했다
- •8.9B 파라미터 모델은 5.73T Dolma-3 토큰으로 학습했고 51.3% 토큰만으로 OLMo-3-7B 손실과 같아졌다
- •전체 사전학습 뒤 OLMo-3-7B보다 macro-average 2.45포인트 앞섰고 GSM8K에서는 5.99포인트 높았다
NCP Team은 Sep 9 NCP-ArchPreview를 공개했고, Sep 11 Hugging Face Papers에 대형 잠재공간 언어모델에 관한 기술 보고서로 제출했다. 논문 페이지는 NCP-ArchPreview를 129개 추천을 받은 #1 Paper of the day로 표시했으며, 이 모델은 사전학습 효율과 다운스트림 성능을 높이기 위해 next-token prediction과 Next Concept Prediction(여러 토큰 개념 예측)을 함께 학습한다고 설명했다.
NCP-ArchPreview는 표준 next-token prediction을 넘어 여러 토큰에 걸친 이산 개념도 학습하면서 토큰 단위 자기회귀 생성을 유지한다. 이 모델은 은닉 상태에서 product-quantized concept vocabulary(압축된 이산 개념 코드)를 만들고, 전용 Concept Module로 미래 개념을 예측한 뒤, 예측된 개념을 다시 토큰 수준에 넣어 이후 생성을 안내한다.
아키텍처는 8.9B 파라미터 규모로 확장됐고 Dolma-3 데이터셋의 5.73T 토큰으로 학습됐다. 저자들은 이를 지금까지 가장 큰 잠재공간 언어모델 시연이라고 불렀다. NCP-ArchPreview는 전체 학습 토큰의 51.3%만 사용하고도 OLMo-3-7B의 최종 사전학습 손실과 같아졌으며, 전체 사전학습 뒤에는 다운스트림 macro-average에서 OLMo-3-7B를 2.45포인트 앞섰고 GSM8K에서는 5.99포인트 향상됐다.
통제 실험은 성능 향상이 잠재 아키텍처와 NCP 목표 양쪽에서 나왔다고 봤다. NCP-ArchPreview는 표준 계산량의 85%만으로도 파라미터를 엄격히 맞춘 8.9B 기준 모델의 학습 손실에 근접했다. 또한 사전학습 뒤에는 17M 파라미터 VQ 모듈만 업데이트해 도메인 적응을 위한 가벼운 인터페이스를 제공했고, DFlash2 drafter에 개념 표현을 주입하자 무시할 만한 오버헤드로 mean accepted length가 4.17% 개선됐다.