AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

大規模LLM蒸留を低コスト化

大規模LLM蒸留を低コスト化

HuggingFace Blog·2026年8月11日 (火)
  • •Multiverse Computingが、蒸留時の教師モデルメモリを減らすoffline top-100 logits cachingを提案した
  • •Fused chunked KLは32K-token benchmark memoryを85.2 GiBから5.45 GiBへ削減した
  • •GPT-OSS 20B distillationは32,768-token contextで4つのGPU nodesから1つへ縮小した
  • •Multiverse Computingが、蒸留時の教師モデルメモリを減らすoffline top-100 logits cachingを提案した
  • •Fused chunked KLは32K-token benchmark memoryを85.2 GiBから5.45 GiBへ削減した
  • •GPT-OSS 20B distillationは32,768-token contextで4つのGPU nodesから1つへ縮小した
  • •Multiverse Computingが、蒸留時の教師モデルメモリを減らすoffline top-100 logits cachingを提案した
  • •Fused chunked KLは32K-token benchmark memoryを85.2 GiBから5.45 GiBへ削減した
  • •GPT-OSS 20B distillationは32,768-token contextで4つのGPU nodesから1つへ縮小した
  • •Multiverse Computingが、蒸留時の教師モデルメモリを減らすoffline top-100 logits cachingを提案した
  • •Fused chunked KLは32K-token benchmark memoryを85.2 GiBから5.45 GiBへ削減した
  • •GPT-OSS 20B distillationは32,768-token contextで4つのGPU nodesから1つへ縮小した

Multiverse Computingの研究者はAugust 10, 2026、Hugging Faceの記事で、大規模言語モデルを対象に知識蒸留(大きなモデルを小さなモデルに模倣させる訓練)を安く実行する方法を説明した。記事によると、非常に大きなオープンソースモデルの登場で、配備コストが高くなり得るため蒸留の重要性が再び高まった。Kimi-K3は2.8 trillion parametersを持ち、ロードだけでroughly 3TB of VRAMを必要とする。著者らは、この広い手法に依存する最近の圧縮モデルとして、NvidiaのNemotron 3 Puzzle 75BとMultiverse ComputingのHypernova 60Bを挙げた。

記事は、従来のonline distillationが教師モデルと生徒モデルを同時にロードし、各トークンについて語彙全体の確率分布を生成するため、蒸留ステップが主なコスト問題になると指摘した。gpt-oss-120bでは語彙が201,088 tokensあり、sequence length 32K、batch size 4の場合、教師確率テンソルのshapeは4 x 201,088 x 32,768となり、bfloat16だけでabout 50GB of VRAMを使う。勾配、アクティベーション、モデル重み、オプティマイザ状態を加えると、1 training iterationのピークはroughly 250GB of VRAMに達し、単一のH200またはB200 GPUを上回る。

論文「Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss」は、2つのシステム変更を提案した。Offline distillationは教師出力を一度だけ計算し、各位置で最も可能性の高いtop-100 tokensをキャッシュし、そのキャッシュに対して生徒を訓練するため、訓練中に教師をメモリへ残す必要がなく、キャッシュはablationで再利用できる。fused, chunked KL loss(2つの確率分布を比較する損失)は、sequence chunksを1つずつ処理することで、full vocabulary-size x sequence-length matrixを実体化しない。

記事はDense KL、Forward-chunked KL、Fused chunked KLを比較した。Dense KLは、キャッシュされたtop-100 logitsから完全な教師確率グリッドを再構築し、生徒のdense log-probability gridと比較するため、full vocabulary x sequence gridを2回使う。Forward-chunked KLは教師を疎なまま保ち、lossをslice by sliceで計算するが、生徒のlogits gridは依然として完全に計算され、backward pass用に保持される。Fused chunked KLは出力射影をloss computationに融合し、1 chunkをend to endで処理して破棄し、backward pass中に各chunkを再計算する。記事は、これによりpeak memoryがsequence lengthに対して線形にのみ増えると述べた。

単一のH200 GPU、8K token context、教師にLlama 3.1 8B Instruct、生徒に3.2B Llama modelを使った実験で、4つの設定はいずれもほぼ同一のtraining lossに到達した。Online distillationは102.8 GB peak memory、25.9 s iteration time、237 TFLOP/s throughputだった。Offline dense KLは78.3 GB、18.5 s、331 TFLOP/s、offline forward-chunked KLは61.8 GB、18.4 s、335 TFLOP/s、offline fused chunked KLは58.3 GB、20.2 s、304 TFLOP/sだった。

Long-context testsではfused lossの効果が大きかった。toy output-projection networkを使ったisolated benchmarkで、32K tokens時のpeak memoryはdense lossの85.2 GiBからfully chunked versionの5.45 GiBへ低下し、15.6x reductionとなった一方、dense lossは64K tokens以降で失敗した。256K tokensではfully chunked lossが11.6 GiBを使い、next-best chunked variantの134.2 GiBを下回り、iterationあたりabout 3.3x fasterで動作した。GPT-OSS 20Bを32,768-token contextで蒸留した場合、構成は4つのGPU nodesから1つに縮小し、step timeは57.0から12.23 secondsへ短縮され、about 5x fasterとなり、throughput per GPUは74.2から345.7 TFLOP/sへ上がった。

生成された生徒モデルは、Llama 3.1 8B Instructからabout 3.2B parametersへ蒸留された。記事によると、BoolQとHellaSwagでは教師のaccuracyの大半を維持し、MMLUではabout nine points以内に収まりながら、parameter countは半分未満だった。著者らはchunked-loss implementationをgithub.com/CompactifAI/Full-Chunked-KL-Lossでオープンソース化し、論文にはloss choiceとsequence packingに関するablationsが含まれると述べた。

Multiverse Computingの研究者はAugust 10, 2026、Hugging Faceの記事で、大規模言語モデルを対象に知識蒸留(大きなモデルを小さなモデルに模倣させる訓練)を安く実行する方法を説明した。記事によると、非常に大きなオープンソースモデルの登場で、配備コストが高くなり得るため蒸留の重要性が再び高まった。Kimi-K3は2.8 trillion parametersを持ち、ロードだけでroughly 3TB of VRAMを必要とする。著者らは、この広い手法に依存する最近の圧縮モデルとして、NvidiaのNemotron 3 Puzzle 75BとMultiverse ComputingのHypernova 60Bを挙げた。

記事は、従来のonline distillationが教師モデルと生徒モデルを同時にロードし、各トークンについて語彙全体の確率分布を生成するため、蒸留ステップが主なコスト問題になると指摘した。gpt-oss-120bでは語彙が201,088 tokensあり、sequence length 32K、batch size 4の場合、教師確率テンソルのshapeは4 x 201,088 x 32,768となり、bfloat16だけでabout 50GB of VRAMを使う。勾配、アクティベーション、モデル重み、オプティマイザ状態を加えると、1 training iterationのピークはroughly 250GB of VRAMに達し、単一のH200またはB200 GPUを上回る。

論文「Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss」は、2つのシステム変更を提案した。Offline distillationは教師出力を一度だけ計算し、各位置で最も可能性の高いtop-100 tokensをキャッシュし、そのキャッシュに対して生徒を訓練するため、訓練中に教師をメモリへ残す必要がなく、キャッシュはablationで再利用できる。fused, chunked KL loss(2つの確率分布を比較する損失)は、sequence chunksを1つずつ処理することで、full vocabulary-size x sequence-length matrixを実体化しない。

記事はDense KL、Forward-chunked KL、Fused chunked KLを比較した。Dense KLは、キャッシュされたtop-100 logitsから完全な教師確率グリッドを再構築し、生徒のdense log-probability gridと比較するため、full vocabulary x sequence gridを2回使う。Forward-chunked KLは教師を疎なまま保ち、lossをslice by sliceで計算するが、生徒のlogits gridは依然として完全に計算され、backward pass用に保持される。Fused chunked KLは出力射影をloss computationに融合し、1 chunkをend to endで処理して破棄し、backward pass中に各chunkを再計算する。記事は、これによりpeak memoryがsequence lengthに対して線形にのみ増えると述べた。

単一のH200 GPU、8K token context、教師にLlama 3.1 8B Instruct、生徒に3.2B Llama modelを使った実験で、4つの設定はいずれもほぼ同一のtraining lossに到達した。Online distillationは102.8 GB peak memory、25.9 s iteration time、237 TFLOP/s throughputだった。Offline dense KLは78.3 GB、18.5 s、331 TFLOP/s、offline forward-chunked KLは61.8 GB、18.4 s、335 TFLOP/s、offline fused chunked KLは58.3 GB、20.2 s、304 TFLOP/sだった。

Long-context testsではfused lossの効果が大きかった。toy output-projection networkを使ったisolated benchmarkで、32K tokens時のpeak memoryはdense lossの85.2 GiBからfully chunked versionの5.45 GiBへ低下し、15.6x reductionとなった一方、dense lossは64K tokens以降で失敗した。256K tokensではfully chunked lossが11.6 GiBを使い、next-best chunked variantの134.2 GiBを下回り、iterationあたりabout 3.3x fasterで動作した。GPT-OSS 20Bを32,768-token contextで蒸留した場合、構成は4つのGPU nodesから1つに縮小し、step timeは57.0から12.23 secondsへ短縮され、about 5x fasterとなり、throughput per GPUは74.2から345.7 TFLOP/sへ上がった。

生成された生徒モデルは、Llama 3.1 8B Instructからabout 3.2B parametersへ蒸留された。記事によると、BoolQとHellaSwagでは教師のaccuracyの大半を維持し、MMLUではabout nine points以内に収まりながら、parameter countは半分未満だった。著者らはchunked-loss implementationをgithub.com/CompactifAI/Full-Chunked-KL-Lossでオープンソース化し、論文にはloss choiceとsequence packingに関するablationsが含まれると述べた。

原文(英語)を読む·2026年8月10日
インフラ#knowledge distillation#llm#multiverse computing#offline distillation#top k logits#kl loss#chunked loss#gpt oss#llama 3 1#vram