Multiverse、LLM剪定を物理最適化へ
- •Multiverseは、LLMのブロック削除をIsing最適化に写像し、圧縮モデルの高速化を狙った
- •CBOはLlama-3.3-70Bの40/80ブロック削除後、MMLUで76.9を記録した
- •オープンソースのtabu solverは、検証可能な最低エネルギー状態に数秒で到達したとされた
Multiverse Computingの研究者はSeptember 21の論文で、大規模言語モデルのブロック削除を制約付き二値最適化問題として扱い、ベンチマーク品質を保ちながらtransformerブロック全体を削除してモデルを高速化する方法を示した。CBOと呼ばれる手法は各ブロックに二値の選択を割り当て、0を保持、1を削除とし、N個のブロックからM個を選んで削除する組み合わせのうち、エネルギー関数を最小化するものを探す。著者らは、depth pruningとも呼ばれるブロック削除が予測可能な推論高速化とメモリ節約をもたらし、quantization、low-rank compression、その他の圧縮技術と併用できると述べた。
論文「LLM Compression by Block Removal with Constrained Binary Optimization」は、各ブロックを個別に採点するのではなく、ブロック選択をIsing glass(相互作用する変数を持つスピン系)に写像した。著者らは、既存のmagnitude、sensitivity、「block influence」ヒューリスティックはブロックをほぼ独立に扱うため、mean-field法に似ていると主張した。CBOはモデル損失の2次Taylor展開を使ってHessian行列を作り、対角成分で各ブロック単体の重要度を推定し、非対角成分でブロック削除判断のペアごとの結合を捉える。
最適化では、削除ブロック数を固定したままxᵀH⁰xを最小化するように、N個のうちどのM個を削除するかを問う。この固定された削除数は、Ising定式化では保存された磁化のように働く。Multiverseは、このスピン系の低エネルギー状態が、高性能な剪定済みモデルの安価な代理指標になると説明した。Hessianは小さなcalibration datasetに対するforward passとbackward passから一度だけ計算され、その後はフルモデルを実行したりベンチマークしたりせず、各剪定候補をエネルギー計算で順位付けできる。同じHessianはMの異なる値にも再利用できる。
扱いやすいケースでは、チームは単一GPUで構成を総当たり探索した。数百万通りの構成は数秒で処理され、最も難しい厳密ケースではLlama-3.3-70Bの80ブロックから8ブロックを削除し、約29 billion通りの構成にroughly two daysを要した。より大きな探索では、問題をQUBO(二次コストを持つ二値最適化)として書き換え、quantum annealing、QAOA、tabu search、specialized branch-and-boundを含む古典、量子、量子インスパイア型ソルバーに送れる。著者らは、総当たりで検証できた最難ケースで、オープンソースのtabu solverが最低エネルギー状態に数秒で到達したと報告した。
結果はLlama-3.1-8B-Instruct、Qwen3-14B、Llama-3.3-70B-Instructを対象にした。Llama-3.3-70B-Instructでは、再訓練なしの元モデルがMMLUで82.2を記録した。32/80ブロックを削除した場合、CBOは76.6で、block influenceの59.3を上回った。40/80ブロックを削除し、50% depth compressionに相当する条件では、CBOが76.9、block influenceが54.0となり、MMLUでalmost 23-pointの優位を示し、テストされたすべてのベンチマークでbaselineを上回った。Qwen3-14Bで12/40ブロックを削除した条件では、CBOがMMLUでabout 10 points先行した。
著者らは、Mamba2、attention、mixture-of-experts層を均一でないパターンで交互に配置するhybrid model、NVIDIA-Nemotron-3-Nano-30B-A3B-FP8もテストした。再訓練なしで2–3 MoE layersまたは2 attention layersを削除した場合、CBOはAIME25とGPQAでblock influenceを上回った。最良の剪定はしばしばground stateではなく低エネルギーのexcited stateであり、Llama-3.1-8B-Instructで16/32ブロックを削除した条件では、17th excited stateが初期ブロックを削除し、軽い再訓練後に複数ベンチマークでground stateを上回った。コードはgithub.com/CompactifAI/Block_removal_through_constrained_binary_optimizationでオープンソース化されている。