TRACE、FP4強化学習のロールアウトを高速化
HuggingFace2026年10月7日 (水)
- •TRACE、ロールアウト経路の量子化結果を使ってFP4学習の丸めを調整
- •4つのMoE言語モデルで推論・コーディング・長期強化学習タスクを評価
- •BF16と同等の強化学習性能を報告、ロールアウトを最大5.4倍高速化
研究者のXin Wang、Hao Yu、Zhengyang Zhugeらは、専門家混合型言語モデルの強化学習(RL)訓練向けに、FP4量子化フレームワーク「TRACE」を提案しました。論文はarXivで公開され、10月6日にHugging Faceにも掲載されました。RL訓練で使うモデル出力を生成するロールアウトの計算・メモリ負荷に対処します。既存のFP4手法は訓練経路とロールアウト経路の量子化精度を別々に最適化しており、両経路の差を直接縮めていません。
TRACEは、ロールアウト経路の量子化結果を使って訓練経路のFP4丸めを決める、ロールアウト誘導型の量子化対応訓練を採用しています。さらに、深い層から選んだ仮数とスケールの情報をキャッシュし、この誘導に伴う保存・通信負荷を減らします。研究者らは4つの大規模MoE言語モデルを使い、推論、コーディング、長期強化学習タスクで評価しました。
研究者らによると、TRACEはFP4の重みと活性値に加え、FP4のKVキャッシュを使ったロールアウトにも対応し、BF16ロールアウトと同等の強化学習性能を示しました。ロールアウト速度は最大5.4倍となり、BF16で訓練した方策に後からFP4量子化を適用する手法より、最終的なFP4性能も高かったとしています。論文はDaniel Wangが10月7日にHugging Faceへ投稿し、同サイトの「本日の論文」で3位にランクされました。提供された掲載情報では、公開時点の賛成票は38件でした。