AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

Direct-OPDによるモデル間強化学習の効率的転送

Direct-OPDによるモデル間強化学習の効率的転送

HuggingFace·2026年7月15日 (水)
  • •Direct-OPDは、最終的なモデルの重みではなくポリシーのシフトを利用して、モデル間で強化学習の成果を転送する。
  • •新しい蒸留手法を用いることで、7BパラメータモデルのAIME 2024におけるスコアが56.7から63.1へ向上した。
  • •Qwen3-1.7Bモデルにおいて、8基のA100 GPUを用いて4時間でAIME 2024のスコアを48.3%から58.3%へ引き上げた。
  • •Direct-OPDは、最終的なモデルの重みではなくポリシーのシフトを利用して、モデル間で強化学習の成果を転送する。
  • •新しい蒸留手法を用いることで、7BパラメータモデルのAIME 2024におけるスコアが56.7から63.1へ向上した。
  • •Qwen3-1.7Bモデルにおいて、8基のA100 GPUを用いて4時間でAIME 2024のスコアを48.3%から58.3%へ引き上げた。

Direct-OPD(Direct On-Policy Distillation)は、強化学習による改善を小さな言語モデルから大きなモデルへと転送する新しい手法である。強化学習によって生じるポリシーの変化を暗黙的な報酬信号として活用することで、大きなターゲットモデルに対して高コストな強化学習(RL)を繰り返し実施することなく、効率的なスケーリングを実現する。清華大学AIRとByteDance Seedの共同研究チームであるSIA-Labが、モデルの規模拡大に伴うRLVR(検証可能な報酬を用いた強化学習)の計算コストというボトルネックを克服するために開発した。

強化学習後のモデルをそのまま蒸留する従来の手法は、小さな教師モデルの制限が学習済み改善点とともに反映されてしまうため、効果が限定的であった。Direct-OPDでは、強化学習プロセスの前後における教師モデルのチェックポイントを比較する。これらバージョン間の対数比を計算してポリシーの具体的な変化を特定し、その差分を密な暗黙的報酬信号として、より強力な生徒モデルのオンポリシー状態に適用する。

実証試験では、生徒モデルが教師モデルの性能を既に上回っている場合でも、Direct-OPDが有効であることが示された。AIME 2024ベンチマークを用いた実験では、7Bの生徒モデルがDirect-OPD学習後にスコア63.1を記録し、ベースラインの56.7から6.4ポイントの向上を達成した。これは、7Bモデルの性能を約50まで低下させた標準的なオンポリシー蒸留の結果とは対照的である。研究チームによれば、この手法は複数のポリシーシフトを順次合成できるため、強化学習の結果を単なるモデルの重みの模倣ではなく、転送可能な信号として再利用できるという。

Direct-OPD(Direct On-Policy Distillation)は、強化学習による改善を小さな言語モデルから大きなモデルへと転送する新しい手法である。強化学習によって生じるポリシーの変化を暗黙的な報酬信号として活用することで、大きなターゲットモデルに対して高コストな強化学習(RL)を繰り返し実施することなく、効率的なスケーリングを実現する。清華大学AIRとByteDance Seedの共同研究チームであるSIA-Labが、モデルの規模拡大に伴うRLVR(検証可能な報酬を用いた強化学習)の計算コストというボトルネックを克服するために開発した。

強化学習後のモデルをそのまま蒸留する従来の手法は、小さな教師モデルの制限が学習済み改善点とともに反映されてしまうため、効果が限定的であった。Direct-OPDでは、強化学習プロセスの前後における教師モデルのチェックポイントを比較する。これらバージョン間の対数比を計算してポリシーの具体的な変化を特定し、その差分を密な暗黙的報酬信号として、より強力な生徒モデルのオンポリシー状態に適用する。

実証試験では、生徒モデルが教師モデルの性能を既に上回っている場合でも、Direct-OPDが有効であることが示された。AIME 2024ベンチマークを用いた実験では、7Bの生徒モデルがDirect-OPD学習後にスコア63.1を記録し、ベースラインの56.7から6.4ポイントの向上を達成した。これは、7Bモデルの性能を約50まで低下させた標準的なオンポリシー蒸留の結果とは対照的である。研究チームによれば、この手法は複数のポリシーシフトを順次合成できるため、強化学習の結果を単なるモデルの重みの模倣ではなく、転送可能な信号として再利用できるという。

原文(英語)を読む·2026年7月15日
#direct opd#reinforcement learning#distillation#aime2024#qwen3#policy shift