DataFlex-RL、RLVRデータ方針を検証
- •DataFlex-RLは、統一されたGRPO手法の下でRLVRのデータ方針を管理実験により比較した
- •Uniform GRPOは未訓練チェックポイント比で、領域均衡平均精度を7.76ポイント改善した
- •数学偏重の6ベンチマーク採点は、12ベンチマーク要約との順位相関が-0.33だった
北京大学の研究者、ハオ・リャン(Hao Liang)、ミンルイ・チェン(Mingrui Chen)、ヘンイ・フォン(Hengyi Feng)、メイイー・チャン(Meiyi Qiang)、ウェンタオ・チャン(Wentao Zhang)は、検証可能な報酬付き強化学習、すなわち明確な正解で報酬を確認できるRLVRのデータ方針を検証する評価基盤DataFlex-RLを公開した。Sep 5に公開され、Sep 14にHugging Face Papersへ投稿された論文は、統一されたGRPO手法(モデル訓練のための方策最適化手法)の下で、どのロールアウトを使うか、どの程度強く重み付けするか、どの領域を後続の訓練バッチに入れるかを比較した。
主要実験は、Qwen2.5-7B-Baseと数学、論理、科学の12ベンチマークを用い、12の対応シードで13構成を検証した。Uniform GRPOは、未訓練チェックポイントから領域均衡平均精度を7.76ポイント引き上げた。8つのロールアウト選択または再重み付け手法のいずれも、均一サンプリングとの差についてゼロを除外する対応あり95%信頼区間に達せず、3つの適応混合も同じ精度水準で固定の均等混合を上回らなかった。
Llama-3.1-8B-Baseで補正した12シード拡張は、追加手法を元の対照群と同じスコア尺度に載せたが、観測平均性能で一貫した勝者は示さなかった。研究者らはさらに、9つのQwen2.5-7B-Instruct実行を、5つの数学ベンチマークとGPQA-Diamondから成り、論理ベンチマークを含まない数学偏重の6ベンチマーク要約で再採点した。その順位は、領域均衡の12ベンチマーク要約に対して相関係数-0.33を示した一方、12ベンチマークすべてを残した要約はおおむね一致した。