AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

DataFlex-RL、RLVRデータ方針を検証

DataFlex-RL、RLVRデータ方針を検証

HuggingFace·2026年9月15日 (火)
  • •DataFlex-RLは、統一されたGRPO手法の下でRLVRのデータ方針を管理実験により比較した
  • •Uniform GRPOは未訓練チェックポイント比で、領域均衡平均精度を7.76ポイント改善した
  • •数学偏重の6ベンチマーク採点は、12ベンチマーク要約との順位相関が-0.33だった
  • •DataFlex-RLは、統一されたGRPO手法の下でRLVRのデータ方針を管理実験により比較した
  • •Uniform GRPOは未訓練チェックポイント比で、領域均衡平均精度を7.76ポイント改善した
  • •数学偏重の6ベンチマーク採点は、12ベンチマーク要約との順位相関が-0.33だった
  • •DataFlex-RLは、統一されたGRPO手法の下でRLVRのデータ方針を管理実験により比較した
  • •Uniform GRPOは未訓練チェックポイント比で、領域均衡平均精度を7.76ポイント改善した
  • •数学偏重の6ベンチマーク採点は、12ベンチマーク要約との順位相関が-0.33だった
  • •DataFlex-RLは、統一されたGRPO手法の下でRLVRのデータ方針を管理実験により比較した
  • •Uniform GRPOは未訓練チェックポイント比で、領域均衡平均精度を7.76ポイント改善した
  • •数学偏重の6ベンチマーク採点は、12ベンチマーク要約との順位相関が-0.33だった

北京大学の研究者、ハオ・リャン(Hao Liang)、ミンルイ・チェン(Mingrui Chen)、ヘンイ・フォン(Hengyi Feng)、メイイー・チャン(Meiyi Qiang)、ウェンタオ・チャン(Wentao Zhang)は、検証可能な報酬付き強化学習、すなわち明確な正解で報酬を確認できるRLVRのデータ方針を検証する評価基盤DataFlex-RLを公開した。Sep 5に公開され、Sep 14にHugging Face Papersへ投稿された論文は、統一されたGRPO手法(モデル訓練のための方策最適化手法)の下で、どのロールアウトを使うか、どの程度強く重み付けするか、どの領域を後続の訓練バッチに入れるかを比較した。

主要実験は、Qwen2.5-7B-Baseと数学、論理、科学の12ベンチマークを用い、12の対応シードで13構成を検証した。Uniform GRPOは、未訓練チェックポイントから領域均衡平均精度を7.76ポイント引き上げた。8つのロールアウト選択または再重み付け手法のいずれも、均一サンプリングとの差についてゼロを除外する対応あり95%信頼区間に達せず、3つの適応混合も同じ精度水準で固定の均等混合を上回らなかった。

Llama-3.1-8B-Baseで補正した12シード拡張は、追加手法を元の対照群と同じスコア尺度に載せたが、観測平均性能で一貫した勝者は示さなかった。研究者らはさらに、9つのQwen2.5-7B-Instruct実行を、5つの数学ベンチマークとGPQA-Diamondから成り、論理ベンチマークを含まない数学偏重の6ベンチマーク要約で再採点した。その順位は、領域均衡の12ベンチマーク要約に対して相関係数-0.33を示した一方、12ベンチマークすべてを残した要約はおおむね一致した。

北京大学の研究者、ハオ・リャン(Hao Liang)、ミンルイ・チェン(Mingrui Chen)、ヘンイ・フォン(Hengyi Feng)、メイイー・チャン(Meiyi Qiang)、ウェンタオ・チャン(Wentao Zhang)は、検証可能な報酬付き強化学習、すなわち明確な正解で報酬を確認できるRLVRのデータ方針を検証する評価基盤DataFlex-RLを公開した。Sep 5に公開され、Sep 14にHugging Face Papersへ投稿された論文は、統一されたGRPO手法(モデル訓練のための方策最適化手法)の下で、どのロールアウトを使うか、どの程度強く重み付けするか、どの領域を後続の訓練バッチに入れるかを比較した。

主要実験は、Qwen2.5-7B-Baseと数学、論理、科学の12ベンチマークを用い、12の対応シードで13構成を検証した。Uniform GRPOは、未訓練チェックポイントから領域均衡平均精度を7.76ポイント引き上げた。8つのロールアウト選択または再重み付け手法のいずれも、均一サンプリングとの差についてゼロを除外する対応あり95%信頼区間に達せず、3つの適応混合も同じ精度水準で固定の均等混合を上回らなかった。

Llama-3.1-8B-Baseで補正した12シード拡張は、追加手法を元の対照群と同じスコア尺度に載せたが、観測平均性能で一貫した勝者は示さなかった。研究者らはさらに、9つのQwen2.5-7B-Instruct実行を、5つの数学ベンチマークとGPQA-Diamondから成り、論理ベンチマークを含まない数学偏重の6ベンチマーク要約で再採点した。その順位は、領域均衡の12ベンチマーク要約に対して相関係数-0.33を示した一方、12ベンチマークすべてを残した要約はおおむね一致した。

原文(英語)を読む·2026年9月15日
#dataflex rl#rlvr#grpo#qwen2 5 7b base#llama 3 1 8b base#rollout selection#reweighting#domain mixture#gpqa diamond