AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

AREX-2、反復学習でエージェントを改善

AREX-2、反復学習でエージェントを改善

HuggingFace·2026年10月2日 (金)
  • •北京智源人工智能研究院の研究者が9月29日にAREX-2を発表
  • •MLE-bench Liteで81.8、Frontier-CSで70.7を記録
  • •DeepSearch QAで93.8を達成し、試行回数の増加とともに性能向上
  • •北京智源人工智能研究院の研究者が9月29日にAREX-2を発表
  • •MLE-bench Liteで81.8、Frontier-CSで70.7を記録
  • •DeepSearch QAで93.8を達成し、試行回数の増加とともに性能向上
  • •北京智源人工智能研究院の研究者が9月29日にAREX-2を発表
  • •MLE-bench Liteで81.8、Frontier-CSで70.7を記録
  • •DeepSearch QAで93.8を達成し、試行回数の増加とともに性能向上
  • •北京智源人工智能研究院の研究者が9月29日にAREX-2を発表
  • •MLE-bench Liteで81.8、Frontier-CSで70.7を記録
  • •DeepSearch QAで93.8を達成し、試行回数の増加とともに性能向上

北京智源人工智能研究院の研究者は9月29日、テスト中に解決策を繰り返し改善し、大規模言語モデルのエージェントを向上させる手法「AREX-2」を発表しました。研究チームは自己改善を、テスト時に解決策を反復して磨くことと定義しています。改善につながる振り返りと、多くの試行を通じて改善を続ける長期実行が鍵だとしています。

研究者らは、この2つの能力は特定の分野に依存せず、信頼できる教師データがある環境で学習できると仮定しました。機械学習とアルゴリズムプログラミングの課題から、長期にわたる改善の軌跡を合成しました。これらの課題では、繰り返しの試行に対して検証可能なフィードバックと報酬を得られます。このデータで訓練したQwen3.8-27Bベースのエージェントは、MLE-bench Liteで81.8、Frontier-CSで70.7を記録しました。

エージェントは深い調査を要する課題にも対応し、BrowseCompで84.0、HLEで52.6、GAIAで92.2、DeepSearch QAで93.8を記録しました。研究者らによると、エージェントに与える試行回数の予算を増やすと性能も向上し続けました。長期にわたる振り返りのデータが、自己改善型エージェントを実現する道筋になると結論づけています。

北京智源人工智能研究院の研究者は9月29日、テスト中に解決策を繰り返し改善し、大規模言語モデルのエージェントを向上させる手法「AREX-2」を発表しました。研究チームは自己改善を、テスト時に解決策を反復して磨くことと定義しています。改善につながる振り返りと、多くの試行を通じて改善を続ける長期実行が鍵だとしています。

研究者らは、この2つの能力は特定の分野に依存せず、信頼できる教師データがある環境で学習できると仮定しました。機械学習とアルゴリズムプログラミングの課題から、長期にわたる改善の軌跡を合成しました。これらの課題では、繰り返しの試行に対して検証可能なフィードバックと報酬を得られます。このデータで訓練したQwen3.8-27Bベースのエージェントは、MLE-bench Liteで81.8、Frontier-CSで70.7を記録しました。

エージェントは深い調査を要する課題にも対応し、BrowseCompで84.0、HLEで52.6、GAIAで92.2、DeepSearch QAで93.8を記録しました。研究者らによると、エージェントに与える試行回数の予算を増やすと性能も向上し続けました。長期にわたる振り返りのデータが、自己改善型エージェントを実現する道筋になると結論づけています。

原文(英語)を読む·2026年10月2日
#arex 2#baai#qwen3.8 27b#self improving agents#long horizon execution#reflective tasks#mle bench lite#deepsearch qa