AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

Webエージェントの自己学習を促す「DeepSearch-Evolve」公開

Webエージェントの自己学習を促す「DeepSearch-Evolve」公開

HuggingFace·2026年7月22日 (水)
  • •研究チームは、Webエージェントの性能を向上させる自己蒸留フレームワーク「DeepSearch-Evolve」を発表した。
  • •モデル「DeepSearch-World-9B」はBrowseCompで31.2%、GAIAで61.5%、HotpotQAで93.4%のスコアを記録した。
  • •DeepSearch-Worldは、長期的なタスクをこなすエージェント向けに420K件のマルチホップQAタスクを提供する。
  • •研究チームは、Webエージェントの性能を向上させる自己蒸留フレームワーク「DeepSearch-Evolve」を発表した。
  • •モデル「DeepSearch-World-9B」はBrowseCompで31.2%、GAIAで61.5%、HotpotQAで93.4%のスコアを記録した。
  • •DeepSearch-Worldは、長期的なタスクをこなすエージェント向けに420K件のマルチホップQAタスクを提供する。
  • •研究チームは、Webエージェントの性能を向上させる自己蒸留フレームワーク「DeepSearch-Evolve」を発表した。
  • •モデル「DeepSearch-World-9B」はBrowseCompで31.2%、GAIAで61.5%、HotpotQAで93.4%のスコアを記録した。
  • •DeepSearch-Worldは、長期的なタスクをこなすエージェント向けに420K件のマルチホップQAタスクを提供する。
  • •研究チームは、Webエージェントの性能を向上させる自己蒸留フレームワーク「DeepSearch-Evolve」を発表した。
  • •モデル「DeepSearch-World-9B」はBrowseCompで31.2%、GAIAで61.5%、HotpotQAで93.4%のスコアを記録した。
  • •DeepSearch-Worldは、長期的なタスクをこなすエージェント向けに420K件のマルチホップQAタスクを提供する。

研究チームは、Webエージェントが自身の経験から学習することを可能にする自己蒸留フレームワーク「DeepSearch-Evolve」を導入した。このアプローチは、教師モデルの固定された軌跡に依存する教師ありファインチューニングや、長期タスクで報酬が疎になりがちな強化学習の限界を補完する。本フレームワークは、再現可能な検索やページ閲覧機能を備えた確定的かつ検証可能な環境「DeepSearch-World」上で動作する。

DeepSearch-Worldは、進捗確認、根拠に基づいた振り返り、失敗からの回復といったエージェントの認知行動の基盤となる。ここにはエンティティレベルのランダムウォークにより生成された420K件のマルチホップQAタスクが含まれており、これらは手動ラベル付けなしで真の軌跡データを提供する。DeepSearch-Evolveのプロセスでは、軌跡の反復生成、結果のフィルタリング、データの混合、ファインチューニングを通じてエージェントの性能を強化する。

研究チームは、より大規模なモデルからの知識蒸留を行わずに「DeepSearch-World-9B」モデルを評価した。その結果、BrowseCompで31.2%、GAIAで61.5%、HotpotQAで93.4%という高いベンチマークスコアを達成した。これらの成果は、検証可能な環境がWebエージェントの拡張可能な自己進化を支えることを示している。チームは研究を促進するため、環境、420K件の学習プール、検証セット、モデルのウェイト、および関連コードを公開する予定だ。

研究チームは、Webエージェントが自身の経験から学習することを可能にする自己蒸留フレームワーク「DeepSearch-Evolve」を導入した。このアプローチは、教師モデルの固定された軌跡に依存する教師ありファインチューニングや、長期タスクで報酬が疎になりがちな強化学習の限界を補完する。本フレームワークは、再現可能な検索やページ閲覧機能を備えた確定的かつ検証可能な環境「DeepSearch-World」上で動作する。

DeepSearch-Worldは、進捗確認、根拠に基づいた振り返り、失敗からの回復といったエージェントの認知行動の基盤となる。ここにはエンティティレベルのランダムウォークにより生成された420K件のマルチホップQAタスクが含まれており、これらは手動ラベル付けなしで真の軌跡データを提供する。DeepSearch-Evolveのプロセスでは、軌跡の反復生成、結果のフィルタリング、データの混合、ファインチューニングを通じてエージェントの性能を強化する。

研究チームは、より大規模なモデルからの知識蒸留を行わずに「DeepSearch-World-9B」モデルを評価した。その結果、BrowseCompで31.2%、GAIAで61.5%、HotpotQAで93.4%という高いベンチマークスコアを達成した。これらの成果は、検証可能な環境がWebエージェントの拡張可能な自己進化を支えることを示している。チームは研究を促進するため、環境、420K件の学習プール、検証セット、モデルのウェイト、および関連コードを公開する予定だ。

原文(英語)を読む·2026年7月22日
#agentic ai#web agents#self distillation#deepsearch world#fine tuning#multi hop qa