AIの探索能力を測るExplorationBench
- •ExplorationBenchが、検証可能な架空世界でAIが未知のルールを発見し、適用できるかを評価
- •ベンチマークはAlien Codeの31目標・70タスクと、Alien Logicの24目標・70タスクで構成
- •10システムを評価し、最も高性能なシステムは未知のルールを学習した一方、探索の継続で成績が停滞・低下する場合も
研究者らは、AIシステムが検証可能な架空世界を探索し、未知のルールを発見して適用できるかを評価するベンチマーク「ExplorationBench」を発表しました。科学的な探索能力の評価には、仮説が本当に新しいかを確かめることと、探索による発見を事前学習データにある知識の想起と区別することという課題があります。架空世界のルールは実行可能で厳密に検証でき、既知の知識と矛盾するため、記憶だけでは課題を解けません。
ExplorationBenchは2つのサンドボックスで構成されます。Alien Codeには発見目標31件とタスク70件、Alien Logicには発見目標24件とタスク70件があります。それぞれに不完全なマニュアル、タスクごとの環境フィードバック、専用のツール呼び出し形式が用意されています。システムはこれらを使って探索した後、学習時に提示されていないタスクを解きます。
研究者らはAIシステム10種類を評価しました。最も高性能なシステムは未知のルールを学習して適用できましたが、探索経路によって成績には大きな差がありました。探索を続けても進展が止まったり、それまでの成果が損なわれたりする場合もありました。論文は2026年9月24日に公開され、9月25日に投稿されました。ページにはTencent Hunyuanと9件の賛成票も記載されています。
このプロジェクトでは、科学的発見を仮説の形成、実験の設計、結果に基づく反復として捉えています。テストでは世界のルールを検証可能にしつつ、タスクの解答は明かしません。これにより、研究者はシステムが探索から何を学ぶのかを、すでに記憶している可能性のある知識とは分けて評価できます。著者らは、未知の環境を探索して新しい知識を獲得し、適用するシステムに向けた一歩だと説明しています。