AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

SSR、マルチモーダル検索エージェントの推論を高速化

SSR、マルチモーダル検索エージェントの推論を高速化

HuggingFace·2026年10月8日 (木)
  • •SSRは自由形式の推論を、各ターンで再利用可能な言語候補から選ぶ方式に置き換え
  • •7つのマルチモーダル検索ベンチマークで2B・4Bモデルを評価し、競争力のある成功率を報告
  • •ターンごとの推論遅延を90%超、質問ごとの推論遅延を28〜54%削減
  • •SSRは自由形式の推論を、各ターンで再利用可能な言語候補から選ぶ方式に置き換え
  • •7つのマルチモーダル検索ベンチマークで2B・4Bモデルを評価し、競争力のある成功率を報告
  • •ターンごとの推論遅延を90%超、質問ごとの推論遅延を28〜54%削減
  • •SSRは自由形式の推論を、各ターンで再利用可能な言語候補から選ぶ方式に置き換え
  • •7つのマルチモーダル検索ベンチマークで2B・4Bモデルを評価し、競争力のある成功率を報告
  • •ターンごとの推論遅延を90%超、質問ごとの推論遅延を28〜54%削減
  • •SSRは自由形式の推論を、各ターンで再利用可能な言語候補から選ぶ方式に置き換え
  • •7つのマルチモーダル検索ベンチマークで2B・4Bモデルを評価し、競争力のある成功率を報告
  • •ターンごとの推論遅延を90%超、質問ごとの推論遅延を28〜54%削減

カーネギーメロン大学などの研究者は、小型モデルを使うマルチモーダル検索エージェントの推論コストを抑える枠組み「Selection-based Structured Reasoning(SSR)」を発表しました。論文は10月1日に公開され、Xiaoyu Zhuが10月7日にHugging Faceへ提出しました。論文によると、小型モデルは次の行動の選択にあまり役立たない場合でも、行動の前に長い自由形式の推論を生成することがあります。

SSRでは、推論をあらかじめ用意した再利用可能な自然言語候補からの選択に置き換えます。各ターンでモデルは、現在の文脈における候補の尤度に基づいて選び、補助タスク用の出力ヘッドは使いません。研究者らは、教師強制によるプレフィルを使って候補を並列に採点し、候補内および候補間のトークン尤度を計算します。その際、生成時に再利用する注意情報を保存した文脈KVキャッシュを共有します。

研究チームは、2Bおよび4Bモデルを用い、複数の強化学習目的と教師あり微調整を組み合わせて、7つのマルチモーダル検索ベンチマークでSSRを評価しました。SSRは同規模の主要な検索エージェントと競争力のある平均成功率を維持しました。論文の要旨によると、タスク性能を保ちながら、ターンごとの推論遅延を90%超、質問ごとのモデル推論全体の遅延を28〜54%削減しました。著者らは、評価した各学習方式で効果が得られたと述べています。

カーネギーメロン大学などの研究者は、小型モデルを使うマルチモーダル検索エージェントの推論コストを抑える枠組み「Selection-based Structured Reasoning(SSR)」を発表しました。論文は10月1日に公開され、Xiaoyu Zhuが10月7日にHugging Faceへ提出しました。論文によると、小型モデルは次の行動の選択にあまり役立たない場合でも、行動の前に長い自由形式の推論を生成することがあります。

SSRでは、推論をあらかじめ用意した再利用可能な自然言語候補からの選択に置き換えます。各ターンでモデルは、現在の文脈における候補の尤度に基づいて選び、補助タスク用の出力ヘッドは使いません。研究者らは、教師強制によるプレフィルを使って候補を並列に採点し、候補内および候補間のトークン尤度を計算します。その際、生成時に再利用する注意情報を保存した文脈KVキャッシュを共有します。

研究チームは、2Bおよび4Bモデルを用い、複数の強化学習目的と教師あり微調整を組み合わせて、7つのマルチモーダル検索ベンチマークでSSRを評価しました。SSRは同規模の主要な検索エージェントと競争力のある平均成功率を維持しました。論文の要旨によると、タスク性能を保ちながら、ターンごとの推論遅延を90%超、質問ごとのモデル推論全体の遅延を28〜54%削減しました。著者らは、評価した各学習方式で効果が得られたと述べています。

原文(英語)を読む·2026年10月8日
#selection based structured reasoning#multimodal search agents#inference latency#kv cache#reinforcement learning#supervised fine tuning#2b models#4b models