AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

OSReward、操作エージェント評価を公開

OSReward、操作エージェント評価を公開

HuggingFace·2026年8月8日 (土)
  • •香港大学の研究者が、複数プラットフォームでコンピューター操作エージェントの軌跡を判定するOSRewardを公開した
  • •OSRewardは、難例向けのOSReward-Hardと細粒度評価向けのOSReward-Multiを含む
  • •OS-Shepherd 9Bと35Bは、商用判定モデルに匹敵しながらコストを30–60×削減した
  • •香港大学の研究者が、複数プラットフォームでコンピューター操作エージェントの軌跡を判定するOSRewardを公開した
  • •OSRewardは、難例向けのOSReward-Hardと細粒度評価向けのOSReward-Multiを含む
  • •OS-Shepherd 9Bと35Bは、商用判定モデルに匹敵しながらコストを30–60×削減した
  • •香港大学の研究者が、複数プラットフォームでコンピューター操作エージェントの軌跡を判定するOSRewardを公開した
  • •OSRewardは、難例向けのOSReward-Hardと細粒度評価向けのOSReward-Multiを含む
  • •OS-Shepherd 9Bと35Bは、商用判定モデルに匹敵しながらコストを30–60×削減した
  • •香港大学の研究者が、複数プラットフォームでコンピューター操作エージェントの軌跡を判定するOSRewardを公開した
  • •OSRewardは、難例向けのOSReward-Hardと細粒度評価向けのOSReward-Multiを含む
  • •OS-Shepherd 9Bと35Bは、商用判定モデルに匹敵しながらコストを30–60×削減した

香港大学NLP Groupの研究者は、コンピューター操作エージェントの軌跡を判定する視覚言語モデルを評価するベンチマーク、OSRewardを公開した。論文はJul 30に発表され、QiushiがAug 7にHugging Faceへ投稿し、44 upvotesで#2 Paper of the dayに入った。CUAの軌跡は、エージェントの画面、操作、状態、推論を記録し、判定モデルがタスク指示の達成可否を判断できるかを測る。

著者らは、検証がCUA評価、データ選別、強化学習の中心だと述べる一方、人手で書いた検証器や人間の注釈者では大規模対応が難しいとした。OSRewardは、ウェブ、Windows、Ubuntu、モバイルの各プラットフォームで、多様なエージェント基盤が人間検証済みの指示を実行した軌跡を使い、多段階の人手注釈で正解判定ラベルを付ける。公開内容には、真に難しい事例向けのOSReward-Hardと、効率性や整合性を細かく採点するOSReward-Multiも含まれる。

評価では、最先端のVLM判定モデルでさえ理想的な判定器には届かず、失敗した実行を成功と誤判定する体系的な甘さの偏りを共有していた。著者らによれば、信頼できる少数の判定モデルは大規模運用には高価すぎ、手頃なオープンモデルは大きく遅れている。この差を埋めるため、CUA判定サンプルに推論注釈を付けたコーパスとして過去最大規模だと説明するOS-Shepherd-100Kを公開した。

チームは、OS-Shepherd-100Kで9Bと35BサイズのOS-Shepherd報酬モデルを訓練した。論文によると、これらのオープンウェイト、オープンデータのモデルは低コストで安定した信頼性のある報酬信号を提供し、商用判定モデルに匹敵し、フロンティアモデルより30–60×低いコストで動作する。著者らはOSRewardのプロジェクトページで、コード、ベンチマーク、データセット、モデルチェックポイントも公開した。

香港大学NLP Groupの研究者は、コンピューター操作エージェントの軌跡を判定する視覚言語モデルを評価するベンチマーク、OSRewardを公開した。論文はJul 30に発表され、QiushiがAug 7にHugging Faceへ投稿し、44 upvotesで#2 Paper of the dayに入った。CUAの軌跡は、エージェントの画面、操作、状態、推論を記録し、判定モデルがタスク指示の達成可否を判断できるかを測る。

著者らは、検証がCUA評価、データ選別、強化学習の中心だと述べる一方、人手で書いた検証器や人間の注釈者では大規模対応が難しいとした。OSRewardは、ウェブ、Windows、Ubuntu、モバイルの各プラットフォームで、多様なエージェント基盤が人間検証済みの指示を実行した軌跡を使い、多段階の人手注釈で正解判定ラベルを付ける。公開内容には、真に難しい事例向けのOSReward-Hardと、効率性や整合性を細かく採点するOSReward-Multiも含まれる。

評価では、最先端のVLM判定モデルでさえ理想的な判定器には届かず、失敗した実行を成功と誤判定する体系的な甘さの偏りを共有していた。著者らによれば、信頼できる少数の判定モデルは大規模運用には高価すぎ、手頃なオープンモデルは大きく遅れている。この差を埋めるため、CUA判定サンプルに推論注釈を付けたコーパスとして過去最大規模だと説明するOS-Shepherd-100Kを公開した。

チームは、OS-Shepherd-100Kで9Bと35BサイズのOS-Shepherd報酬モデルを訓練した。論文によると、これらのオープンウェイト、オープンデータのモデルは低コストで安定した信頼性のある報酬信号を提供し、商用判定モデルに匹敵し、フロンティアモデルより30–60×低いコストで動作する。著者らはOSRewardのプロジェクトページで、コード、ベンチマーク、データセット、モデルチェックポイントも公開した。

原文(英語)を読む·2026年8月8日
#osreward#computer using agent#vision language model#reward model#os shepherd 100k#os shepherd#agentic ai#benchmark#reinforcement learning