AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

MerchantBench、長期エージェント一貫性を検証

MerchantBench、長期エージェント一貫性を検証

HuggingFace·2026年8月6日 (木)
  • •MerchantBenchは、98,843件の商品記録に基づく365日間の販売者側ECシミュレーションでLLM Agentをテストした
  • •研究者らは、8つのLLMと2つのエージェントフレームワークを48回の年間実行で評価した
  • •最良のLLM構成でも、最終純資産の平均は人間参加者の27.3%にとどまった
  • •MerchantBenchは、98,843件の商品記録に基づく365日間の販売者側ECシミュレーションでLLM Agentをテストした
  • •研究者らは、8つのLLMと2つのエージェントフレームワークを48回の年間実行で評価した
  • •最良のLLM構成でも、最終純資産の平均は人間参加者の27.3%にとどまった
  • •MerchantBenchは、98,843件の商品記録に基づく365日間の販売者側ECシミュレーションでLLM Agentをテストした
  • •研究者らは、8つのLLMと2つのエージェントフレームワークを48回の年間実行で評価した
  • •最良のLLM構成でも、最終純資産の平均は人間参加者の27.3%にとどまった
  • •MerchantBenchは、98,843件の商品記録に基づく365日間の販売者側ECシミュレーションでLLM Agentをテストした
  • •研究者らは、8つのLLMと2つのエージェントフレームワークを48回の年間実行で評価した
  • •最良のLLM構成でも、最終純資産の平均は人間参加者の27.3%にとどまった

Qiming Shiと12人の共著者は、LLM Agentが販売者側のEC運営を365日間のシミュレーションで続ける間、一貫した行動を保てるかを測るベンチマーク、MerchantBenchを発表した。論文はJul 31に公開され、Aug 5にHugging Face Papersへ投稿され、80 upvotesで#1 Paper of the dayに掲載された。MerchantBenchは長期一貫性を対象にしており、蓄積された証拠に意思決定を適応させながら、長い時間軸で目的ある行動を保つ能力と定義している。

MerchantBenchは、98,843件の実EC商品記録に基づく注文単位の環境を使い、エージェントに26のmerchant toolsへのアクセスを与える。シミュレーション対象の業務は、Product Sourcing、Listing and Pricing Control、Cash-Flow Management、Mixed-Latency Feedback Adaptationである。環境は、すぐ観測できるUpstream Supplier Eventsと遅れて現れるDownstream Order Outcomesを組み合わせ、返金、否定的レビュー、ペナルティ、サプライヤー障害、その他の遅延シグナルが出た際に、エージェントが個別の注文ライフサイクルを追跡し、過去の選択を見直す必要がある。

著者らは、8つのLLMを2つのエージェントフレームワーク下で評価し、合計48回の実行を行った。各実行は365シミュレーション日だった。論文は、最新LLMと人間参加者の間に大きな差があると報告している。最良のLLM構成でも、人間参加者が達成した最終純資産の平均の27.3%にとどまった。著者らは分析から、「long-running does not necessarily mean long-horizon」と述べる。エージェントは次第に行動を止めたり、制御ループを狭めたり、遅延フィードバックに反応できなかったり、記憶を通じて誤った仮定を強化したりするためだ。

Qiming Shiと12人の共著者は、LLM Agentが販売者側のEC運営を365日間のシミュレーションで続ける間、一貫した行動を保てるかを測るベンチマーク、MerchantBenchを発表した。論文はJul 31に公開され、Aug 5にHugging Face Papersへ投稿され、80 upvotesで#1 Paper of the dayに掲載された。MerchantBenchは長期一貫性を対象にしており、蓄積された証拠に意思決定を適応させながら、長い時間軸で目的ある行動を保つ能力と定義している。

MerchantBenchは、98,843件の実EC商品記録に基づく注文単位の環境を使い、エージェントに26のmerchant toolsへのアクセスを与える。シミュレーション対象の業務は、Product Sourcing、Listing and Pricing Control、Cash-Flow Management、Mixed-Latency Feedback Adaptationである。環境は、すぐ観測できるUpstream Supplier Eventsと遅れて現れるDownstream Order Outcomesを組み合わせ、返金、否定的レビュー、ペナルティ、サプライヤー障害、その他の遅延シグナルが出た際に、エージェントが個別の注文ライフサイクルを追跡し、過去の選択を見直す必要がある。

著者らは、8つのLLMを2つのエージェントフレームワーク下で評価し、合計48回の実行を行った。各実行は365シミュレーション日だった。論文は、最新LLMと人間参加者の間に大きな差があると報告している。最良のLLM構成でも、人間参加者が達成した最終純資産の平均の27.3%にとどまった。著者らは分析から、「long-running does not necessarily mean long-horizon」と述べる。エージェントは次第に行動を止めたり、制御ループを狭めたり、遅延フィードバックに反応できなかったり、記憶を通じて誤った仮定を強化したりするためだ。

原文(英語)を読む·2026年8月6日
#merchantbench#llm agent#agentic ai#e commerce#long term coherence#benchmark#tool use#cash flow management