AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

Amazon、相関するLLM審査を検証

Amazon、相関するLLM審査を検証

amazon.science·2026年9月16日 (水)
  • •Amazon研究者が、訓練ラベルなしで相関するLLM審査員パネルを集約するイジングモデル手法を提案した
  • •依存関係を考慮した審査は、重み付き多数決ベースライン比で精度を9%から14%改善した
  • •評価では10個の審査モデルを使い、関連性分類、毒性検出、要約評価の3タスクを検証した
  • •Amazon研究者が、訓練ラベルなしで相関するLLM審査員パネルを集約するイジングモデル手法を提案した
  • •依存関係を考慮した審査は、重み付き多数決ベースライン比で精度を9%から14%改善した
  • •評価では10個の審査モデルを使い、関連性分類、毒性検出、要約評価の3タスクを検証した
  • •Amazon研究者が、訓練ラベルなしで相関するLLM審査員パネルを集約するイジングモデル手法を提案した
  • •依存関係を考慮した審査は、重み付き多数決ベースライン比で精度を9%から14%改善した
  • •評価では10個の審査モデルを使い、関連性分類、毒性検出、要約評価の3タスクを検証した
  • •Amazon研究者が、訓練ラベルなしで相関するLLM審査員パネルを集約するイジングモデル手法を提案した
  • •依存関係を考慮した審査は、重み付き多数決ベースライン比で精度を9%から14%改善した
  • •評価では10個の審査モデルを使い、関連性分類、毒性検出、要約評価の3タスクを検証した

Amazon ScienceはAugust 26, 2026、複数のLLM審査員が同じ隠れた理由で一致すると、審査パネルの信頼度が過大評価され得るとする研究を公開した。クリシュナ・バラスブラマニアン(Krishna Balasubramanian)とサーシャ・ポドコパエフ(Sasha Podkopaev)は、シヴァ・カシヴィスワナサン(Shiva Kasiviswanathan)との共著研究「Dependence-aware label aggregation for LLM-as-a-judge via Ising models」を説明し、同研究は今年のInternational Conference on Machine Learningで発表された。手法は審査出力間の相関を推定し、似た審査員による反復エラーが独立した証拠のように数えられないよう集約スコアを調整する。

問題は検索拡張生成の評価で生じる。ユーザーが質問し、システムが文章を検索し、LLM審査員がその文章の関連性を判定する場面だ。8票が「関連あり」、2票が「関連なし」なら説得力があるように見えるが、重要なのは8人の審査員がどれだけ独立して同じ答えに到達したかだとされる。共通のプロンプトテンプレート、訓練系譜、モデルファミリー、例示、言い回しへの感度、盲点により、複数票が8つの別々の判断ではなく、1つの反復された誤りを反映する場合がある。

提案された集約器は、審査員パネルを単純な投票カウンターではなくネットワークとして扱う。各審査員は固有の信頼性プロファイルを持ち、審査員ペアには、個別の信頼性から予測される以上に一致しやすいかどうかを示す関係がある。共有された誤りでの一致も含まれる。研究はイジングモデル(ペア依存を表す統計モデル)を使い、教師なし設定で審査員の能力と審査員同士の類似性を学習する。つまり、人間の参照ラベルを訓練に使わず、審査員の出力から学ぶ。

手法は各項目の真のラベルを潜在変数(データから推定される隠れた値)として扱う。初期パラメータから始め、アルゴリズムは項目ラベルが陽性である確率を推定し、そのソフトな確率の更新と、審査員の信頼性およびペアごとの依存関係の再推定を交互に行う。人間の参照ラベルは、実験上の精度を測定するために後からのみ使われる。

研究は2つの依存モデリング変種を示した。第1の変種は、審査員間の関係パターンが陽性ラベルと陰性ラベルでおおむね同じだとみなし、重み付き投票に似た決定規則を維持しながら、冗長な一致を割り引く。第2のクラス依存モデルは、ラベルによって関係パターンが変わることを許す。明確な項目では審査員が広く一致する一方、曖昧な項目では認識可能なクラスタに分かれるケースを捉えられるが、追加パラメータを信頼できる形で推定するにはより多くのデータが必要になる。

評価では、検索された情報の関連性分類、毒性分類、要約評価という3つの二値タスクを検証した。パネルには10個の審査モデルが含まれ、すべてtemperature zeroで実行されたため、同じ入力は常に同じ出力を生成する。依存関係を考慮したモデルは、条件付き独立を仮定する2つのベースライン、重み付き多数決と一様多数決と比較された。

10個すべての審査モデルと各タスクで利用可能な最大訓練データを使った場合、最良の依存関係対応結果は、関連性で0.912の精度に達した。重み付き多数決は0.820、一様多数決は0.804だった。毒性の精度は0.792で、比較対象は0.694と0.695。要約の精度は0.806で、比較対象は0.737と0.561だった。3タスク全体の改善幅は、最良ベースライン比で9%から14%と要約されている。

著者らは、LLM-as-a-judgeのパイプラインを使うチームに対し、個々の審査員だけでなくパネル全体を評価し、モデル多様性を統計的多様性として扱い、一致クラスタを調べ、依存関係を考慮したうえで信頼度を報告するよう助言している。既存の評価ログから一致と不一致のパターンを把握でき、監査では冗長な審査員やタスク固有の共有盲点を特定しやすくなる。

Amazon ScienceはAugust 26, 2026、複数のLLM審査員が同じ隠れた理由で一致すると、審査パネルの信頼度が過大評価され得るとする研究を公開した。クリシュナ・バラスブラマニアン(Krishna Balasubramanian)とサーシャ・ポドコパエフ(Sasha Podkopaev)は、シヴァ・カシヴィスワナサン(Shiva Kasiviswanathan)との共著研究「Dependence-aware label aggregation for LLM-as-a-judge via Ising models」を説明し、同研究は今年のInternational Conference on Machine Learningで発表された。手法は審査出力間の相関を推定し、似た審査員による反復エラーが独立した証拠のように数えられないよう集約スコアを調整する。

問題は検索拡張生成の評価で生じる。ユーザーが質問し、システムが文章を検索し、LLM審査員がその文章の関連性を判定する場面だ。8票が「関連あり」、2票が「関連なし」なら説得力があるように見えるが、重要なのは8人の審査員がどれだけ独立して同じ答えに到達したかだとされる。共通のプロンプトテンプレート、訓練系譜、モデルファミリー、例示、言い回しへの感度、盲点により、複数票が8つの別々の判断ではなく、1つの反復された誤りを反映する場合がある。

提案された集約器は、審査員パネルを単純な投票カウンターではなくネットワークとして扱う。各審査員は固有の信頼性プロファイルを持ち、審査員ペアには、個別の信頼性から予測される以上に一致しやすいかどうかを示す関係がある。共有された誤りでの一致も含まれる。研究はイジングモデル(ペア依存を表す統計モデル)を使い、教師なし設定で審査員の能力と審査員同士の類似性を学習する。つまり、人間の参照ラベルを訓練に使わず、審査員の出力から学ぶ。

手法は各項目の真のラベルを潜在変数(データから推定される隠れた値)として扱う。初期パラメータから始め、アルゴリズムは項目ラベルが陽性である確率を推定し、そのソフトな確率の更新と、審査員の信頼性およびペアごとの依存関係の再推定を交互に行う。人間の参照ラベルは、実験上の精度を測定するために後からのみ使われる。

研究は2つの依存モデリング変種を示した。第1の変種は、審査員間の関係パターンが陽性ラベルと陰性ラベルでおおむね同じだとみなし、重み付き投票に似た決定規則を維持しながら、冗長な一致を割り引く。第2のクラス依存モデルは、ラベルによって関係パターンが変わることを許す。明確な項目では審査員が広く一致する一方、曖昧な項目では認識可能なクラスタに分かれるケースを捉えられるが、追加パラメータを信頼できる形で推定するにはより多くのデータが必要になる。

評価では、検索された情報の関連性分類、毒性分類、要約評価という3つの二値タスクを検証した。パネルには10個の審査モデルが含まれ、すべてtemperature zeroで実行されたため、同じ入力は常に同じ出力を生成する。依存関係を考慮したモデルは、条件付き独立を仮定する2つのベースライン、重み付き多数決と一様多数決と比較された。

10個すべての審査モデルと各タスクで利用可能な最大訓練データを使った場合、最良の依存関係対応結果は、関連性で0.912の精度に達した。重み付き多数決は0.820、一様多数決は0.804だった。毒性の精度は0.792で、比較対象は0.694と0.695。要約の精度は0.806で、比較対象は0.737と0.561だった。3タスク全体の改善幅は、最良ベースライン比で9%から14%と要約されている。

著者らは、LLM-as-a-judgeのパイプラインを使うチームに対し、個々の審査員だけでなくパネル全体を評価し、モデル多様性を統計的多様性として扱い、一致クラスタを調べ、依存関係を考慮したうえで信頼度を報告するよう助言している。既存の評価ログから一致と不一致のパターンを把握でき、監査では冗長な審査員やタスク固有の共有盲点を特定しやすくなる。

原文(英語)を読む·2026年8月26日
#llm as a judge#ising model#label aggregation#judge correlation#retrieval augmented generation#toxicity detection#summarization assessment#majority vote#evaluation logs