Harvey、法律AIベンチマークの採点を改定
- •HarveyとArtificial Analysisが、幻覚監査と3人の判定者による法律AIベンチマークを更新
- •120課題の評価でGrok 4.7が9.4%を記録し、Muse Spark 1.3とGPT-6 Astraを上回る
- •合格相当の結果でも、検証したモデル全体で60%超に重大な幻覚
Artificial AnalysisとHarveyは2026年10月8日、実際の法律業務をこなすAIエージェントの独立ベンチマークについて、採点方法を改定したHarvey LAB-AA v1.1を公開しました。各モデルは企業の合併・買収、資本市場、税務、訴訟、破産にまたがる非公開の120課題に取り組みます。提出物は課題の原資料と照合して幻覚の有無を確認し、3つの大規模言語モデル判定者が採点基準の各項目を評価します。新設の「幻覚を除外した全項目合格率」は、全基準を満たし、重大な幻覚を含まない課題だけを合格として数えます。
新指標ではGrok 4.7(xhigh)が9.4%で首位となり、Muse Spark 1.3(max)が8.9%、GPT-6 Astra(max)が8.6%で続きました。GPT-6.1 Sol(max)は6.9%、Claude Fable 5.1(max、フォールバック有効)は6.4%、Kimi K3(max)は5.3%、Claude Opus 5.5(max、フォールバック有効)は4.2%でした。Claudeのモデルは有効化されていたフォールバックを使いませんでした。幻覚を除外しない全項目合格率ではMuse Sparkが26.7%で首位ですが、その合格結果の3分の2に重大な幻覚が含まれます。GPT-6 Astraは合格のほぼすべてを維持し、8.9%から8.6%への低下にとどまり、同率10位から3位に上がりました。GPT-6.1 Solは7.5%から6.9%に下がりました。検証したモデル全体では、合格相当の結果の60%超に重大な幻覚があり、幻覚を除外した後に0%となるモデルも複数ありました。
幻覚を除外する前の採点基準では、16モデルが項目の85.6~96.0%に合格しました。ベンチマークは、基準の網羅度と原資料への根拠付けを別々に示すため、基準合格率と、確認した課題1件あたりの重大な幻覚の平均数を分けて報告します。GPT-6 Astraは課題1件あたり平均0.03件、120課題全体で4件の重大な幻覚がありました。GPT-6 Solは平均0.07件、120課題で8件でした。今回の公開対象で平均が最多だったGemini 3.8 Flashは、課題1件あたり13.96件でした。Muse Sparkは基準項目の合格率が最も高い96.0%でしたが、重大な幻覚は課題1件あたり平均1.68件で、GPT-6 Astraの0.03件を上回りました。オープンウェイトモデルはすべて、課題1件あたり平均2.09件以上の重大な幻覚がありました。評価によると、幻覚率は法律業務の分野よりもモデルによる差が大きいといいます。
v1.1では、v1.0の単独判定者に代わり、GPT-6 Sol、Grok 4.7、Claude Opus 5.5の3モデルが判定し、結果を平均します。幻覚チェックにはGPT-6 Sol(high)を使い、2段階で確認します。まず、矛盾、原資料にない内容の捏造、資料で裏付けられない具体的主張を検出し、次に各指摘を資料と照合して、確認された誤りを重大または軽微に分類します。課題の点数を0にするのは重大な幻覚だけです。利用可能な提出物がない課題は0点となり、監査の対象にもなりません。採点と評価方法の両方が変わったため、v1.1とv1.0の結果は直接比較できません。データセットはHarveyの非公開v1.1.0版に更新されました。今後は文体やトーンなど、弁護士が重視する使いやすさの要素も反映する計画です。
独立した評価環境では、Artificial AnalysisのStirrupエージェント実行環境を使い、文脈の圧縮機能を利用しました。プロンプトはArtificial Analysisが簡略化したものです。Harvey独自のツールと文書生成スクリプトは使わず、モデルには簡単なコード実行ツールを与え、指定された正確なファイル名で成果物を提出させました。20課題、8モデルを使った判定器の比較では、GPT-6 Solが重大な幻覚470件を認定し、Grokは219件、Claude Opusは99件、Claude Sonnetは57件でした。6つすべての判定器がGPT-6 Astraの出力から幻覚を検出しませんでした。
幻覚を除外する条件を保ちつつ、基準を1つまたは2つ落としても合格とする「ニアパス」採点では、GPT-6 Astraは1項目未達で20.3%、2項目未達で31.7%でした。GPT-6.1 Solはそれぞれ20.3%と29.6%、Grokは15.3%と23.1%でした。Grokの費用は課題1件あたり約9.50ドルで、Claude Fableの約21.70ドルを半分未満に下回りました。Muse Sparkは約4.20ドルで2番目に低コストでした。GPT-6 Astraは課題1件あたり約81,000出力トークンを使い、合格率は8.6%でした。Grokは約180,000トークンを使いました。