Vectara Hallucination Rate

かんたんに言うと · 文章を要約するとき、ない内容をでっち上げる割合

何を測定しますか?
文書を要約させたとき、原文にない内容を作り出す割合です。低いほど原文に忠実です。「多く知っているか」ではなく「与えられた文から逸脱しないか」を見ます。
誰がどのように評価しますか?
検索企業 Vectara がニュース・技術・医学・法律など7,700編以上の文書をAIに要約させ、自社の判定モデル HHEM(現在2.3版)が要約に原文にない事実が含まれていないかを検査します。文書集合は非公開のため事前に学習できません。この表は公開リーダーボードの値を取得しますが、リーダーボードから外れたり名前が変わったAIは最後に掲載された値を順位を付けずに表の下に別に表示します。
スコアの読み方
0〜100%、低いほど良い。上位は1〜3%台に密集しており小数点の差はあまり意味がありません。要約状況での忠実度だけを測るため、一般的な質問での捏造の程度や要約の品質・有用性は分かりません。

最終更新: 2026-09-22

順位

最高スコア3.1%GPT-5.4 Nano
測定したモデル36件
最終更新2026.09.22
モデルのリリース時期(右が最新)
その時点の最高記録低い値ほど良い試験のため軸を反転しています — 上ほど良い
  1. 🥇OpenAIGPT-5.4 Nano3.1%
  2. 🥈GoogleGemini 2.5 Flash Lite3.3%
  3. 🥉OpenAIGPT-5.4 Mini5.5%
  4. #4OpenAIGPT-4.15.6%
  5. #5DeepSeekDeepSeek V3.26.3%
  6. #6OpenAIGPT-6 Sol6.5%
  7. #7Arcee AITrinity Large Thinking6.9%
  8. #8GoogleGemini 2.5 Pro7.0%
  9. #8OpenAIGPT-5.47.0%
  10. #10GoogleGemma 4 31B7.4%
  11. #11GoogleGemini 2.5 Flash7.8%
  12. #12GoogleGemini 3.1 Flash Lite8.2%
  13. #13OpenAIGPT-5.4 Pro8.3%
  14. #14DeepSeekDeepSeek V4 Pro8.6%
  15. #15OpenAIGPT-6 Astra8.7%
  16. #16OpenAIGPT-5.59.3%
  17. #17NVIDIANemotron 3 Nano 30B A3B9.6%
  18. #18AnthropicClaude Haiku 4.59.8%
  19. #19Z.aiGLM-510.1%
  20. #20AnthropicClaude Sonnet 410.3%
  21. #21GoogleGemini 3.1 Pro10.4%
  22. #22OpenAIGPT-5 Nano10.5%
  23. #23AnthropicClaude Sonnet 4.610.6%
  24. #24AlibabaQwen3.5 Plus10.7%
  25. #25AnthropicClaude Opus 4.510.9%
  26. #26AnthropicClaude Opus 4.111.8%
  27. #27AnthropicClaude Opus 412.0%
  28. #27AnthropicClaude Opus 4.712.0%
  29. #27AnthropicClaude Sonnet 4.512.0%
  30. #30AnthropicClaude Opus 4.612.2%
  31. #31OpenAIGPT-5.6 Sol12.4%
  32. #32OpenAIGPT-5 Mini12.9%
  33. #33GoogleGemini 3 Flash13.5%
  34. #34OpenAIGPT OSS 120B14.2%
  35. #35xAIGrok 4.1 Fast17.8%
  36. #36xAIGrok 4.1 Fast (Reasoning)19.2%
モデルの半数が10.0%以下最終更新 2026-09-22

以前の版のスコア

最新ランキング(2026.09.22)に反映されていないスコアです。出典から外れたか、まだ更新されていないモデルで、最後に取得したスコアを参考として表示し、順位は付けません。

  1. —
    Meta2025.04.05
    7.7%
  2. —
    Meta2025.04.05
    8.2%
  3. —
    Z.ai2026.04.07
    10.1%
  4. —
    Anthropic2026.05.27
    12.0%
  5. —
    Moonshot AI2026.01.27
    14.2%
  6. —
    OpenAI2025.08.07
    14.7%

直近60日にリリースされたAI 37個のうち35個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか32個

出典: Vectara HHEM データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • 原文の要約が文書の内容に忠実かを測ったスコアです。一般知識や推論力を測る試験ではありません。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。