Vectara Factual Consistency

かんたんに言うと · 文章を要約するとき、原文にある内容だけを書く割合

何を測定しますか?
文書の要約が原文にどれだけ忠実かの割合です。幻覚率を裏返した値に近いもの(おおよそ100% − 幻覚率)で、同じ情報を「高いほど良い」で見たものです。
誰がどのように評価しますか?
検索企業 Vectara がニュース・技術・医学・法律など7,700編以上の文書をAIに要約させ、自社の判定モデル HHEM(現在2.3版)が要約に原文にない事実が含まれていないかを検査します。文書集合は非公開のため事前に学習できません。この表は公開リーダーボードの値を取得しますが、リーダーボードから外れたり名前が変わったAIは最後に掲載された値を順位を付けずに表の下に別に表示します。
スコアの読み方
0〜100%、高いほど良い。幻覚率とほぼ対になりますが、リーダーボードで別々に発表される値のため小数点以下でずれることがあります。要約の忠実度のみを測り、一般知識の正確さは分かりません。

最終更新: 2026-09-22

順位

最高スコア96.9%GPT-5.4 Nano
測定したモデル36件
最終更新2026.09.22
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    OpenAI2026.03.17
    96.9%
  2. 2
    Google2025.09.25
    96.7%
  3. 3
    OpenAI2026.03.17
    94.5%
  4. 4
    OpenAI2025.04.14
    94.4%
  5. 5
    DeepSeek2025.12.01
    93.7%
  6. 6
    OpenAI2026.09.22
    93.5%
  7. 7
    Arcee AI2026.04.01
    93.1%
  8. 8
    Google2025.06.17
    93.0%
  9. 9
    OpenAI2026.03.05
    93.0%
  10. 10
    Google2026.04.02
    92.6%

直近60日にリリースされたAI 37個のうち35個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか32個

出典: Vectara HHEM データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • 原文の要約が文書の内容に忠実かを測ったスコアです。一般知識や推論力を測る試験ではありません。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。