FACTS Grounding

高いほど良い

最大3万2千トークンの文書と依頼(要約、事実の抽出、分析)を受け取り、その文書だけに基づいた長い回答を書く試験です。AI審査員が依頼に沿っているか、すべての内容が文書に基づいているかを判定します。スコアは0〜100%です。高いほど良い結果です。

最高スコア85.2%GPT-6 Sol
測定したモデル31件
最終更新2026.09.25
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    OpenAI2026.09.22
    85.2%
  2. 2
    OpenAI2026.09.04
    82.0%
  3. 3
    OpenAI2026.09.22
    81.4%
  4. 4
    Google2026.04.02
    80.7%
  5. 5
    OpenAI2026.04.23
    76.2%
  6. 6
    Google2026.08.13
    75.5%
  7. 7
    xAI2026.07.08
    74.5%
  8. 8
    Google2025.06.17
    74.3%
  9. 9
    Google2026.05.19
    73.2%
  10. 10
    Google2026.09.03
    73.1%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。