FACTS Benchmark Suite

引用多め高いほど良い

Googleの事実性試験集FACTSの総合スコアで、記憶だけで答える(Parametric)、検索ツールで答える(Search)、画像についての質問(Multimodal)、与えられた文書だけに基づく長い回答(Grounding)の4つの平均です。4つすべてを受けていないモデルは平均を比べにくくなります。スコアは0〜100%です。高いほど良い結果です。

最高スコア75.7%GPT-6 Astra
測定したモデル31件
最終更新2026.09.29
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    OpenAI2026.09.04
    75.7%
  2. 2
    OpenAI2026.09.22
    72.5%
  3. 3
    Google2026.08.13
    71.2%
  4. 4
    Google2026.09.03
    69.4%
  5. 5
    Google2026.02.19
    67.4%
  6. 6
    OpenAI2026.04.23
    66.7%
  7. 7
    Google2026.07.21
    65.3%
  8. 8
    Anthropic2026.09.22
    65.3%
  9. 9
    Google2025.12.17
    63.4%
  10. 10
    OpenAI2026.09.22
    63.3%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。