FACTS Benchmark Suite
引用多め高いほど良い
Googleの事実性試験集FACTSの総合スコアで、記憶だけで答える(Parametric)、検索ツールで答える(Search)、画像についての質問(Multimodal)、与えられた文書だけに基づく長い回答(Grounding)の4つの平均です。4つすべてを受けていないモデルは平均を比べにくくなります。スコアは0〜100%です。高いほど良い結果です。
最高スコア75.7%GPT-6 Astra
測定したモデル31件
最終更新2026.09.29
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 12026.09.04$4075.7%
- 22026.09.22$872.5%
- 32026.08.13$371.2%

- 42026.09.03$369.4%

- 52026.02.19$9.5067.4%

- 62026.04.23$2466.7%
- 72026.07.21$365.3%

- 82026.09.22$1665.3%
- 92025.12.17$2.3863.4%

- 102026.09.22$0.4063.3%
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。