FACTS Grounding
高いほど良い
最大3万2千トークンの文書と依頼(要約、事実の抽出、分析)を受け取り、その文書だけに基づいた長い回答を書く試験です。AI審査員が依頼に沿っているか、すべての内容が文書に基づいているかを判定します。スコアは0〜100%です。高いほど良い結果です。
最高スコア85.2%GPT-6 Sol
測定したモデル31件
最終更新2026.09.25
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 12026.09.22$885.2%
- 22026.09.04$4082.0%
- 32026.09.22$0.4081.4%
- 42026.04.02$0.3480.7%

- 52026.04.23$2476.2%
- 62026.08.13$375.5%

- 72026.07.08$574.5%
- 82025.06.17$7.8174.3%

- 92026.05.19$7.1373.2%

- 102026.09.03$373.1%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。