SimpleQA Verified
引用多め高いほど良い
ツールを使わず記憶だけで答える短い事実質問1,000問です。OpenAIのSimpleQA(4,326問)から重複を除き、テーマの偏りをならし、誤った正解を直した版です。ここでの値はEpoch AIが測った正答率です。スコアは0〜100%です。高いほど良い結果です。
最高スコア75.6%GPT-6 Astra
測定したモデル56件
最終更新2026.09.29
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
多くの人に好まれ、しかも間違いのない回答をするAIは?Arena Text Factuality
Gemini 4 Argon🥇
Gemini 4 Argon🥇何段階にもわたるWeb調査をこなせる?Deep Research Bench
Claude Opus 4.6🥇
Claude Opus 4.6🥇
- 🥇OpenAIGPT-6 Astra推論強度: Max146675.6%—
- 🥈OpenAIGPT-6.1 Sol推論強度: Max146373.9%—
- 🥉GoogleGemini 3.1 Pro推論強度: High147273.5%47.8%
- #4AnthropicClaude Opus 5.5推論強度: Max150772.2%—
- #5AnthropicClaude Fable 5.1推論強度: Max150070.8%—
- #6AnthropicClaude Fable 5推論強度: Extra High148470.7%—
- #7GoogleGemini 3.8 Flash推論強度: High147769.7%—
- #7OpenAIGPT-5.6 Sol推論強度: Max147669.7%—
- #9GoogleGemini 3.7 Flash推論強度: High147769.2%—
- #10GoogleGemini 3 Flash推論強度: High146866.8%49.8%
- #11GoogleGemini 3.5 Flash推論強度: High147666.2%—
- #11GoogleGemini 3.6 Flash推論強度: High147166.2%—
- #13OpenAIGPT-5.5推論強度: Extra High148663.0%54.0%
- #14OpenAIGPT-6 Sol推論強度: Max143460.7%—
- #15MetaMuse Spark 1.2推論強度: Extra High148360.3%—
- #16AnthropicClaude Opus 5推論強度: Max148959.9%—
- #17MetaMuse Spark 1.1146457.8%—
- #18xAIGrok 4.7推論強度: Extra High142856.0%—
- #19AlibabaQwen3.7 Max148155.8%—
- #20AnthropicClaude Opus 4.8推論強度: Max147053.0%50.2%
- #21DeepSeekDeepSeek V4 Pro推論強度: Max145552.9%—
- #22AlibabaQwen3.6 Max145352.0%—
- #23AnthropicClaude Opus 4.7推論強度: Extra High147751.7%—
- #24Moonshot AIKimi K3推論強度: Max147250.6%—
- #25OpenAIGPT-5推論強度: High142150.1%49.6%
- #26xAIGrok 4.6推論強度: High144949.3%—
- #27xAIGrok 4.5推論強度: High146548.3%—
- #28AnthropicClaude Opus 4.6推論強度: Max149447.0%55.3%
- #29AnthropicClaude Sonnet 5.5推論強度: Max147046.5%—
- #30OpenAIGPT-5.4 Pro推論強度: Extra High—46.3%—
- #31AnthropicClaude Opus 4.5推論強度: Budget 32K145945.7%54.8%
- #32OpenAIGPT-5.4推論強度: Extra High148545.1%35.1%
- #33AlibabaQwen3.6 Plus143844.1%—
- #34OpenAIGPT-5.6 Terra推論強度: Max146643.2%—
- #35OpenAIGPT-6 Luna推論強度: Max143041.4%—
- #36OpenAIGPT-5.6 Luna推論強度: Max146041.0%—
- #36Z.aiGLM 5.3推論強度: Max—41.0%—
- #38Moonshot AIKimi K2.7 Code—36.5%—
- #39AnthropicClaude Sonnet 4.6推論強度: High146135.5%54.9%
- #40Moonshot AIKimi K2.6145634.9%—
- #41Moonshot AIKimi K2.5144534.3%—
- #42Z.aiGLM 5.2推論強度: Max146334.2%—
- #43Z.aiGLM-5.1145634.0%—
- #44AnthropicClaude Sonnet 5推論強度: Max145233.7%—
- #45DeepSeekDeepSeek V4 Flash推論強度: Max143933.6%—
- #46xAIGrok 4.3推論強度: High142833.2%—
- #47OpenAIGPT-4.1140831.1%—
- #48AnthropicClaude Sonnet 4.5推論強度: Budget 59K144930.7%52.6%
- #49xAIGrok 4.20 (Reasoning)145630.2%—
- #50OpenAIGPT-5.4 Mini推論強度: High144729.4%36.3%
- #51OpenAIGPT-5 Mini推論強度: High139421.6%—
- #52AlibabaQwen3.6 Flash—15.9%—
- #53AnthropicClaude Haiku 4.5141813.2%45.5%
- #54OpenAIGPT-5.4 Nano推論強度: High141811.7%—
- #54OpenAIGPT-5 Nano推論強度: High—11.7%—
- #56GoogleGemma 4 31B145010.4%—
モデルの半数が46.8%以下最終更新 2026-10-07
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。