SimpleQA Verified

引用多め高いほど良い

ツールを使わず記憶だけで答える短い事実質問1,000問です。OpenAIのSimpleQA(4,326問)から重複を除き、テーマの偏りをならし、誤った正解を直した版です。ここでの値はEpoch AIが測った正答率です。スコアは0〜100%です。高いほど良い結果です。

最高スコア75.6%GPT-6 Astra
測定したモデル56件
最終更新2026.09.29
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇OpenAIGPT-6 Astra推論強度: Max146675.6%—
  2. 🥈OpenAIGPT-6.1 Sol推論強度: Max146373.9%—
  3. 🥉GoogleGemini 3.1 Pro推論強度: High147273.5%47.8%
  4. #4AnthropicClaude Opus 5.5推論強度: Max150772.2%—
  5. #5AnthropicClaude Fable 5.1推論強度: Max150070.8%—
  6. #6AnthropicClaude Fable 5推論強度: Extra High148470.7%—
  7. #7GoogleGemini 3.8 Flash推論強度: High147769.7%—
  8. #7OpenAIGPT-5.6 Sol推論強度: Max147669.7%—
  9. #9GoogleGemini 3.7 Flash推論強度: High147769.2%—
  10. #10GoogleGemini 3 Flash推論強度: High146866.8%49.8%
  11. #11GoogleGemini 3.5 Flash推論強度: High147666.2%—
  12. #11GoogleGemini 3.6 Flash推論強度: High147166.2%—
  13. #13OpenAIGPT-5.5推論強度: Extra High148663.0%54.0%
  14. #14OpenAIGPT-6 Sol推論強度: Max143460.7%—
  15. #15MetaMuse Spark 1.2推論強度: Extra High148360.3%—
  16. #16AnthropicClaude Opus 5推論強度: Max148959.9%—
  17. #17MetaMuse Spark 1.1146457.8%—
  18. #18xAIGrok 4.7推論強度: Extra High142856.0%—
  19. #19AlibabaQwen3.7 Max148155.8%—
  20. #20AnthropicClaude Opus 4.8推論強度: Max147053.0%50.2%
  21. #21DeepSeekDeepSeek V4 Pro推論強度: Max145552.9%—
  22. #22AlibabaQwen3.6 Max145352.0%—
  23. #23AnthropicClaude Opus 4.7推論強度: Extra High147751.7%—
  24. #24Moonshot AIKimi K3推論強度: Max147250.6%—
  25. #25OpenAIGPT-5推論強度: High142150.1%49.6%
  26. #26xAIGrok 4.6推論強度: High144949.3%—
  27. #27xAIGrok 4.5推論強度: High146548.3%—
  28. #28AnthropicClaude Opus 4.6推論強度: Max149447.0%55.3%
  29. #29AnthropicClaude Sonnet 5.5推論強度: Max147046.5%—
  30. #30OpenAIGPT-5.4 Pro推論強度: Extra High—46.3%—
  31. #31AnthropicClaude Opus 4.5推論強度: Budget 32K145945.7%54.8%
  32. #32OpenAIGPT-5.4推論強度: Extra High148545.1%35.1%
  33. #33AlibabaQwen3.6 Plus143844.1%—
  34. #34OpenAIGPT-5.6 Terra推論強度: Max146643.2%—
  35. #35OpenAIGPT-6 Luna推論強度: Max143041.4%—
  36. #36OpenAIGPT-5.6 Luna推論強度: Max146041.0%—
  37. #36Z.aiGLM 5.3推論強度: Max—41.0%—
  38. #38Moonshot AIKimi K2.7 Code—36.5%—
  39. #39AnthropicClaude Sonnet 4.6推論強度: High146135.5%54.9%
  40. #40Moonshot AIKimi K2.6145634.9%—
  41. #41Moonshot AIKimi K2.5144534.3%—
  42. #42Z.aiGLM 5.2推論強度: Max146334.2%—
  43. #43Z.aiGLM-5.1145634.0%—
  44. #44AnthropicClaude Sonnet 5推論強度: Max145233.7%—
  45. #45DeepSeekDeepSeek V4 Flash推論強度: Max143933.6%—
  46. #46xAIGrok 4.3推論強度: High142833.2%—
  47. #47OpenAIGPT-4.1140831.1%—
  48. #48AnthropicClaude Sonnet 4.5推論強度: Budget 59K144930.7%52.6%
  49. #49xAIGrok 4.20 (Reasoning)145630.2%—
  50. #50OpenAIGPT-5.4 Mini推論強度: High144729.4%36.3%
  51. #51OpenAIGPT-5 Mini推論強度: High139421.6%—
  52. #52AlibabaQwen3.6 Flash—15.9%—
  53. #53AnthropicClaude Haiku 4.5141813.2%45.5%
  54. #54OpenAIGPT-5.4 Nano推論強度: High141811.7%—
  55. #54OpenAIGPT-5 Nano推論強度: High—11.7%—
  56. #56GoogleGemma 4 31B145010.4%—
モデルの半数が46.8%以下最終更新 2026-10-07

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。