GPQA Diamond

かんたんに言うと · 生物・化学・物理の博士級の選択問題をどれだけ正解するか

何を測定しますか?
博士級の専門家でも間違える科学問題をどれだけ正解できるかを見ます。ネット検索では答えにくく作られた問題("Google-proof")なので、暗記ではなく深い理解と推論を測ります。
誰がどのように評価しますか?
生物学・化学・物理学の博士(課程)専門家が問題を書き、別の専門家が検証しました。全448問のうち専門家は正解し非専門家は間違えた最も厳選された198問が「Diamond」で、4択の正答率で採点します。Artificial Analysis が自ら実行します。
スコアの読み方
0〜100%。参考として当該分野の博士専門家の正答率は約65%(明らかなミスを除くと74%)、30分以上ネット検索した非専門家は約34%でした。4択なので当てずっぽうでも25%は出ます。問題が公開されているため学習データへの混入(汚染)が指摘され、上位モデルはすでに専門家の正答率を超えて飽和に近い状態です。

順位

最高スコア96.3%GPT-6 Astra
測定したモデル103件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇OpenAIGPT-6 Astra推論強度: Extra High96.3%
  2. 🥈GoogleGemini 3.8 Flash推論強度: High95.3%
  3. 🥉xAIGrok 4.6推論強度: High94.9%
  4. #4GoogleGemini 3.7 Flash推論強度: High94.5%
  5. #5GoogleGemini 3.1 Pro94.1%
  6. #5OpenAIGPT-5.6 Sol推論強度: Max94.1%
  7. #5MetaMuse Spark 1.3推論強度: Extra High94.1%
  8. #8AnthropicClaude Fable 5.1推論強度: Max93.7%
  9. #8AnthropicClaude Opus 5推論強度: Extra High93.7%
  10. #10OpenAIGPT-5.5推論強度: Extra High93.5%
  11. #10Moonshot AIKimi K3推論強度: Max93.5%
  12. #12xAIGrok 4.5推論強度: High93.1%
  13. #13MiniMaxMiniMax M392.9%
  14. #14DeepSeekDeepSeek V4 Pro推論強度: Max92.8%
  15. #14GoogleGemini 3.6 Flash推論強度: High92.8%
  16. #16AnthropicClaude Fable 5推論強度: Max92.6%
  17. #17OpenAIGPT-5.6 Terra推論強度: Max92.5%
  18. #18AlibabaQwen3.7 Max92.3%
  19. #18AlibabaQwen3.8 Flash92.3%
  20. #20GoogleGemini 3.5 Flash推論強度: High92.2%
  21. #21AnthropicClaude Opus 4.8推論強度: Max92.0%
  22. #21OpenAIGPT-5.4推論強度: Extra High92.0%
  23. #23Z.aiGLM 5.3推論強度: Max91.7%
  24. #24AnthropicClaude Opus 4.7推論強度: Max91.4%
  25. #25Z.aiGLM 5.3 Flash91.2%
  26. #26AnthropicClaude Sonnet 5推論強度: Max91.1%
  27. #26OpenAIGPT-5.6 Luna推論強度: Max91.1%
  28. #26xAIGrok 4.20 (Reasoning)推論強度: Thinking91.1%
  29. #26Moonshot AIKimi K2.6推論強度: Thinking91.1%
  30. #30DeepSeekDeepSeek V4 Flash推論強度: Max90.8%
  31. #31MetaMuse Spark 1.2推論強度: Extra High90.4%
  32. #32xAIGrok 4.3推論強度: High90.1%
  33. #33AlibabaQwen3.7 Plus90.0%
  34. #34GoogleGemini 3 Flash推論強度: Thinking89.8%
  35. #34MetaMuse Spark 1.1推論強度: Extra High89.8%
  36. #36TencentHy389.7%
  37. #37AnthropicClaude Opus 4.6推論強度: Max89.6%
  38. #37Moonshot AIKimi K2.7 Code89.6%
  39. #39Z.aiGLM 5.2推論強度: Max89.5%
  40. #40AlibabaQwen3.5 397B A17B推論強度: Thinking89.3%
  41. #41UpstageSolar Pro 489.1%
  42. #42AlibabaQwen3.6 Max88.8%
  43. #43MetaMuse Spark88.4%
  44. #44AlibabaQwen3.6 Plus88.2%
  45. #45Moonshot AIKimi K2.5推論強度: Thinking87.9%
  46. #46AnthropicClaude Sonnet 4.6推論強度: Max87.5%
  47. #46OpenAIGPT-5.4 Mini推論強度: Extra High87.5%
  48. #48MiniMaxMiniMax M2.787.4%
  49. #49XiaomiMiMo V2 Pro87.0%
  50. #50Z.aiGLM-5.1推論強度: Thinking86.8%
  51. #51NVIDIANemotron 3 Ultra推論強度: Thinking86.7%
  52. #52AnthropicClaude Opus 4.5推論強度: Thinking86.6%
  53. #52XiaomiMiMo V2.5 Pro推論強度: Thinking86.6%
  54. #54SK TelecomA.X K285.7%
  55. #54GoogleGemma 4 31B推論強度: Thinking85.7%
  56. #54Ring AIRing-2.6-1T85.7%
  57. #57OpenAIGPT-5推論強度: High85.4%
  58. #58xAIGrok 4.1 Fast (Reasoning)推論強度: Thinking85.3%
  59. #59XiaomiMiMo V2.584.9%
  60. #60MiniMaxMiniMax M2.584.8%
  61. #61Z.aiGLM-5-Turbo84.7%
  62. #62GoogleGemini 2.5 Pro84.4%
  63. #63AlibabaQwen3.6 35B A3B推論強度: Thinking84.1%
  64. #64DeepSeekDeepSeek V3.2推論強度: Thinking84.0%
  65. #65GoogleGemini 3.5 Flash-Lite83.8%
  66. #66AnthropicClaude Sonnet 4.5推論強度: Thinking83.4%
  67. #66Motif TechnologiesMotif 383.4%
  68. #68LG AI ResearchK-EXAONE 2.082.9%
  69. #69OpenAIGPT-5 Mini推論強度: High82.8%
  70. #70AlibabaQwen3.5 Plus82.6%
  71. #71GoogleGemini 3.1 Flash Lite82.2%
  72. #72Z.aiGLM-5推論強度: Thinking82.0%
  73. #73OpenAIGPT-5.4 Nano推論強度: Extra High81.7%
  74. #74AmazonNova 2 Lite推論強度: High81.1%
  75. #75AnthropicClaude Opus 4.1推論強度: Thinking80.9%
  76. #75Z.aiGLM 5V Turbo推論強度: Thinking80.9%
  77. #75StepfunStep 3.7 Flash80.9%
  78. #78NVIDIANemotron 3 Super推論強度: Thinking80.0%
  79. #79AnthropicClaude Opus 4推論強度: Thinking79.6%
  80. #80GoogleGemini 2.5 Flash推論強度: Thinking79.0%
  81. #81LG AI ResearchK-EXAONE推論強度: Thinking78.3%
  82. #82OpenAIGPT OSS 120B推論強度: High78.2%
  83. #83MeituanLongCat 2.078.0%
  84. #84AnthropicClaude Sonnet 4推論強度: Thinking77.7%
  85. #84BaiduERNIE 5.0 Thinking77.7%
  86. #86xAIGrok 4.20推論強度: None77.6%
  87. #87Mistral AIMistral Small 4推論強度: Thinking76.9%
  88. #88NVIDIANemotron 3 Nano 30B A3B推論強度: Thinking75.7%
  89. #88CohereNorth Mini Code75.7%
  90. #90Arcee AITrinity Large Thinking75.2%
  91. #91Mistral AIMistral Medium 3.574.8%
  92. #92UpstageSolar Pro 372.4%
  93. #93GoogleGemini 2.5 Flash Lite推論強度: Thinking70.9%
  94. #94OpenAIGPT-5 Nano推論強度: High67.6%
  95. #95AnthropicClaude Haiku 4.5推論強度: Thinking67.2%
  96. #96MetaLlama 4 Maverick67.1%
  97. #97OpenAIGPT-4.166.6%
  98. #98xAIGrok 4.1 Fast推論強度: None63.7%
  99. #99MeituanLongcat Flash Chat63.6%
  100. #100MetaLlama 4 Scout58.7%
  101. #101PerplexitySonar47.1%
  102. #102NVIDIANemotron 3 Nano Omni46.9%
  103. #103IBMGranite 4.1 8B43.3%
モデルの半数が86.6%以下

直近60日にリリースされたAI 37個のうち27個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか24個

出典: Artificial Analysis データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。