GPQA Diamond

한 줄 요약 · 생물·화학·물리 박사급 객관식 문제를 얼마나 맞히는지

무엇을 측정하나요?
박사급 전문가도 틀리는 과학 문제를 얼마나 맞히는지 봅니다. 인터넷 검색으로는 답을 찾기 어렵게 만든 문제라("Google-proof"), 암기가 아니라 깊은 이해와 추론을 잽니다.
누가 어떻게 평가하나요?
생물학·화학·물리학 박사(과정) 전문가들이 문제를 쓰고 다른 전문가가 검증했습니다. 전체 448문항 중 전문가는 맞히고 비전문가는 틀린 가장 엄선된 198문항이 'Diamond' 이며, 4지선다 정답률로 채점합니다. Artificial Analysis 가 직접 실행합니다.
점수 읽는 법
0~100%. 참고로 해당 분야 박사 전문가의 정답률이 약 65%(명백한 실수 제외 시 74%), 인터넷을 30분 이상 검색한 비전문가는 약 34% 였습니다. 4지선다라 무작위로 찍어도 25% 는 나옵니다.

순위

최고 점수96.3%GPT-6 Astra
측정한 모델103개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇OpenAIGPT-6 Astra추론 강도: Extra High96.3%
  2. 🥈GoogleGemini 3.8 Flash추론 강도: High95.3%
  3. 🥉xAIGrok 4.6추론 강도: High94.9%
  4. #4GoogleGemini 3.7 Flash추론 강도: High94.5%
  5. #5GoogleGemini 3.1 Pro94.1%
  6. #5OpenAIGPT-5.6 Sol추론 강도: Max94.1%
  7. #5MetaMuse Spark 1.3추론 강도: Extra High94.1%
  8. #8AnthropicClaude Fable 5.1추론 강도: Max93.7%
  9. #8AnthropicClaude Opus 5추론 강도: Extra High93.7%
  10. #10OpenAIGPT-5.5추론 강도: Extra High93.5%
  11. #10Moonshot AIKimi K3추론 강도: Max93.5%
  12. #12xAIGrok 4.5추론 강도: High93.1%
  13. #13MiniMaxMiniMax M392.9%
  14. #14DeepSeekDeepSeek V4 Pro추론 강도: Max92.8%
  15. #14GoogleGemini 3.6 Flash추론 강도: High92.8%
  16. #16AnthropicClaude Fable 5추론 강도: Max92.6%
  17. #17OpenAIGPT-5.6 Terra추론 강도: Max92.5%
  18. #18AlibabaQwen3.7 Max92.3%
  19. #18AlibabaQwen3.8 Flash92.3%
  20. #20GoogleGemini 3.5 Flash추론 강도: High92.2%
  21. #21AnthropicClaude Opus 4.8추론 강도: Max92.0%
  22. #21OpenAIGPT-5.4추론 강도: Extra High92.0%
  23. #23Z.aiGLM 5.3추론 강도: Max91.7%
  24. #24AnthropicClaude Opus 4.7추론 강도: Max91.4%
  25. #25Z.aiGLM 5.3 Flash91.2%
  26. #26AnthropicClaude Sonnet 5추론 강도: Max91.1%
  27. #26OpenAIGPT-5.6 Luna추론 강도: Max91.1%
  28. #26xAIGrok 4.20 (Reasoning)추론 강도: Thinking91.1%
  29. #26Moonshot AIKimi K2.6추론 강도: Thinking91.1%
  30. #30DeepSeekDeepSeek V4 Flash추론 강도: Max90.8%
  31. #31MetaMuse Spark 1.2추론 강도: Extra High90.4%
  32. #32xAIGrok 4.3추론 강도: High90.1%
  33. #33AlibabaQwen3.7 Plus90.0%
  34. #34GoogleGemini 3 Flash추론 강도: Thinking89.8%
  35. #34MetaMuse Spark 1.1추론 강도: Extra High89.8%
  36. #36TencentHy389.7%
  37. #37AnthropicClaude Opus 4.6추론 강도: Max89.6%
  38. #37Moonshot AIKimi K2.7 Code89.6%
  39. #39Z.aiGLM 5.2추론 강도: Max89.5%
  40. #40AlibabaQwen3.5 397B A17B추론 강도: Thinking89.3%
  41. #41UpstageSolar Pro 489.1%
  42. #42AlibabaQwen3.6 Max88.8%
  43. #43MetaMuse Spark88.4%
  44. #44AlibabaQwen3.6 Plus88.2%
  45. #45Moonshot AIKimi K2.5추론 강도: Thinking87.9%
  46. #46AnthropicClaude Sonnet 4.6추론 강도: Max87.5%
  47. #46OpenAIGPT-5.4 Mini추론 강도: Extra High87.5%
  48. #48MiniMaxMiniMax M2.787.4%
  49. #49XiaomiMiMo V2 Pro87.0%
  50. #50Z.aiGLM-5.1추론 강도: Thinking86.8%
  51. #51NVIDIANemotron 3 Ultra추론 강도: Thinking86.7%
  52. #52AnthropicClaude Opus 4.5추론 강도: Thinking86.6%
  53. #52XiaomiMiMo V2.5 Pro추론 강도: Thinking86.6%
  54. #54SK TelecomA.X K285.7%
  55. #54GoogleGemma 4 31B추론 강도: Thinking85.7%
  56. #54Ring AIRing-2.6-1T85.7%
  57. #57OpenAIGPT-5추론 강도: High85.4%
  58. #58xAIGrok 4.1 Fast (Reasoning)추론 강도: Thinking85.3%
  59. #59XiaomiMiMo V2.584.9%
  60. #60MiniMaxMiniMax M2.584.8%
  61. #61Z.aiGLM-5-Turbo84.7%
  62. #62GoogleGemini 2.5 Pro84.4%
  63. #63AlibabaQwen3.6 35B A3B추론 강도: Thinking84.1%
  64. #64DeepSeekDeepSeek V3.2추론 강도: Thinking84.0%
  65. #65GoogleGemini 3.5 Flash-Lite83.8%
  66. #66AnthropicClaude Sonnet 4.5추론 강도: Thinking83.4%
  67. #66Motif TechnologiesMotif 383.4%
  68. #68LG AI ResearchK-EXAONE 2.082.9%
  69. #69OpenAIGPT-5 Mini추론 강도: High82.8%
  70. #70AlibabaQwen3.5 Plus82.6%
  71. #71GoogleGemini 3.1 Flash Lite82.2%
  72. #72Z.aiGLM-5추론 강도: Thinking82.0%
  73. #73OpenAIGPT-5.4 Nano추론 강도: Extra High81.7%
  74. #74AmazonNova 2 Lite추론 강도: High81.1%
  75. #75AnthropicClaude Opus 4.1추론 강도: Thinking80.9%
  76. #75Z.aiGLM 5V Turbo추론 강도: Thinking80.9%
  77. #75StepfunStep 3.7 Flash80.9%
  78. #78NVIDIANemotron 3 Super추론 강도: Thinking80.0%
  79. #79AnthropicClaude Opus 4추론 강도: Thinking79.6%
  80. #80GoogleGemini 2.5 Flash추론 강도: Thinking79.0%
  81. #81LG AI ResearchK-EXAONE추론 강도: Thinking78.3%
  82. #82OpenAIGPT OSS 120B추론 강도: High78.2%
  83. #83MeituanLongCat 2.078.0%
  84. #84AnthropicClaude Sonnet 4추론 강도: Thinking77.7%
  85. #84BaiduERNIE 5.0 Thinking77.7%
  86. #86xAIGrok 4.20추론 강도: None77.6%
  87. #87Mistral AIMistral Small 4추론 강도: Thinking76.9%
  88. #88NVIDIANemotron 3 Nano 30B A3B추론 강도: Thinking75.7%
  89. #88CohereNorth Mini Code75.7%
  90. #90Arcee AITrinity Large Thinking75.2%
  91. #91Mistral AIMistral Medium 3.574.8%
  92. #92UpstageSolar Pro 372.4%
  93. #93GoogleGemini 2.5 Flash Lite추론 강도: Thinking70.9%
  94. #94OpenAIGPT-5 Nano추론 강도: High67.6%
  95. #95AnthropicClaude Haiku 4.5추론 강도: Thinking67.2%
  96. #96MetaLlama 4 Maverick67.1%
  97. #97OpenAIGPT-4.166.6%
  98. #98xAIGrok 4.1 Fast추론 강도: None63.7%
  99. #99MeituanLongcat Flash Chat63.6%
  100. #100MetaLlama 4 Scout58.7%
  101. #101PerplexitySonar47.1%
  102. #102NVIDIANemotron 3 Nano Omni46.9%
  103. #103IBMGranite 4.1 8B43.3%
모델 절반이 86.6% 이하

최근 60일 내 출시된 AI 37개 중 27개는 아직 이 지표에 반영되지 않았습니다 · Claude Haiku 5.5, Decider V1.1 27B, Mistral Large 4 외 24개

출처: Artificial Analysis 데이터 출처·게재 중단 요청

점수 해석 시 유의사항

  • 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
  • '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.