GPQA Diamond
한 줄 요약 · 생물·화학·물리 박사급 객관식 문제를 얼마나 맞히는지
- 무엇을 측정하나요?
- 박사급 전문가도 틀리는 과학 문제를 얼마나 맞히는지 봅니다. 인터넷 검색으로는 답을 찾기 어렵게 만든 문제라("Google-proof"), 암기가 아니라 깊은 이해와 추론을 잽니다.
- 누가 어떻게 평가하나요?
- 생물학·화학·물리학 박사(과정) 전문가들이 문제를 쓰고 다른 전문가가 검증했습니다. 전체 448문항 중 전문가는 맞히고 비전문가는 틀린 가장 엄선된 198문항이 'Diamond' 이며, 4지선다 정답률로 채점합니다. Artificial Analysis 가 직접 실행합니다.
- 점수 읽는 법
- 0~100%. 참고로 해당 분야 박사 전문가의 정답률이 약 65%(명백한 실수 제외 시 74%), 인터넷을 30분 이상 검색한 비전문가는 약 34% 였습니다. 4지선다라 무작위로 찍어도 25% 는 나옵니다.
순위
최고 점수96.3%GPT-6 Astra
측정한 모델103개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
여러 분야 전문가도 어려워하는 문제를 풀 수 있을까?Humanity's Last Exam
Claude Opus 5.5🥇
Claude Opus 5.5🥇연구 수준의 물리 문제를 풀 수 있을까?CritPt
GPT-5.6 Sol🥇
GPT-5.6 Sol🥇대중들이 가장 선호하는 수학 답변을 하는 AI는?Arena Math
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇OpenAIGPT-6 Astra추론 강도: Extra High96.3%
- 🥈GoogleGemini 3.8 Flash추론 강도: High95.3%
- 🥉xAIGrok 4.6추론 강도: High94.9%
- #4GoogleGemini 3.7 Flash추론 강도: High94.5%
- #5GoogleGemini 3.1 Pro94.1%
- #5OpenAIGPT-5.6 Sol추론 강도: Max94.1%
- #5MetaMuse Spark 1.3추론 강도: Extra High94.1%
- #8AnthropicClaude Fable 5.1추론 강도: Max93.7%
- #8AnthropicClaude Opus 5추론 강도: Extra High93.7%
- #10OpenAIGPT-5.5추론 강도: Extra High93.5%
- #10Moonshot AIKimi K3추론 강도: Max93.5%
- #12xAIGrok 4.5추론 강도: High93.1%
- #13MiniMaxMiniMax M392.9%
- #14DeepSeekDeepSeek V4 Pro추론 강도: Max92.8%
- #14GoogleGemini 3.6 Flash추론 강도: High92.8%
- #16AnthropicClaude Fable 5추론 강도: Max92.6%
- #17OpenAIGPT-5.6 Terra추론 강도: Max92.5%
- #18AlibabaQwen3.7 Max92.3%
- #18AlibabaQwen3.8 Flash92.3%
- #20GoogleGemini 3.5 Flash추론 강도: High92.2%
- #21AnthropicClaude Opus 4.8추론 강도: Max92.0%
- #21OpenAIGPT-5.4추론 강도: Extra High92.0%
- #23Z.aiGLM 5.3추론 강도: Max91.7%
- #24AnthropicClaude Opus 4.7추론 강도: Max91.4%
- #25Z.aiGLM 5.3 Flash91.2%
- #26AnthropicClaude Sonnet 5추론 강도: Max91.1%
- #26OpenAIGPT-5.6 Luna추론 강도: Max91.1%
- #26xAIGrok 4.20 (Reasoning)추론 강도: Thinking91.1%
- #26Moonshot AIKimi K2.6추론 강도: Thinking91.1%
- #30DeepSeekDeepSeek V4 Flash추론 강도: Max90.8%
- #31MetaMuse Spark 1.2추론 강도: Extra High90.4%
- #32xAIGrok 4.3추론 강도: High90.1%
- #33AlibabaQwen3.7 Plus90.0%
- #34GoogleGemini 3 Flash추론 강도: Thinking89.8%
- #34MetaMuse Spark 1.1추론 강도: Extra High89.8%
- #36TencentHy389.7%
- #37AnthropicClaude Opus 4.6추론 강도: Max89.6%
- #37Moonshot AIKimi K2.7 Code89.6%
- #39Z.aiGLM 5.2추론 강도: Max89.5%
- #40AlibabaQwen3.5 397B A17B추론 강도: Thinking89.3%
- #41UpstageSolar Pro 489.1%
- #42AlibabaQwen3.6 Max88.8%
- #43MetaMuse Spark88.4%
- #44AlibabaQwen3.6 Plus88.2%
- #45Moonshot AIKimi K2.5추론 강도: Thinking87.9%
- #46AnthropicClaude Sonnet 4.6추론 강도: Max87.5%
- #46OpenAIGPT-5.4 Mini추론 강도: Extra High87.5%
- #48MiniMaxMiniMax M2.787.4%
- #49XiaomiMiMo V2 Pro87.0%
- #50Z.aiGLM-5.1추론 강도: Thinking86.8%
- #51NVIDIANemotron 3 Ultra추론 강도: Thinking86.7%
- #52AnthropicClaude Opus 4.5추론 강도: Thinking86.6%
- #52XiaomiMiMo V2.5 Pro추론 강도: Thinking86.6%
- #54SK TelecomA.X K285.7%
- #54GoogleGemma 4 31B추론 강도: Thinking85.7%
- #54Ring AIRing-2.6-1T85.7%
- #57OpenAIGPT-5추론 강도: High85.4%
- #58xAIGrok 4.1 Fast (Reasoning)추론 강도: Thinking85.3%
- #59XiaomiMiMo V2.584.9%
- #60MiniMaxMiniMax M2.584.8%
- #61Z.aiGLM-5-Turbo84.7%
- #62GoogleGemini 2.5 Pro84.4%
- #63AlibabaQwen3.6 35B A3B추론 강도: Thinking84.1%
- #64DeepSeekDeepSeek V3.2추론 강도: Thinking84.0%
- #65GoogleGemini 3.5 Flash-Lite83.8%
- #66AnthropicClaude Sonnet 4.5추론 강도: Thinking83.4%
- #66Motif TechnologiesMotif 383.4%
- #68LG AI ResearchK-EXAONE 2.082.9%
- #69OpenAIGPT-5 Mini추론 강도: High82.8%
- #70AlibabaQwen3.5 Plus82.6%
- #71GoogleGemini 3.1 Flash Lite82.2%
- #72Z.aiGLM-5추론 강도: Thinking82.0%
- #73OpenAIGPT-5.4 Nano추론 강도: Extra High81.7%
- #74AmazonNova 2 Lite추론 강도: High81.1%
- #75AnthropicClaude Opus 4.1추론 강도: Thinking80.9%
- #75Z.aiGLM 5V Turbo추론 강도: Thinking80.9%
- #75StepfunStep 3.7 Flash80.9%
- #78NVIDIANemotron 3 Super추론 강도: Thinking80.0%
- #79AnthropicClaude Opus 4추론 강도: Thinking79.6%
- #80GoogleGemini 2.5 Flash추론 강도: Thinking79.0%
- #81LG AI ResearchK-EXAONE추론 강도: Thinking78.3%
- #82OpenAIGPT OSS 120B추론 강도: High78.2%
- #83MeituanLongCat 2.078.0%
- #84AnthropicClaude Sonnet 4추론 강도: Thinking77.7%
- #84BaiduERNIE 5.0 Thinking77.7%
- #86xAIGrok 4.20추론 강도: None77.6%
- #87Mistral AIMistral Small 4추론 강도: Thinking76.9%
- #88NVIDIANemotron 3 Nano 30B A3B추론 강도: Thinking75.7%
- #88CohereNorth Mini Code75.7%
- #90Arcee AITrinity Large Thinking75.2%
- #91Mistral AIMistral Medium 3.574.8%
- #92UpstageSolar Pro 372.4%
- #93GoogleGemini 2.5 Flash Lite추론 강도: Thinking70.9%
- #94OpenAIGPT-5 Nano추론 강도: High67.6%
- #95AnthropicClaude Haiku 4.5추론 강도: Thinking67.2%
- #96MetaLlama 4 Maverick67.1%
- #97OpenAIGPT-4.166.6%
- #98xAIGrok 4.1 Fast추론 강도: None63.7%
- #99MeituanLongcat Flash Chat63.6%
- #100MetaLlama 4 Scout58.7%
- #101PerplexitySonar47.1%
- #102NVIDIANemotron 3 Nano Omni46.9%
- #103IBMGranite 4.1 8B43.3%
모델 절반이 86.6% 이하
최근 60일 내 출시된 AI 37개 중 27개는 아직 이 지표에 반영되지 않았습니다 · Claude Haiku 5.5, Decider V1.1 27B, Mistral Large 4 외 24개
출처: Artificial Analysis 데이터 출처·게재 중단 요청점수 해석 시 유의사항
- 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
- '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.