Event Info

GPQA Diamond

About This Benchmark

A multiple-choice benchmark measuring graduate-level expert knowledge in biology, chemistry, and physics — challenging even for domain experts. Score is accuracy (%).

Source: Artificial Analysis
RankModel
#1

Google

Gemini 3.1 Pro

94.1%
#2

OpenAI

GPT-5.6 Sol

94.1%
#3

OpenAI

GPT-5.5

93.5%
#4

Moonshot AI

Kimi K3

93.5%
#5

Anthropic

Claude Opus 5

93.2%
#6

xAI

Grok 4.5

93.1%
#7

MiniMax

MiniMax M3

92.9%
#8

Google

Gemini 3.6 Flash

92.8%
#9

Anthropic

Claude Fable 5

92.6%
#10

OpenAI

GPT-5.6 Terra

92.5%
#11

Alibaba

Qwen: Qwen3.7 Max

92.3%
#12

Google

Gemini 3.5 Flash

92.2%
#13

Anthropic

Claude Opus 4.8

92.0%
#14

OpenAI

GPT-5.4

92.0%
#15

Anthropic

Claude Opus 4.7

91.4%
#16

Anthropic

Claude Sonnet 5

91.1%
#17

OpenAI

GPT-5.6 Luna

91.1%
#18

xAI

Grok 4.20 (Reasoning)

91.1%
#19

Moonshot AI

Kimi K2.6

91.1%
#20

xAI

Grok 4.3

90.1%
#21

Alibaba

Qwen3.7 Plus

90.0%
#22

Google

Gemini 3 Flash

89.8%
#23

Meta

Muse Spark 1.1

89.8%
#24

Tencent

Hy3

89.7%
#25

Anthropic

Claude Opus 4.6

89.6%
#26

Moonshot AI

Kimi K2.7 Code

89.6%
#27

Z.ai

GLM 5.2

89.5%
#28

DeepSeek

DeepSeek V4 Flash

89.4%
#29

DeepSeek

DeepSeek V4 Pro

88.8%
#30

Alibaba

Qwen3.6 Max

88.8%
#31

Meta

Muse Spark

88.4%
#32

Alibaba

Qwen3.6 Plus

88.2%
#33

Moonshot AI

Kimi K2.5

87.9%
#34

MiniMax

MiniMax M2.7

87.4%
#35

Xiaomi

MiMo V2 Pro

87.0%
#36

Z.ai

GLM-5.1

86.8%
#37

NVIDIA

Nemotron 3 Ultra

86.7%
#38

Anthropic

Claude Opus 4.5

86.6%
#39

Xiaomi

MiMo V2.5

86.6%
#40

Xiaomi

MiMo V2.5 Pro

86.6%
#41

Alibaba

Qwen3.5 397B A17B

86.1%
#42

Google

Gemma 4 31B

85.7%
#43

Ring AI

Ring-2.6-1T

85.7%
#44

xAI

Grok 4.1 Fast (Reasoning)

85.3%
#45

MiniMax

MiniMax M2.5

84.8%
#46

Z.ai

GLM-5-Turbo

84.7%
#47

Google

Gemini 2.5 Pro

84.4%
#48

Alibaba

Qwen: Qwen3.6 35B A3B

84.1%
#49

DeepSeek

DeepSeek V3.2

84.0%
#50

Google

Gemini 3.5 Flash-Lite

83.8%
#51

Anthropic

Claude Sonnet 4.5

83.4%
#52

OpenAI

GPT-5.4 Mini

82.3%
#53

Google

Gemini 3.1 Flash Lite

82.2%
#54

Z.ai

GLM-5

82.0%
#55

Anthropic

Claude Opus 4.1

80.9%
#56

Z.ai

GLM 5V Turbo

80.9%
#57

Stepfun

Step 3.7 Flash

80.9%
#58

NVIDIA

Nemotron 3 Super

80.0%
#59

Anthropic

Claude Sonnet 4.6

79.7%
#60

Anthropic

Claude Opus 4

79.6%
#61

Google

Gemini 2.5 Flash

79.0%
#62

LG AI Research

K-EXAONE

78.3%
#63

Meituan

LongCat 2.0

78.0%
#64

Anthropic

Claude Sonnet 4

77.7%
#65

Baidu

ERNIE 5.0 Thinking

77.7%
#66

xAI

Grok 4.20

77.6%
#67

Mistral AI

Mistral Small 4

76.9%
#68

OpenAI

GPT-5.4 Nano

76.1%
#69

NVIDIA

Nemotron 3 Nano 30B A3B

75.7%
#70

Cohere

North Mini Code

75.7%
#71

Arcee AI

Trinity Large Thinking

75.2%
#72

Mistral AI

Mistral Medium 3.5

74.8%
#73

Upstage

Solar Pro 3

72.4%
#74

OpenAI

GPT-5 Mini

68.7%
#75

OpenAI

GPT-5

68.6%
#76

Anthropic

Claude Haiku 4.5

67.2%
#77

OpenAI

GPT OSS 120B

67.2%
#78

Meta

Llama 4 Maverick

67.1%
#79

OpenAI

GPT-5 Nano

67.0%
#80

OpenAI

GPT-4.1

66.6%
#81

Google

Gemini 2.5 Flash Lite

65.1%
#82

xAI

Grok 4.1 Fast

63.7%
#83

Meituan

Longcat Flash Chat

63.6%
#84

Amazon

Nova 2 Lite

60.3%
#85

Meta

Llama 4 Scout

58.7%
#86

Perplexity

Sonar

47.1%
#87

NVIDIA

Nemotron 3 Nano Omni

46.9%
#88

IBM

Granite 4.1 8B

43.3%