CritPt
Often citedHigher is better
Made by 50+ physicists led by Argonne National Laboratory and the University of Illinois: 71 unpublished physics problems at the level of early research projects rather than textbook exercises. Answers are numbers, formulas, or code, graded automatically, and scores are very low. Scores run from 0 to 100%. Higher is better.
Top score32.3%GPT-5.6 Sol
Models tested78
Model release date (newest on the right)
Best score so farHigher on the chart is better
Can it solve problems that stump experts across fields?Humanity's Last Exam
Claude Opus 5.5🥇
Claude Opus 5.5🥇Which AI gives the math answers people prefer most?Arena Math
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇OpenAIGPT-5.6 SolReasoning effort: Max49.5%32.3%1494
- 🥈AnthropicClaude Opus 5.5Reasoning effort: Max61.4%31.7%1511
- 🥈OpenAIGPT-6 AstraReasoning effort: Max54.7%31.7%1490
- 🥈OpenAIGPT-6.1 SolReasoning effort: Max52.9%31.7%—
- #5AnthropicClaude Sonnet 5.5Reasoning effort: Max55.0%31.4%—
- #6AnthropicClaude Fable 5.1Reasoning effort: Extra High59.1%31.1%1518
- #7OpenAIGPT-6 SolReasoning effort: Max47.9%30.9%1451
- #8OpenAIGPT-5.6 TerraReasoning effort: Max42.9%30.0%1479
- #8OpenAIGPT-5.4 ProReasoning effort: Extra High—30.0%—
- #10AnthropicClaude Opus 5Reasoning effort: Max54.9%29.1%1516
- #11AnthropicClaude Fable 5Reasoning effort: Max55.5%28.6%1522
- #12GoogleGemini 4 ArgonReasoning effort: High57.1%27.1%1530
- #12OpenAIGPT-5.5Reasoning effort: Extra High45.8%27.1%1500
- #14XiaomiMiMo-V2.6-Pro49.4%26.6%1487
- #15MetaMuse Spark 1.3Reasoning effort: Extra High48.7%26.0%1509
- #16OpenAIGPT-5.4Reasoning effort: Extra High43.7%23.4%1492
- #17Moonshot AIKimi K3Reasoning effort: Max46.9%23.4%1501
- #18AnthropicClaude Opus 4.8Reasoning effort: Max48.7%20.9%1477
- #18Z.aiGLM 5.2Reasoning effort: Max41.1%20.9%1488
- #20OpenAIGPT-5.6 LunaReasoning effort: Max39.5%20.6%1477
- #21xAIGrok 4.6Reasoning effort: Extra High44.1%19.7%1448
- #22OpenAIGPT-6 LunaReasoning effort: Max38.5%19.4%1460
- #23Z.aiGLM 5.3Reasoning effort: Max42.3%19.1%1494
- #24GoogleGemini 3.8 FlashReasoning effort: High47.8%18.3%1518
- #25xAIGrok 4.7Reasoning effort: High43.1%18.0%1444
- #25DeepSeekDeepSeek V4 ProReasoning effort: Max41.0%18.0%1445
- #27GoogleGemini 3.1 Pro47.0%17.7%1488
- #27MetaMuse Spark 1.2Reasoning effort: Extra High45.5%17.7%1468
- #29AnthropicClaude Sonnet 5Reasoning effort: Max41.3%16.9%1474
- #30DeepSeekDeepSeek V4 FlashReasoning effort: Max38.6%16.6%1425
- #31xAIGrok 4.5Reasoning effort: High42.7%15.4%1473
- #31Z.aiGLM 5.3 Flash39.9%15.4%1503
- #33MetaMuse Spark 1.1Reasoning effort: Extra High46.2%15.1%1492
- #34GoogleGemini 3.7 FlashReasoning effort: High47.9%14.3%1503
- #34DeepSeekDeepSeek V4.1 FlashReasoning effort: Max39.2%14.3%1503
- #36AlibabaQwen3.7 Max40.5%13.4%1484
- #37GoogleGemini 3.5 FlashReasoning effort: High42.7%13.1%1482
- #38OpenAIGPT-5Reasoning effort: High28.5%12.6%1434
- #39AnthropicClaude Opus 4.7Reasoning effort: Max42.3%12.0%1492
- #39XiaomiMiMo-V2.6-Flash35.1%12.0%1472
- #41MetaMuse Spark40.7%11.3%1466
- #42GoogleGemini 3.6 FlashReasoning effort: High40.8%10.6%1501
- #43Moonshot AIKimi K2.7 Code35.0%10.0%—
- #43OpenAIGPT-5.4 MiniReasoning effort: Extra High28.1%10.0%1439
- #45OpenAIGPT-5.4 NanoReasoning effort: Extra High28.3%9.3%1425
- #46AlibabaQwen3.7 Plus35.6%9.1%1466
- #46xAIGrok Build 0.1—9.1%—
- #48Moonshot AIKimi K2.637.5%8.0%1480
- #48xAIGrok 4.3Reasoning effort: High37.2%8.0%1419
- #50Z.aiGLM-5.130.1%4.6%1475
- #51XiaomiMiMo V2.5 Pro35.7%4.0%1481
- #52MiniMaxMiniMax M339.0%3.7%1432
- #52XiaomiMiMo V2.527.2%3.7%1438
- #52Ring AIRing-2.6-1T21.6%3.7%—
- #55AnthropicClaude Sonnet 4.6Reasoning effort: Max33.6%3.1%1464
- #55Moonshot AIKimi K2.530.7%3.1%1471
- #55NVIDIANemotron 3 Ultra28.4%3.1%1442
- #55NVIDIANemotron 3 Super20.8%3.1%1373
- #59AlibabaQwen3.6 Plus27.8%2.9%1454
- #60StepfunStep 3.7 Flash21.4%2.3%—
- #61GoogleGemini 2.5 Pro22.5%2.0%1439
- #62GoogleGemma 4 31B23.6%1.4%1469
- #63OpenAIGPT OSS 120BReasoning effort: High19.6%1.1%1381
- #63AnthropicClaude Sonnet 4.517.8%1.1%1428
- #63GoogleGemini 3.1 Flash Lite17.2%1.1%1436
- #66GoogleGemini 2.5 Flash12.1%1.1%1405
- #67Arcee AITrinity Large Thinking15.8%0.9%1384
- #68MiniMaxMiniMax M2.729.6%0.6%1422
- #69AnthropicClaude Opus 412.3%0.3%1421
- #70AlibabaQwen3.6 35B A3B22.2%0.3%—
- #70AnthropicClaude Sonnet 410.7%0.3%1404
- #72OpenAIGPT-5 MiniReasoning effort: High21.5%0.0%1405
- #72GoogleGemini 3.5 Flash-Lite18.8%0.0%1442
- #72Mistral AIMistral Medium 3.513.8%0.0%1429
- #72AnthropicClaude Haiku 4.510.4%0.0%1400
- #72UpstageSolar Pro 310.3%0.0%—
- #72MetaLlama 4 Maverick4.9%0.0%1316
- #72MetaLlama 4 Scout3.8%0.0%1309
Hard test · top score 32.3% · Half of models ≤ 12.0%Last updated 2026-10-07
The "harness" is the agent program the AI used to carry out the task. The same model can score very differently depending on its harness and reasoning effort.