CritPt
引用多め高いほど良い
アルゴンヌ国立研究所とイリノイ大学が主導し、50人以上の物理学者が作った試験で、教科書の練習問題ではなく実際の初期研究プロジェクト並みの未公開の物理問題71問を解きます。答えは数値・数式・コードの形で自動採点され、スコアは非常に低く出ます。スコアは0〜100%です。高いほど良い結果です。
最高スコア32.3%GPT-5.6 Sol
測定したモデル78件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
さまざまな分野の専門家でも難しい問題を解ける?Humanity's Last Exam
Claude Opus 5.5🥇
Claude Opus 5.5🥇多くの人に最も好まれる数学の回答をするAIは?Arena Math
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇OpenAIGPT-5.6 Sol推論強度: Max49.5%32.3%1494
- 🥈AnthropicClaude Opus 5.5推論強度: Max61.4%31.7%1511
- 🥈OpenAIGPT-6 Astra推論強度: Max54.7%31.7%1490
- 🥈OpenAIGPT-6.1 Sol推論強度: Max52.9%31.7%—
- #5AnthropicClaude Sonnet 5.5推論強度: Max55.0%31.4%—
- #6AnthropicClaude Fable 5.1推論強度: Extra High59.1%31.1%1518
- #7OpenAIGPT-6 Sol推論強度: Max47.9%30.9%1451
- #8OpenAIGPT-5.6 Terra推論強度: Max42.9%30.0%1479
- #8OpenAIGPT-5.4 Pro推論強度: Extra High—30.0%—
- #10AnthropicClaude Opus 5推論強度: Max54.9%29.1%1516
- #11AnthropicClaude Fable 5推論強度: Max55.5%28.6%1522
- #12GoogleGemini 4 Argon推論強度: High57.1%27.1%1530
- #12OpenAIGPT-5.5推論強度: Extra High45.8%27.1%1500
- #14XiaomiMiMo-V2.6-Pro49.4%26.6%1487
- #15MetaMuse Spark 1.3推論強度: Extra High48.7%26.0%1509
- #16OpenAIGPT-5.4推論強度: Extra High43.7%23.4%1492
- #17Moonshot AIKimi K3推論強度: Max46.9%23.4%1501
- #18AnthropicClaude Opus 4.8推論強度: Max48.7%20.9%1477
- #18Z.aiGLM 5.2推論強度: Max41.1%20.9%1488
- #20OpenAIGPT-5.6 Luna推論強度: Max39.5%20.6%1477
- #21xAIGrok 4.6推論強度: Extra High44.1%19.7%1448
- #22OpenAIGPT-6 Luna推論強度: Max38.5%19.4%1460
- #23Z.aiGLM 5.3推論強度: Max42.3%19.1%1494
- #24GoogleGemini 3.8 Flash推論強度: High47.8%18.3%1518
- #25xAIGrok 4.7推論強度: High43.1%18.0%1444
- #25DeepSeekDeepSeek V4 Pro推論強度: Max41.0%18.0%1445
- #27GoogleGemini 3.1 Pro47.0%17.7%1488
- #27MetaMuse Spark 1.2推論強度: Extra High45.5%17.7%1468
- #29AnthropicClaude Sonnet 5推論強度: Max41.3%16.9%1474
- #30DeepSeekDeepSeek V4 Flash推論強度: Max38.6%16.6%1425
- #31xAIGrok 4.5推論強度: High42.7%15.4%1473
- #31Z.aiGLM 5.3 Flash39.9%15.4%1503
- #33MetaMuse Spark 1.1推論強度: Extra High46.2%15.1%1492
- #34GoogleGemini 3.7 Flash推論強度: High47.9%14.3%1503
- #34DeepSeekDeepSeek V4.1 Flash推論強度: Max39.2%14.3%1503
- #36AlibabaQwen3.7 Max40.5%13.4%1484
- #37GoogleGemini 3.5 Flash推論強度: High42.7%13.1%1482
- #38OpenAIGPT-5推論強度: High28.5%12.6%1434
- #39AnthropicClaude Opus 4.7推論強度: Max42.3%12.0%1492
- #39XiaomiMiMo-V2.6-Flash35.1%12.0%1472
- #41MetaMuse Spark40.7%11.3%1466
- #42GoogleGemini 3.6 Flash推論強度: High40.8%10.6%1501
- #43Moonshot AIKimi K2.7 Code35.0%10.0%—
- #43OpenAIGPT-5.4 Mini推論強度: Extra High28.1%10.0%1439
- #45OpenAIGPT-5.4 Nano推論強度: Extra High28.3%9.3%1425
- #46AlibabaQwen3.7 Plus35.6%9.1%1466
- #46xAIGrok Build 0.1—9.1%—
- #48Moonshot AIKimi K2.637.5%8.0%1480
- #48xAIGrok 4.3推論強度: High37.2%8.0%1419
- #50Z.aiGLM-5.130.1%4.6%1475
- #51XiaomiMiMo V2.5 Pro35.7%4.0%1481
- #52MiniMaxMiniMax M339.0%3.7%1432
- #52XiaomiMiMo V2.527.2%3.7%1438
- #52Ring AIRing-2.6-1T21.6%3.7%—
- #55AnthropicClaude Sonnet 4.6推論強度: Max33.6%3.1%1464
- #55Moonshot AIKimi K2.530.7%3.1%1471
- #55NVIDIANemotron 3 Ultra28.4%3.1%1442
- #55NVIDIANemotron 3 Super20.8%3.1%1373
- #59AlibabaQwen3.6 Plus27.8%2.9%1454
- #60StepfunStep 3.7 Flash21.4%2.3%—
- #61GoogleGemini 2.5 Pro22.5%2.0%1439
- #62GoogleGemma 4 31B23.6%1.4%1469
- #63OpenAIGPT OSS 120B推論強度: High19.6%1.1%1381
- #63AnthropicClaude Sonnet 4.517.8%1.1%1428
- #63GoogleGemini 3.1 Flash Lite17.2%1.1%1436
- #66GoogleGemini 2.5 Flash12.1%1.1%1405
- #67Arcee AITrinity Large Thinking15.8%0.9%1384
- #68MiniMaxMiniMax M2.729.6%0.6%1422
- #69AnthropicClaude Opus 412.3%0.3%1421
- #70AlibabaQwen3.6 35B A3B22.2%0.3%—
- #70AnthropicClaude Sonnet 410.7%0.3%1404
- #72OpenAIGPT-5 Mini推論強度: High21.5%0.0%1405
- #72GoogleGemini 3.5 Flash-Lite18.8%0.0%1442
- #72Mistral AIMistral Medium 3.513.8%0.0%1429
- #72AnthropicClaude Haiku 4.510.4%0.0%1400
- #72UpstageSolar Pro 310.3%0.0%—
- #72MetaLlama 4 Maverick4.9%0.0%1316
- #72MetaLlama 4 Scout3.8%0.0%1309
難しい試験 · 最高スコア32.3% · モデルの半数が12.0%以下最終更新 2026-10-07
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。