CritPt

引用多め高いほど良い

アルゴンヌ国立研究所とイリノイ大学が主導し、50人以上の物理学者が作った試験で、教科書の練習問題ではなく実際の初期研究プロジェクト並みの未公開の物理問題71問を解きます。答えは数値・数式・コードの形で自動採点され、スコアは非常に低く出ます。スコアは0〜100%です。高いほど良い結果です。

最高スコア32.3%GPT-5.6 Sol
測定したモデル78件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇OpenAIGPT-5.6 Sol推論強度: Max49.5%32.3%1494
  2. 🥈AnthropicClaude Opus 5.5推論強度: Max61.4%31.7%1511
  3. 🥈OpenAIGPT-6 Astra推論強度: Max54.7%31.7%1490
  4. 🥈OpenAIGPT-6.1 Sol推論強度: Max52.9%31.7%—
  5. #5AnthropicClaude Sonnet 5.5推論強度: Max55.0%31.4%—
  6. #6AnthropicClaude Fable 5.1推論強度: Extra High59.1%31.1%1518
  7. #7OpenAIGPT-6 Sol推論強度: Max47.9%30.9%1451
  8. #8OpenAIGPT-5.6 Terra推論強度: Max42.9%30.0%1479
  9. #8OpenAIGPT-5.4 Pro推論強度: Extra High—30.0%—
  10. #10AnthropicClaude Opus 5推論強度: Max54.9%29.1%1516
  11. #11AnthropicClaude Fable 5推論強度: Max55.5%28.6%1522
  12. #12GoogleGemini 4 Argon推論強度: High57.1%27.1%1530
  13. #12OpenAIGPT-5.5推論強度: Extra High45.8%27.1%1500
  14. #14XiaomiMiMo-V2.6-Pro49.4%26.6%1487
  15. #15MetaMuse Spark 1.3推論強度: Extra High48.7%26.0%1509
  16. #16OpenAIGPT-5.4推論強度: Extra High43.7%23.4%1492
  17. #17Moonshot AIKimi K3推論強度: Max46.9%23.4%1501
  18. #18AnthropicClaude Opus 4.8推論強度: Max48.7%20.9%1477
  19. #18Z.aiGLM 5.2推論強度: Max41.1%20.9%1488
  20. #20OpenAIGPT-5.6 Luna推論強度: Max39.5%20.6%1477
  21. #21xAIGrok 4.6推論強度: Extra High44.1%19.7%1448
  22. #22OpenAIGPT-6 Luna推論強度: Max38.5%19.4%1460
  23. #23Z.aiGLM 5.3推論強度: Max42.3%19.1%1494
  24. #24GoogleGemini 3.8 Flash推論強度: High47.8%18.3%1518
  25. #25xAIGrok 4.7推論強度: High43.1%18.0%1444
  26. #25DeepSeekDeepSeek V4 Pro推論強度: Max41.0%18.0%1445
  27. #27GoogleGemini 3.1 Pro47.0%17.7%1488
  28. #27MetaMuse Spark 1.2推論強度: Extra High45.5%17.7%1468
  29. #29AnthropicClaude Sonnet 5推論強度: Max41.3%16.9%1474
  30. #30DeepSeekDeepSeek V4 Flash推論強度: Max38.6%16.6%1425
  31. #31xAIGrok 4.5推論強度: High42.7%15.4%1473
  32. #31Z.aiGLM 5.3 Flash39.9%15.4%1503
  33. #33MetaMuse Spark 1.1推論強度: Extra High46.2%15.1%1492
  34. #34GoogleGemini 3.7 Flash推論強度: High47.9%14.3%1503
  35. #34DeepSeekDeepSeek V4.1 Flash推論強度: Max39.2%14.3%1503
  36. #36AlibabaQwen3.7 Max40.5%13.4%1484
  37. #37GoogleGemini 3.5 Flash推論強度: High42.7%13.1%1482
  38. #38OpenAIGPT-5推論強度: High28.5%12.6%1434
  39. #39AnthropicClaude Opus 4.7推論強度: Max42.3%12.0%1492
  40. #39XiaomiMiMo-V2.6-Flash35.1%12.0%1472
  41. #41MetaMuse Spark40.7%11.3%1466
  42. #42GoogleGemini 3.6 Flash推論強度: High40.8%10.6%1501
  43. #43Moonshot AIKimi K2.7 Code35.0%10.0%—
  44. #43OpenAIGPT-5.4 Mini推論強度: Extra High28.1%10.0%1439
  45. #45OpenAIGPT-5.4 Nano推論強度: Extra High28.3%9.3%1425
  46. #46AlibabaQwen3.7 Plus35.6%9.1%1466
  47. #46xAIGrok Build 0.1—9.1%—
  48. #48Moonshot AIKimi K2.637.5%8.0%1480
  49. #48xAIGrok 4.3推論強度: High37.2%8.0%1419
  50. #50Z.aiGLM-5.130.1%4.6%1475
  51. #51XiaomiMiMo V2.5 Pro35.7%4.0%1481
  52. #52MiniMaxMiniMax M339.0%3.7%1432
  53. #52XiaomiMiMo V2.527.2%3.7%1438
  54. #52Ring AIRing-2.6-1T21.6%3.7%—
  55. #55AnthropicClaude Sonnet 4.6推論強度: Max33.6%3.1%1464
  56. #55Moonshot AIKimi K2.530.7%3.1%1471
  57. #55NVIDIANemotron 3 Ultra28.4%3.1%1442
  58. #55NVIDIANemotron 3 Super20.8%3.1%1373
  59. #59AlibabaQwen3.6 Plus27.8%2.9%1454
  60. #60StepfunStep 3.7 Flash21.4%2.3%—
  61. #61GoogleGemini 2.5 Pro22.5%2.0%1439
  62. #62GoogleGemma 4 31B23.6%1.4%1469
  63. #63OpenAIGPT OSS 120B推論強度: High19.6%1.1%1381
  64. #63AnthropicClaude Sonnet 4.517.8%1.1%1428
  65. #63GoogleGemini 3.1 Flash Lite17.2%1.1%1436
  66. #66GoogleGemini 2.5 Flash12.1%1.1%1405
  67. #67Arcee AITrinity Large Thinking15.8%0.9%1384
  68. #68MiniMaxMiniMax M2.729.6%0.6%1422
  69. #69AnthropicClaude Opus 412.3%0.3%1421
  70. #70AlibabaQwen3.6 35B A3B22.2%0.3%—
  71. #70AnthropicClaude Sonnet 410.7%0.3%1404
  72. #72OpenAIGPT-5 Mini推論強度: High21.5%0.0%1405
  73. #72GoogleGemini 3.5 Flash-Lite18.8%0.0%1442
  74. #72Mistral AIMistral Medium 3.513.8%0.0%1429
  75. #72AnthropicClaude Haiku 4.510.4%0.0%1400
  76. #72UpstageSolar Pro 310.3%0.0%—
  77. #72MetaLlama 4 Maverick4.9%0.0%1316
  78. #72MetaLlama 4 Scout3.8%0.0%1309
難しい試験 · 最高スコア32.3% · モデルの半数が12.0%以下最終更新 2026-10-07

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。