AA Intelligence Index

かんたんに言うと · 複数の試験結果をひとつにまとめた総合成績

何を測定しますか?
複数の試験の点数を一つにまとめた総合成績表です。コーディング・科学・業務代行・長文理解を個別に見るのではなく「全体としてどれだけ有能か」を一つの数字で比べるときに使います。この点数が高いAIは一芸に秀でるより万能型の傾向があります。
誰がどのように評価しますか?
独立評価機関 Artificial Analysis が9つの評価(GDPval-AA・τ³-Banking・Terminal-Bench・SciCode・AA-LCR・AA-Omniscience・Humanity's Last Exam・GPQA Diamond・CritPt)を自ら実行し、加重平均します。エージェント・コーディング・一般能力・科学的推論の4領域が反映され、開発元の発表値ではなく第三者の実測です。
スコアの読み方
0〜100点です。上位は数点差に密集しているため1〜2点の差は体感しにくく、順位より点数帯を見るのが安全です。英語テキスト中心の評価のため、画像・音声・日本語の実力は反映されません。構成評価と重みはバージョンごとに変わってきた(現在 v4.1.1)ので、時点の異なる点数の直接比較は避けてください。

順位

最高スコア57.6Claude Opus 5.5
測定したモデル117件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇AnthropicClaude Opus 5.5推論強度: Max57.6150482.1
  2. 🥈AnthropicClaude Sonnet 5.5推論強度: Max56.0147177.8
  3. 🥉AnthropicClaude Fable 5.1推論強度: Max53.4150183.4
  4. #4OpenAIGPT-6 Astra推論強度: Max52.7147782.2
  5. #5GoogleGemini 4 Argon推論強度: High52.61525—
  6. #6OpenAIGPT-6.1 Sol推論強度: Max51.8148381.1
  7. #7AnthropicClaude Opus 5推論強度: Max50.8149080.1
  8. #8AnthropicClaude Fable 5推論強度: Max49.6150483.0
  9. #9MetaMuse Spark 1.3推論強度: Max48.1149481.6
  10. #10OpenAIGPT-6 Sol推論強度: Max47.6145779.3
  11. #11OpenAIGPT-5.6 Sol推論強度: Max47.0148481.0
  12. #12xAIGrok 4.7推論強度: Extra High46.4144377.4
  13. #13XiaomiMiMo-V2.6-Pro46.31480—
  14. #14Z.aiGLM 5.3推論強度: Max44.8147976.1
  15. #15xAIGrok 4.6推論強度: High44.3145478.0
  16. #16StepfunStep-543.71454—
  17. #17Moonshot AIKimi K3推論強度: Max43.6148879.2
  18. #18AnthropicClaude Haiku 5.5推論強度: Max43.4——
  19. #19OpenAIGPT-5.6 Terra推論強度: Max42.1146677.9
  20. #20AnthropicClaude Opus 4.8推論強度: Max41.8147576.2
  21. #20Z.aiGLM 5.3 Flash41.8147371.6
  22. #22GoogleGemini 3.8 Flash推論強度: High40.9149575.8
  23. #23AnthropicClaude Opus 4.7推論強度: Max40.7149476.5
  24. #24AlibabaQwen3.8 Flash39.8—76.2
  25. #25GoogleGemini 3.7 Flash推論強度: Medium39.6148878.8
  26. #25MetaMuse Spark 1.2推論強度: Extra High39.6149478.0
  27. #27DeepSeekDeepSeek V4.1 Flash推論強度: Max39.5147481.1
  28. #28OpenAIGPT-5.4推論強度: Extra High39.0147578.0
  29. #29xAIGrok 4.5推論強度: High38.8146675.8
  30. #30OpenAIGPT-5.5推論強度: Extra High38.4147780.2
  31. #30Mistral AIMistral Large 438.4——
  32. #32AnthropicClaude Sonnet 5推論強度: Max38.2146276.0
  33. #33OpenAIGPT-6 Luna推論強度: Max38.1144372.0
  34. #34XiaomiMiMo-V2.6-Flash37.91452—
  35. #35OpenAIGPT-5.6 Luna推論強度: Max37.3145373.6
  36. #36DeepSeekDeepSeek V4 Pro推論強度: Max36.0145871.6
  37. #37DeepSeekDeepSeek V4 Flash推論強度: Max34.3143665.5
  38. #38GoogleGemini 3.6 Flash推論強度: High34.0148373.6
  39. #39Z.aiGLM 5.2推論強度: Max33.7147673.2
  40. #39MetaMuse Spark 1.1推論強度: Extra High33.7149175.3
  41. #41GoogleGemini 3.5 Flash推論強度: Medium33.6147674.6
  42. #41Motif TechnologiesMotif 333.6——
  43. #43AnthropicClaude Opus 4.6推論強度: Max31.9149774.5
  44. #44MetaMuse Spark31.31489—
  45. #45AnthropicClaude Sonnet 4.6推論強度: Max30.1147273.0
  46. #46GoogleGemini 3.1 Pro29.7148777.0
  47. #47AlibabaQwen3.7 Max29.5147573.1
  48. #48MiniMaxMiniMax M329.2144067.3
  49. #49AnthropicClaude Opus 4.5推論強度: Thinking29.1147072.6
  50. #50XiaomiMiMo V2 Pro28.61448—
  51. #51AlibabaQwen3.6 Max28.41460—
  52. #52UpstageSolar Pro 428.21386—
  53. #53Z.aiGLM-5推論強度: Thinking27.91458—
  54. #54Moonshot AIKimi K2.6推論強度: Thinking27.0146170.5
  55. #54AlibabaQwen3.6 Plus27.0144368.9
  56. #56Z.aiGLM-5-Turbo26.6——
  57. #57GoogleGemini 3 Flash推論強度: Thinking26.31473—
  58. #58Z.aiGLM-5.1推論強度: Thinking26.11465—
  59. #59XiaomiMiMo V2.5 Pro推論強度: Thinking26.01468—
  60. #60Moonshot AIKimi K2.7 Code25.8—68.4
  61. #61xAIGrok 4.20 (Reasoning)推論強度: Thinking25.71472—
  62. #62TencentHy325.31409—
  63. #63XiaomiMiMo V2.525.21434—
  64. #63AlibabaQwen3.7 Plus25.21456—
  65. #65xAIGrok 4.3推論強度: High24.9144162.3
  66. #66OpenAIGPT-5.4 Mini推論強度: Extra High24.1144766.4
  67. #66UpstageSolar Mini 424.1——
  68. #68Z.aiGLM 5V Turbo推論強度: Thinking23.51434—
  69. #68Moonshot AIKimi K2.5推論強度: Thinking23.51450—
  70. #70OpenAIGPT-5推論強度: High23.01435—
  71. #71NVIDIANemotron 3 Ultra推論強度: Thinking22.9142667.4
  72. #72AnthropicClaude Opus 4.1推論強度: Thinking22.81450—
  73. #72MiniMaxMiniMax M2.522.81391—
  74. #72MiniMaxMiniMax M2.722.81415—
  75. #75GoogleGemini 3.5 Flash-Lite22.2145563.9
  76. #76SK TelecomA.X K221.5——
  77. #76DeepSeekDeepSeek V3.2推論強度: Thinking21.51425—
  78. #78AlibabaQwen3.5 397B A17B推論強度: None21.41442—
  79. #79AnthropicClaude Sonnet 4.5推論強度: Thinking20.71455—
  80. #79OpenAIGPT-5.4 Nano推論強度: Extra High20.7140169.6
  81. #81AnthropicClaude Opus 4推論強度: Thinking20.61426—
  82. #81OpenAIGPT-5 Mini推論強度: Medium20.61390—
  83. #83xAIGrok 4.1 Fast (Reasoning)推論強度: Thinking20.41430—
  84. #83AlibabaQwen3.5 Plus20.4——
  85. #85LG AI ResearchK-EXAONE 2.019.7——
  86. #86StepfunStep 3.7 Flash19.5——
  87. #87MeituanLongCat 2.019.1——
  88. #88AnthropicClaude Sonnet 4推論強度: Thinking18.91402—
  89. #89AlibabaQwen3.6 35B A3B推論強度: Thinking18.2——
  90. #90AnthropicClaude Haiku 4.5推論強度: Thinking16.91414—
  91. #91Ring AIRing-2.6-1T16.6——
  92. #92GoogleGemini 2.5 Pro16.11446—
  93. #93GoogleGemini 3.1 Flash Lite15.61433—
  94. #94GoogleGemma 4 31B推論強度: Thinking14.71453—
  95. #95LG AI ResearchK-EXAONE推論強度: Thinking14.4——
  96. #96BaiduERNIE 5.0 Thinking14.31446—
  97. #97xAIGrok 4.20推論強度: None14.21475—
  98. #97Mistral AIMistral Medium 3.514.21427—
  99. #99AmazonNova 2 Lite推論強度: High13.41335—
  100. #100GoogleGemini 2.5 Flash推論強度: Thinking13.11409—
  101. #101OpenAIGPT-5 Nano推論強度: High13.01338—
  102. #102NVIDIANemotron 3 Super推論強度: Thinking12.81361—
  103. #103OpenAIGPT-4.112.71313—
  104. #104OpenAIGPT OSS 120B推論強度: High11.61352—
  105. #105MeituanLongcat Flash Chat11.51437—
  106. #106xAIGrok 4.1 Fast推論強度: None11.3——
  107. #106Mistral AIMistral Small 4推論強度: Thinking11.3——
  108. #108Arcee AITrinity Large Thinking10.81367—
  109. #109GoogleGemini 2.5 Flash Lite推論強度: Thinking10.41379—
  110. #110NVIDIANemotron 3 Nano Omni10.3——
  111. #111MetaLlama 4 Maverick10.01327—
  112. #112CohereNorth Mini Code9.9——
  113. #113NVIDIANemotron 3 Nano 30B A3B推論強度: Thinking8.91314—
  114. #114MetaLlama 4 Scout8.11322—
  115. #115UpstageSolar Pro 37.8——
  116. #116PerplexitySonar7.7——
  117. #117IBMGranite 4.1 8B6.61304—
モデルの半数が26.0以下

直近60日にリリースされたAI 37個のうち13個はまだこの試験のスコアがありません · Decider V1.1 27B, GPT-6 Luna Decisions, Clef Flash ほか10個

出典: Artificial Analysis データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。