AA Intelligence Index
かんたんに言うと · 複数の試験結果をひとつにまとめた総合成績
- 何を測定しますか?
- 複数の試験の点数を一つにまとめた総合成績表です。コーディング・科学・業務代行・長文理解を個別に見るのではなく「全体としてどれだけ有能か」を一つの数字で比べるときに使います。この点数が高いAIは一芸に秀でるより万能型の傾向があります。
- 誰がどのように評価しますか?
- 独立評価機関 Artificial Analysis が9つの評価(GDPval-AA・τ³-Banking・Terminal-Bench・SciCode・AA-LCR・AA-Omniscience・Humanity's Last Exam・GPQA Diamond・CritPt)を自ら実行し、加重平均します。エージェント・コーディング・一般能力・科学的推論の4領域が反映され、開発元の発表値ではなく第三者の実測です。
- スコアの読み方
- 0〜100点です。上位は数点差に密集しているため1〜2点の差は体感しにくく、順位より点数帯を見るのが安全です。英語テキスト中心の評価のため、画像・音声・日本語の実力は反映されません。構成評価と重みはバージョンごとに変わってきた(現在 v4.1.1)ので、時点の異なる点数の直接比較は避けてください。
順位
最高スコア57.6Claude Opus 5.5
測定したモデル117件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
多くの人に最も好まれる回答をするAIは?Arena Text
Gemini 4 Argon🥇
Gemini 4 Argon🥇覚えた答えではなく、初めて見る問題も解ける?LiveBench Overall
Claude Fable 5.1🥇
Claude Fable 5.1🥇
- 🥇AnthropicClaude Opus 5.5推論強度: Max57.6150482.1
- 🥈AnthropicClaude Sonnet 5.5推論強度: Max56.0147177.8
- 🥉AnthropicClaude Fable 5.1推論強度: Max53.4150183.4
- #4OpenAIGPT-6 Astra推論強度: Max52.7147782.2
- #5GoogleGemini 4 Argon推論強度: High52.61525—
- #6OpenAIGPT-6.1 Sol推論強度: Max51.8148381.1
- #7AnthropicClaude Opus 5推論強度: Max50.8149080.1
- #8AnthropicClaude Fable 5推論強度: Max49.6150483.0
- #9MetaMuse Spark 1.3推論強度: Max48.1149481.6
- #10OpenAIGPT-6 Sol推論強度: Max47.6145779.3
- #11OpenAIGPT-5.6 Sol推論強度: Max47.0148481.0
- #12xAIGrok 4.7推論強度: Extra High46.4144377.4
- #13XiaomiMiMo-V2.6-Pro46.31480—
- #14Z.aiGLM 5.3推論強度: Max44.8147976.1
- #15xAIGrok 4.6推論強度: High44.3145478.0
- #16StepfunStep-543.71454—
- #17Moonshot AIKimi K3推論強度: Max43.6148879.2
- #18AnthropicClaude Haiku 5.5推論強度: Max43.4——
- #19OpenAIGPT-5.6 Terra推論強度: Max42.1146677.9
- #20AnthropicClaude Opus 4.8推論強度: Max41.8147576.2
- #20Z.aiGLM 5.3 Flash41.8147371.6
- #22GoogleGemini 3.8 Flash推論強度: High40.9149575.8
- #23AnthropicClaude Opus 4.7推論強度: Max40.7149476.5
- #24AlibabaQwen3.8 Flash39.8—76.2
- #25GoogleGemini 3.7 Flash推論強度: Medium39.6148878.8
- #25MetaMuse Spark 1.2推論強度: Extra High39.6149478.0
- #27DeepSeekDeepSeek V4.1 Flash推論強度: Max39.5147481.1
- #28OpenAIGPT-5.4推論強度: Extra High39.0147578.0
- #29xAIGrok 4.5推論強度: High38.8146675.8
- #30OpenAIGPT-5.5推論強度: Extra High38.4147780.2
- #30Mistral AIMistral Large 438.4——
- #32AnthropicClaude Sonnet 5推論強度: Max38.2146276.0
- #33OpenAIGPT-6 Luna推論強度: Max38.1144372.0
- #34XiaomiMiMo-V2.6-Flash37.91452—
- #35OpenAIGPT-5.6 Luna推論強度: Max37.3145373.6
- #36DeepSeekDeepSeek V4 Pro推論強度: Max36.0145871.6
- #37DeepSeekDeepSeek V4 Flash推論強度: Max34.3143665.5
- #38GoogleGemini 3.6 Flash推論強度: High34.0148373.6
- #39Z.aiGLM 5.2推論強度: Max33.7147673.2
- #39MetaMuse Spark 1.1推論強度: Extra High33.7149175.3
- #41GoogleGemini 3.5 Flash推論強度: Medium33.6147674.6
- #41Motif TechnologiesMotif 333.6——
- #43AnthropicClaude Opus 4.6推論強度: Max31.9149774.5
- #44MetaMuse Spark31.31489—
- #45AnthropicClaude Sonnet 4.6推論強度: Max30.1147273.0
- #46GoogleGemini 3.1 Pro29.7148777.0
- #47AlibabaQwen3.7 Max29.5147573.1
- #48MiniMaxMiniMax M329.2144067.3
- #49AnthropicClaude Opus 4.5推論強度: Thinking29.1147072.6
- #50XiaomiMiMo V2 Pro28.61448—
- #51AlibabaQwen3.6 Max28.41460—
- #52UpstageSolar Pro 428.21386—
- #53Z.aiGLM-5推論強度: Thinking27.91458—
- #54Moonshot AIKimi K2.6推論強度: Thinking27.0146170.5
- #54AlibabaQwen3.6 Plus27.0144368.9
- #56Z.aiGLM-5-Turbo26.6——
- #57GoogleGemini 3 Flash推論強度: Thinking26.31473—
- #58Z.aiGLM-5.1推論強度: Thinking26.11465—
- #59XiaomiMiMo V2.5 Pro推論強度: Thinking26.01468—
- #60Moonshot AIKimi K2.7 Code25.8—68.4
- #61xAIGrok 4.20 (Reasoning)推論強度: Thinking25.71472—
- #62TencentHy325.31409—
- #63XiaomiMiMo V2.525.21434—
- #63AlibabaQwen3.7 Plus25.21456—
- #65xAIGrok 4.3推論強度: High24.9144162.3
- #66OpenAIGPT-5.4 Mini推論強度: Extra High24.1144766.4
- #66UpstageSolar Mini 424.1——
- #68Z.aiGLM 5V Turbo推論強度: Thinking23.51434—
- #68Moonshot AIKimi K2.5推論強度: Thinking23.51450—
- #70OpenAIGPT-5推論強度: High23.01435—
- #71NVIDIANemotron 3 Ultra推論強度: Thinking22.9142667.4
- #72AnthropicClaude Opus 4.1推論強度: Thinking22.81450—
- #72MiniMaxMiniMax M2.522.81391—
- #72MiniMaxMiniMax M2.722.81415—
- #75GoogleGemini 3.5 Flash-Lite22.2145563.9
- #76SK TelecomA.X K221.5——
- #76DeepSeekDeepSeek V3.2推論強度: Thinking21.51425—
- #78AlibabaQwen3.5 397B A17B推論強度: None21.41442—
- #79AnthropicClaude Sonnet 4.5推論強度: Thinking20.71455—
- #79OpenAIGPT-5.4 Nano推論強度: Extra High20.7140169.6
- #81AnthropicClaude Opus 4推論強度: Thinking20.61426—
- #81OpenAIGPT-5 Mini推論強度: Medium20.61390—
- #83xAIGrok 4.1 Fast (Reasoning)推論強度: Thinking20.41430—
- #83AlibabaQwen3.5 Plus20.4——
- #85LG AI ResearchK-EXAONE 2.019.7——
- #86StepfunStep 3.7 Flash19.5——
- #87MeituanLongCat 2.019.1——
- #88AnthropicClaude Sonnet 4推論強度: Thinking18.91402—
- #89AlibabaQwen3.6 35B A3B推論強度: Thinking18.2——
- #90AnthropicClaude Haiku 4.5推論強度: Thinking16.91414—
- #91Ring AIRing-2.6-1T16.6——
- #92GoogleGemini 2.5 Pro16.11446—
- #93GoogleGemini 3.1 Flash Lite15.61433—
- #94GoogleGemma 4 31B推論強度: Thinking14.71453—
- #95LG AI ResearchK-EXAONE推論強度: Thinking14.4——
- #96BaiduERNIE 5.0 Thinking14.31446—
- #97xAIGrok 4.20推論強度: None14.21475—
- #97Mistral AIMistral Medium 3.514.21427—
- #99AmazonNova 2 Lite推論強度: High13.41335—
- #100GoogleGemini 2.5 Flash推論強度: Thinking13.11409—
- #101OpenAIGPT-5 Nano推論強度: High13.01338—
- #102NVIDIANemotron 3 Super推論強度: Thinking12.81361—
- #103OpenAIGPT-4.112.71313—
- #104OpenAIGPT OSS 120B推論強度: High11.61352—
- #105MeituanLongcat Flash Chat11.51437—
- #106xAIGrok 4.1 Fast推論強度: None11.3——
- #106Mistral AIMistral Small 4推論強度: Thinking11.3——
- #108Arcee AITrinity Large Thinking10.81367—
- #109GoogleGemini 2.5 Flash Lite推論強度: Thinking10.41379—
- #110NVIDIANemotron 3 Nano Omni10.3——
- #111MetaLlama 4 Maverick10.01327—
- #112CohereNorth Mini Code9.9——
- #113NVIDIANemotron 3 Nano 30B A3B推論強度: Thinking8.91314—
- #114MetaLlama 4 Scout8.11322—
- #115UpstageSolar Pro 37.8——
- #116PerplexitySonar7.7——
- #117IBMGranite 4.1 8B6.61304—
モデルの半数が26.0以下
直近60日にリリースされたAI 37個のうち13個はまだこの試験のスコアがありません · Decider V1.1 27B, GPT-6 Luna Decisions, Clef Flash ほか10個
出典: Artificial Analysis データの出典・掲載停止のご依頼このスコアを読むときに知っておくこと
- あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
- 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。