Q1 複数の試験を合わせた総合力はどのくらい? AA Intelligence Index · 下位26%88位 Q1 複数の試験を合わせた総合力はどのくらい? AA Intelligence Index · 下位26%88位 Q2 多くの人に最も好まれる回答をするAIは? Arena Text · 下位17%82位 Q3 幅広い専門分野の知識を持っている? MMLU-Pro · 上位40%11位
Q1 下位26%88位 / 117 18.9 推論強度: Thinking Q2 1402 Q3 84.2% 強度別 None 16.6 Thinking 18.9
AA Intelligence Indexについて AA Intelligence Indexについて詳しく
Q1 顧客対応の仕事をルールどおりに処理できる? τ³-Banking · 下位42%47位 Q1 顧客対応の仕事をルールどおりに処理できる? τ³-Banking · 下位42%47位 Q2 顧客対応の仕事をルールどおりに処理できる? TAU2 · 下位22%63位 Q3 人が何時間もかかる長い仕事もこなせる? METR Time Horizon · 下位20%9位 Q1 下位42%47位 / 79 16.7% 推論強度: Thinking Q2 64.6% Q3 1時間15分 Q4 33.1% Q5 43.9% τ³-Bankingについて τ³-Bankingについて詳しく
Q1 複数の長い文書に散らばった情報を、まとめて答えられる? Long Context Reasoning · 下位30%83位 Q1 複数の長い文書に散らばった情報を、まとめて答えられる? Long Context Reasoning · 下位30%83位 Q2 多くの人に最も好まれるビジネスの回答をするAIは? Arena Business, Management & Finance · 下位13%86位 Q3 数百ページの契約書を読んで、必要な内容を正確に見つけて答えられる? CorpFin v2 · 下位34%43位 Q1 下位30%83位 / 116 70.3% 推論強度: Thinking Q2 1381 Q3 61.2% Q4 35.0% Q5 46.9% Q6 44.5% 強度別 None 44.0% Thinking 70.3%
Long Context Reasoningについて Long Context Reasoningについて詳しく
Q1 何段階にもわたるWeb調査をこなせる? Deep Research Bench · 下位36%12位 Q1 何段階にもわたるWeb調査をこなせる? Deep Research Bench · 下位36%12位 Q2 要約するとき、ない内容をでっち上げない? Vectara Hallucination Rate · 下位48%20位 Q3 要約するとき、ない内容をでっち上げない? Vectara Factual Consistency · 下位48%20位 Q4 これから起きることを、どれだけ正確に予測できる? ForecastBench Brier Index · 下位34%19位
Q1 下位36%12位 / 17 46.6% 推論強度: Budget 2K Q2 10.3% Q3 89.7% Q4 58.9 Deep Research Benchについて Deep Research Benchについて詳しく
Q1 多くの人に最も好まれるコーディングの回答をするAIは? Arena Coding · 下位25%74位 Q1 多くの人に最も好まれるコーディングの回答をするAIは? Arena Coding · 下位25%74位 Q2 正解のない最適化問題で、よりよい答えを見つけられる? ALE-Bench · 下位22%59位 Q3 コンピューターを自分で操作して、開発の仕事をひとりで終えられる? Terminal-Bench 2.1 · 下位21%65位 Q1 下位25%74位 / 97 1474 Q2 655 Q3 36.3% Q4 31.1% Q5 37.6 Q6 65.5% Q7 40.0% Q8 46.1% Q9 4.9% Q10 61.3% Q11 1445 Arena Codingについて Arena Codingについて詳しく
Q1 多くの人に最も好まれる文章・文学の回答をするAIは? Arena Writing, Literature & Language · 下位22%77位 Q1 多くの人に最も好まれる文章・文学の回答をするAIは? Arena Writing, Literature & Language · 下位22%77位 Q2 会話が長くなったとき、多くの人に最も好まれるAIは? Arena Multi-turn · 下位22%77位 Q3 形式や長さなどの細かい条件を、漏れなく守れる? IFBench · 下位24%63位 Q1 下位22%77位 / 97 1398 Q2 1421 Q3 54.7% Q4 1396 Q5 1416 Q6 8.14 / 10 Q7 72.4% Q8 1389 Arena Writing, Literature & Languageについて Arena Writing, Literature & Languageについて詳しく
Q1 さまざまな分野の専門家でも難しい問題を解ける? Humanity's Last Exam · 下位12%104位 Q1 さまざまな分野の専門家でも難しい問題を解ける? Humanity's Last Exam · 下位12%104位 Q2 研究レベルの物理の問題を解ける? CritPt · 下位12%70位 Q3 多くの人に最も好まれる数学の回答をするAIは? Arena Math · 下位15%81位 Q1 下位12%104位 / 117 10.7% 推論強度: Thinking Q2 0.3% Q3 1404 Q4 77.7% Q5 71.1% Q6 74.3 Q7 74.3% Q8 1416 Q9 1413 Q10 99.1% Q11 84.4% Q12 4.1% Q13 0.0% Q14 40.0% Q15 5.9% Q16 45.5% Q17 3.1% Q18 77.1% Q19 29.0 強度別 None 4.3% Thinking 10.7%
Humanity's Last Examについて Humanity's Last Examについて詳しく
Q1 多くの人に最も好まれる写真・図表についての回答をするAIは? Arena Vision · 下位7%55位 Q1 多くの人に最も好まれる写真・図表についての回答をするAIは? Arena Vision · 下位7%55位 Q2 絵だけを見て、物がどう動くかを予測できる? VPCT · 下位20%9位 Q3 写真1枚で、どこで撮ったかを当てられる? GeoBench · 下位15%7位 Q4 いろいろな方向から撮った写真で、空間を把握できる? MindCube ·
Q1 下位7%55位 / 58 1191 Q2 34.0% Q3 37.0% Q4 44.8% Arena Visionについて Arena Visionについて詳しく
Q1 韓国語で聞いたとき、多くの人に最も好まれるAIは? Arena Korean · 下位16%68位 Q1 韓国語で聞いたとき、多くの人に最も好まれるAIは? Arena Korean · 下位16%68位 Q2 日本語で聞いたとき、多くの人に最も好まれるAIは? Arena Japanese · 下位16%64位 Q3 難しい質問で、多くの人に最も好まれるAIは? Arena Hard Prompts · 下位18%81位 Q1 下位16%68位 / 79 1338 Q2 1342 Q3 1432 Q4 1433 Q5 1416 Q6 1406 Q7 35.0% Q8 17.9% Q9 56.1% Q10 28.6% Q11 20.4% Q12 35.0% Q13 90.6% Q14 90.0% Q15 91.3% Q16 97.8% Q17 81.5% Q18 28.3% Q19 79.2% Q20 89.3% Q21 74.6% Q22 6.0% Q23 24.6% Arena Koreanについて Arena Koreanについて詳しく