LiveBench Data Analysis
かんたんに言うと · 表やデータを読んで分析する問題をどれだけ正解するか
- 何を測定しますか?
- 表データを扱う実務力です。列の種類を当てる、表を別形式(JSON・CSV・HTML)に変換する、2つの表を結合する列を見つけるなど、データアナリストが毎日行う仕事です。
- 誰がどのように評価しますか?
- Abacus.AI・ニューヨーク大学などの研究陣が作った LiveBench は、最近の大会問題・論文・ニュースから毎月新しい問題を出し、AIが学習中に問題を見た可能性(汚染)を減らします。答えが定まった問題だけを出してプログラムが自動採点し、別のAIは採点しません。この表は livebench.ai が公開した最新の月次結果表を取得しますが、最新の表にないAIは最後に掲載されたスコアを順位を付けずに表の下に別に表示します。 データ分析科目は Kaggle・Socrata の実際の公開データで作った列型判別・表変換・表結合の課題で構成されます。
- スコアの読み方
- 0〜100点です。問題が難しく設計されており最上位AIでも70点を超えるのは難しく、毎月問題が変わるため時点の異なる点数の直接比較は避けてください。 統計の解釈や可視化の力は含まれません。
最終更新: 2026-06-25
順位
最高スコア83.0GPT-6 Astra
測定したモデル50件
最終更新2026.06.25
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
複数の長い文書に散らばった情報を、まとめて答えられる?Long Context Reasoning
Kimi K3🥇
Kimi K3🥇多くの人に最も好まれるビジネスの回答をするAIは?Arena Business, Management & Finance
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇OpenAIGPT-6 Astra80.7%83.01473
- 🥈OpenAIGPT-6.1 Sol84.0%82.21475
- 🥉OpenAIGPT-5.584.3%81.61485
- #4OpenAIGPT-6 Sol83.7%81.21446
- #5AnthropicClaude Fable 582.3%80.51502
- #6AnthropicClaude Fable 5.185.3%80.31484
- #7OpenAIGPT-5.6 Sol84.0%79.81485
- #8AnthropicClaude Opus 5.584.7%79.81489
- #9MetaMuse Spark 1.383.0%79.61505
- #10OpenAIGPT-5.6 Terra83.0%79.31467
- #10OpenAIGPT-5.482.0%79.31482
- #12DeepSeekDeepSeek V4.1 Flash84.0%79.31479
- #13Moonshot AIKimi K388.7%78.71487
- #14AnthropicClaude Sonnet 5.582.7%78.61464
- #15GoogleGemini 3.1 Pro82.0%78.51477
- #16AnthropicClaude Opus 4.778.7%78.31496
- #17OpenAIGPT-5.6 Luna83.7%78.01463
- #18AnthropicClaude Sonnet 4.680.0%78.01482
- #19xAIGrok 4.780.0%76.91433
- #20MetaMuse Spark 1.279.0%76.51514
- #21Z.aiGLM 5.3 Flash80.0%76.41467
- #22MiniMaxMiniMax M383.0%76.21448
- #23AnthropicClaude Opus 582.0%74.51484
- #24DeepSeekDeepSeek V4 Pro80.3%74.51460
- #25AnthropicClaude Opus 4.577.3%74.41472
- #26AlibabaQwen3.8 Flash79.7%74.2—
- #27xAIGrok 4.681.0%73.91447
- #28Z.aiGLM 5.278.3%73.71466
- #29OpenAIGPT-6 Luna83.3%73.41447
- #30xAIGrok 4.579.3%73.01465
- #31MetaMuse Spark 1.177.7%72.51493
- #32AlibabaQwen3.7 Max79.0%71.81458
- #33AnthropicClaude Sonnet 582.0%71.71465
- #34OpenAIGPT-5.4 Mini77.0%70.81460
- #34xAIGrok Build 0.1—70.8—
- #36Z.aiGLM 5.379.7%70.21475
- #37AlibabaQwen3.6 Plus78.3%69.91446
- #38AnthropicClaude Opus 4.678.0%69.91500
- #39DeepSeekDeepSeek V4 Flash79.7%68.01439
- #40GoogleGemini 3.7 Flash83.0%68.01483
- #41OpenAIGPT-5.4 Nano76.7%67.61405
- #42AnthropicClaude Opus 4.877.7%66.01487
- #43Moonshot AIKimi K2.681.0%65.11455
- #44GoogleGemini 3.5 Flash74.3%64.91462
- #45GoogleGemini 3.6 Flash80.0%63.01472
- #46Moonshot AIKimi K2.7 Code79.3%62.7—
- #47xAIGrok 4.375.0%55.81439
- #48NVIDIANemotron 3 Ultra79.3%54.51418
- #49GoogleGemini 3.8 Flash84.0%54.01481
- #50GoogleGemini 3.5 Flash-Lite76.0%53.31452
モデルの半数が74.3以下最終更新 2026-06-25
以前の版のスコア
最新ランキング(2026.06.25)に反映されていないスコアです。出典から外れたか、まだ更新されていないモデルで、最後に取得したスコアを参考として表示し、順位は付けません。
- —2026.02.11$2.4067.9
- —2026.04.07$3.6563.2
- —2026.03.31$2.1962.9
- —2026.01.27$2.2761.4
- —2026.04.27$0.8958.8
- —2026.04.02$0.3458.8

- —2025.08.07$7.8157.0
- —2026.03.18$0.9756.3
- —2026.03.03$1.1954.9

- —2025.05.22$1254.6
- —2026.04.01$3.3054.1
- —2025.09.15$0.4252.2
- —2025.06.17$7.8151.6

- —2025.08.07$1.5649.6
- —2026.02.12$0.9749.6
- —2026.03.18$2.5049.2

- —2025.08.05$6049.0
- —2025.12.17$2.3848.3

- —2025.06.17$1.9547.3

- —2025.09.25$0.3347.0

- —2025.09.29$1247.0
- —2025.10.15$445.1
- —2025.12.01$0.8345.0
- —2025.08.07$0.3144.3
- —2026.03.09$2.1943.5
- —2025.11.19$0.4240.6
- —2026.04.01$0.6640.3
- —2025.08.05$0.4038.8
- —2026.03.11$0.3421.2
直近60日にリリースされたAI 37個のうち21個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか18個
出典: LiveBench データの出典・掲載停止のご依頼このスコアを読むときに知っておくこと
- あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
- 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。