LiveBench Data Analysis

かんたんに言うと · 表やデータを読んで分析する問題をどれだけ正解するか

何を測定しますか?
表データを扱う実務力です。列の種類を当てる、表を別形式(JSON・CSV・HTML)に変換する、2つの表を結合する列を見つけるなど、データアナリストが毎日行う仕事です。
誰がどのように評価しますか?
Abacus.AI・ニューヨーク大学などの研究陣が作った LiveBench は、最近の大会問題・論文・ニュースから毎月新しい問題を出し、AIが学習中に問題を見た可能性(汚染)を減らします。答えが定まった問題だけを出してプログラムが自動採点し、別のAIは採点しません。この表は livebench.ai が公開した最新の月次結果表を取得しますが、最新の表にないAIは最後に掲載されたスコアを順位を付けずに表の下に別に表示します。 データ分析科目は Kaggle・Socrata の実際の公開データで作った列型判別・表変換・表結合の課題で構成されます。
スコアの読み方
0〜100点です。問題が難しく設計されており最上位AIでも70点を超えるのは難しく、毎月問題が変わるため時点の異なる点数の直接比較は避けてください。 統計の解釈や可視化の力は含まれません。

最終更新: 2026-06-25

順位

最高スコア83.0GPT-6 Astra
測定したモデル50件
最終更新2026.06.25
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇OpenAIGPT-6 Astra80.7%83.01473
  2. 🥈OpenAIGPT-6.1 Sol84.0%82.21475
  3. 🥉OpenAIGPT-5.584.3%81.61485
  4. #4OpenAIGPT-6 Sol83.7%81.21446
  5. #5AnthropicClaude Fable 582.3%80.51502
  6. #6AnthropicClaude Fable 5.185.3%80.31484
  7. #7OpenAIGPT-5.6 Sol84.0%79.81485
  8. #8AnthropicClaude Opus 5.584.7%79.81489
  9. #9MetaMuse Spark 1.383.0%79.61505
  10. #10OpenAIGPT-5.6 Terra83.0%79.31467
  11. #10OpenAIGPT-5.482.0%79.31482
  12. #12DeepSeekDeepSeek V4.1 Flash84.0%79.31479
  13. #13Moonshot AIKimi K388.7%78.71487
  14. #14AnthropicClaude Sonnet 5.582.7%78.61464
  15. #15GoogleGemini 3.1 Pro82.0%78.51477
  16. #16AnthropicClaude Opus 4.778.7%78.31496
  17. #17OpenAIGPT-5.6 Luna83.7%78.01463
  18. #18AnthropicClaude Sonnet 4.680.0%78.01482
  19. #19xAIGrok 4.780.0%76.91433
  20. #20MetaMuse Spark 1.279.0%76.51514
  21. #21Z.aiGLM 5.3 Flash80.0%76.41467
  22. #22MiniMaxMiniMax M383.0%76.21448
  23. #23AnthropicClaude Opus 582.0%74.51484
  24. #24DeepSeekDeepSeek V4 Pro80.3%74.51460
  25. #25AnthropicClaude Opus 4.577.3%74.41472
  26. #26AlibabaQwen3.8 Flash79.7%74.2—
  27. #27xAIGrok 4.681.0%73.91447
  28. #28Z.aiGLM 5.278.3%73.71466
  29. #29OpenAIGPT-6 Luna83.3%73.41447
  30. #30xAIGrok 4.579.3%73.01465
  31. #31MetaMuse Spark 1.177.7%72.51493
  32. #32AlibabaQwen3.7 Max79.0%71.81458
  33. #33AnthropicClaude Sonnet 582.0%71.71465
  34. #34OpenAIGPT-5.4 Mini77.0%70.81460
  35. #34xAIGrok Build 0.1—70.8—
  36. #36Z.aiGLM 5.379.7%70.21475
  37. #37AlibabaQwen3.6 Plus78.3%69.91446
  38. #38AnthropicClaude Opus 4.678.0%69.91500
  39. #39DeepSeekDeepSeek V4 Flash79.7%68.01439
  40. #40GoogleGemini 3.7 Flash83.0%68.01483
  41. #41OpenAIGPT-5.4 Nano76.7%67.61405
  42. #42AnthropicClaude Opus 4.877.7%66.01487
  43. #43Moonshot AIKimi K2.681.0%65.11455
  44. #44GoogleGemini 3.5 Flash74.3%64.91462
  45. #45GoogleGemini 3.6 Flash80.0%63.01472
  46. #46Moonshot AIKimi K2.7 Code79.3%62.7—
  47. #47xAIGrok 4.375.0%55.81439
  48. #48NVIDIANemotron 3 Ultra79.3%54.51418
  49. #49GoogleGemini 3.8 Flash84.0%54.01481
  50. #50GoogleGemini 3.5 Flash-Lite76.0%53.31452
モデルの半数が74.3以下最終更新 2026-06-25

以前の版のスコア

最新ランキング(2026.06.25)に反映されていないスコアです。出典から外れたか、まだ更新されていないモデルで、最後に取得したスコアを参考として表示し、順位は付けません。

  1. —
    Z.ai2026.02.11
    67.9
  2. —
    Z.ai2026.04.07
    63.2
  3. —62.9
  4. —
    Moonshot AI2026.01.27
    61.4
  5. —
    Alibaba2026.04.27
    58.8
  6. —
    Google2026.04.02
    58.8
  7. —
    OpenAI2025.08.07
    57.0
  8. —
    MiniMax2026.03.18
    56.3
  9. —
    Google2026.03.03
    54.9
  10. —
    Anthropic2025.05.22
    54.6
  11. —
    Z.ai2026.04.01
    54.1
  12. —52.2
  13. —
    Google2025.06.17
    51.6
  14. —
    OpenAI2025.08.07
    49.6
  15. —
    MiniMax2026.02.12
    49.6
  16. —
    Xiaomi2026.03.18
    49.2
  17. —
    Anthropic2025.08.05
    49.0
  18. —
    Google2025.12.17
    48.3
  19. —
    Google2025.06.17
    47.3
  20. —
    Google2025.09.25
    47.0
  21. —
    Anthropic2025.09.29
    47.0
  22. —
    Anthropic2025.10.15
    45.1
  23. —
    DeepSeek2025.12.01
    45.0
  24. —
    OpenAI2025.08.07
    44.3
  25. —
    xAI2026.03.09
    43.5
  26. —
    xAI2025.11.19
    40.6
  27. —
    Arcee AI2026.04.01
    40.3
  28. —
    OpenAI2025.08.05
    38.8
  29. —
    NVIDIA2026.03.11
    21.2

直近60日にリリースされたAI 37個のうち21個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか18個

出典: LiveBench データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。