LiveBench Language

かんたんに言うと · 単語パズルや誤字修正のような言語問題をどれだけ正解するか

何を測定しますか?
言語をどれだけ正確に扱うかです。単語グループパズル(Connections)、論文要旨の誤字探し、シャッフルされた映画のあらすじの並べ替えなど、読解と言語感覚が必要です。
誰がどのように評価しますか?
Abacus.AI・ニューヨーク大学などの研究陣が作った LiveBench は、最近の大会問題・論文・ニュースから毎月新しい問題を出し、AIが学習中に問題を見た可能性(汚染)を減らします。答えが定まった問題だけを出してプログラムが自動採点し、別のAIは採点しません。この表は livebench.ai が公開した最新の月次結果表を取得しますが、最新の表にないAIは最後に掲載されたスコアを順位を付けずに表の下に別に表示します。 言語科目は Connections パズル、arXiv 要旨の誤字除去、最新映画のあらすじ並べ替えの課題で構成されます。
スコアの読み方
0〜100点です。問題が難しく設計されており最上位AIでも70点を超えるのは難しく、毎月問題が変わるため時点の異なる点数の直接比較は避けてください。 英語基準のため日本語の実力とは直接関係ありません。

最終更新: 2026-06-25

順位

最高スコア90.7Claude Fable 5
測定したモデル50件
最終更新2026.06.25
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇AnthropicClaude Fable 590.7
  2. 🥈AnthropicClaude Fable 5.189.5
  3. 🥉OpenAIGPT-6 Astra89.4
  4. #4AnthropicClaude Opus 588.7
  5. #5OpenAIGPT-6.1 Sol88.6
  6. #6GoogleGemini 3.8 Flash87.8
  7. #7OpenAIGPT-5.6 Sol87.7
  8. #8OpenAIGPT-5.587.4
  9. #9Moonshot AIKimi K385.5
  10. #10AnthropicClaude Opus 5.585.5
  11. #11GoogleGemini 3.7 Flash85.5
  12. #12GoogleGemini 3.1 Pro85.4
  13. #13OpenAIGPT-6 Sol85.3
  14. #14GoogleGemini 3.5 Flash84.6
  15. #15GoogleGemini 3.6 Flash83.9
  16. #16xAIGrok 4.683.7
  17. #17AnthropicClaude Sonnet 5.583.4
  18. #18AnthropicClaude Opus 4.683.3
  19. #19OpenAIGPT-5.6 Terra82.9
  20. #20xAIGrok 4.582.8
  21. #21MetaMuse Spark 1.382.8
  22. #22OpenAIGPT-5.482.6
  23. #23AnthropicClaude Opus 4.581.3
  24. #24DeepSeekDeepSeek V4.1 Flash81.2
  25. #25xAIGrok 4.780.1
  26. #26Z.aiGLM 5.379.9
  27. #27AlibabaQwen3.7 Max79.7
  28. #28AnthropicClaude Opus 4.879.7
  29. #29MetaMuse Spark 1.278.6
  30. #30DeepSeekDeepSeek V4 Pro78.1
  31. #31AnthropicClaude Opus 4.777.9
  32. #31Moonshot AIKimi K2.7 Code77.9
  33. #33Z.aiGLM 5.3 Flash77.3
  34. #34MiniMaxMiniMax M376.8
  35. #35Z.aiGLM 5.276.2
  36. #36AnthropicClaude Sonnet 4.676.1
  37. #37Moonshot AIKimi K2.675.1
  38. #38AlibabaQwen3.6 Plus75.0
  39. #39AnthropicClaude Sonnet 575.0
  40. #40AlibabaQwen3.8 Flash74.6
  41. #41MetaMuse Spark 1.174.3
  42. #42OpenAIGPT-6 Luna73.8
  43. #43xAIGrok 4.373.6
  44. #44OpenAIGPT-5.6 Luna72.6
  45. #45xAIGrok Build 0.172.5
  46. #46GoogleGemini 3.5 Flash-Lite71.8
  47. #47OpenAIGPT-5.4 Mini71.0
  48. #48NVIDIANemotron 3 Ultra70.8
  49. #49DeepSeekDeepSeek V4 Flash70.1
  50. #50OpenAIGPT-5.4 Nano62.5
モデルの半数が80.0以下最終更新 2026-06-25

以前の版のスコア

最新ランキング(2026.06.25)に反映されていないスコアです。出典から外れたか、まだ更新されていないモデルで、最後に取得したスコアを参考として表示し、順位は付けません。

  1. —
    OpenAI2025.08.07
    80.7
  2. —
    Google2025.12.17
    78.7
  3. —77.7
  4. —
    Moonshot AI2026.01.27
    77.7
  5. —
    Z.ai2026.02.11
    77.5
  6. —
    Anthropic2025.09.29
    76.0
  7. —
    Google2025.06.17
    75.5
  8. —74.3
  9. —
    Google2026.03.03
    73.2
  10. —
    Anthropic2025.05.22
    72.9
  11. —
    Anthropic2025.08.05
    72.8
  12. —
    Z.ai2026.04.07
    71.8
  13. —
    Google2026.04.02
    71.3
  14. —
    OpenAI2025.08.07
    69.2
  15. —
    Xiaomi2026.03.18
    69.1
  16. —
    MiniMax2026.03.18
    66.8
  17. —
    DeepSeek2025.12.01
    64.2
  18. —
    Alibaba2026.04.27
    63.1
  19. —
    Z.ai2026.04.01
    62.3
  20. —
    Google2025.06.17
    62.3
  21. —
    Anthropic2025.10.15
    57.0
  22. —
    MiniMax2026.02.12
    55.1
  23. —
    Google2025.09.25
    52.0
  24. —
    xAI2025.11.19
    50.0
  25. —
    OpenAI2025.08.05
    48.6
  26. —
    OpenAI2025.08.07
    47.7
  27. —
    Arcee AI2026.04.01
    42.1
  28. —
    xAI2026.03.09
    42.0
  29. —
    NVIDIA2026.03.11
    30.0

直近60日にリリースされたAI 37個のうち21個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか18個

出典: LiveBench データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。