LiveBench Reasoning

かんたんに言うと · 毎月新しく出すパズル・論理問題をどれだけ正解するか

何を測定しますか?
論理パズルを解く力です。複数人の真偽の発言から結論を導く、条件が絡む配置パズル、図形の空間関係の推論など、知識より考え抜く力が必要です。
誰がどのように評価しますか?
Abacus.AI・ニューヨーク大学などの研究陣が作った LiveBench は、最近の大会問題・論文・ニュースから毎月新しい問題を出し、AIが学習中に問題を見た可能性(汚染)を減らします。答えが定まった問題だけを出してプログラムが自動採点し、別のAIは採点しません。この表は livebench.ai が公開した最新の月次結果表を取得しますが、最新の表にないAIは最後に掲載されたスコアを順位を付けずに表の下に別に表示します。 推論科目は真偽推論(Web of Lies)、シマウマパズル、空間推論の課題で構成されます。
スコアの読み方
0〜100点です。問題が難しく設計されており最上位AIでも70点を超えるのは難しく、毎月問題が変わるため時点の異なる点数の直接比較は避けてください。 常識や知識ではなく純粋な論理能力だけを測ります。

最終更新: 2026-06-25

順位

最高スコア92.7GPT-6 Astra
測定したモデル50件
最終更新2026.06.25
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    OpenAI2026.09.04
    92.7
  2. 2
    Anthropic2026.09.01
    91.7
  3. 3
    OpenAI2026.07.09
    91.7
  4. 4
    OpenAI2026.09.29
    91.6
  5. 5
    Anthropic2026.07.24
    91.2
  6. 6
    Moonshot AI2026.07.17
    90.7
  7. 7
    Anthropic2026.09.22
    90.7
  8. 8
    OpenAI2026.07.09
    90.6
  9. 9
    xAI2026.08.12
    90.5
  10. 10
    Meta2026.08.05
    90.0

直近60日にリリースされたAI 37個のうち21個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか18個

出典: LiveBench データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。