Japanese MT-Bench

日本語高いほど良い

文章作成、ロールプレイ、推論、数学、コーディング、情報抽出、理工系、人文学の8分野の日本語の質問80問に、2回続けて答える試験です。AI審査員が1〜10点で付けた点数を10で割ります。スコアは0〜100%です。高いほど良い結果です。

最高スコア98.8%Claude Opus 5
測定したモデル62件
最終更新2026.09.10
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    Anthropic2026.07.24 · adaptive-thinking-max
    98.8%
  2. 2
    Z.ai2026.08.26 · reasoning-max
    98.8%
  3. 3
    Anthropic2026.02.17 · extended-thinking
    98.4%
  4. 4
    Moonshot AI2026.07.17 · reasoning-max
    98.4%
  5. 5
    Google2026.07.21
    98.3%
  6. 6
    Anthropic2026.05.27 · adaptive-thinking-xhigh
    98.1%
  7. 7
    Anthropic2026.04.16 · adaptive-thinking-xhigh
    98.0%
  8. 8
    Z.ai2026.08.18 · reasoning-max
    97.9%
  9. 9
    Anthropic2025.05.22 · extended-thinking
    97.8%
  10. 9
    Google2026.05.19
    97.8%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。