Japanese MT-Bench
日本語高いほど良い
文章作成、ロールプレイ、推論、数学、コーディング、情報抽出、理工系、人文学の8分野の日本語の質問80問に、2回続けて答える試験です。AI審査員が1〜10点で付けた点数を10で割ります。スコアは0〜100%です。高いほど良い結果です。
最高スコア98.8%Claude Opus 5
測定したモデル62件
最終更新2026.09.10
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 1adaptive-thinking-max2026.07.24$2098.8%
- 2reasoning-max2026.08.26$0.4198.8%
- 3extended-thinking2026.02.17$1298.4%
- 4reasoning-max2026.07.17$1198.4%
- 52026.07.21$398.3%

- 6adaptive-thinking-xhigh2026.05.27$2098.1%
- 7adaptive-thinking-xhigh2026.04.16$2098.0%
- 8reasoning-max2026.08.18$3.6097.9%
- 9extended-thinking2025.05.22$1297.8%
- 92026.05.19$7.1397.8%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。