Japanese MT-Bench (Swallow)
日本語高いほど良い
Swallowリーダーボードが自ら実施した日本語MT-Benchです。文章作成、ロールプレイ、推論、数学、コーディング、情報抽出、理工系、人文学の8分野の質問に2回続けて答え、AI審査員が採点します。質問はNejumi版を使いますが採点は別に行うため、Nejumiの日本語MT-Benchとは値が異なります。スコアは0〜100%です。高いほど良い結果です。
最高スコア84.4%GPT-5.4
測定したモデル8件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 1medium2026.03.05$1284.4%
- 2medium2025.08.07$7.8184.2%
- 3medium2025.08.07$1.5683.0%
- 42026.04.02$0.3481.5%

- 52025.04.14$6.5077.1%
- 6medium2025.08.05$0.4075.7%
- 72026.03.11$0.3473.6%
- 82025.04.05$0.3762.9%
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。