Japanese MT-Bench (Swallow)

日本語高いほど良い

Swallowリーダーボードが自ら実施した日本語MT-Benchです。文章作成、ロールプレイ、推論、数学、コーディング、情報抽出、理工系、人文学の8分野の質問に2回続けて答え、AI審査員が採点します。質問はNejumi版を使いますが採点は別に行うため、Nejumiの日本語MT-Benchとは値が異なります。スコアは0〜100%です。高いほど良い結果です。

最高スコア84.4%GPT-5.4
測定したモデル8件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    OpenAI2026.03.05 · medium
    84.4%
  2. 2
    OpenAI2025.08.07 · medium
    84.2%
  3. 3
    OpenAI2025.08.07 · medium
    83.0%
  4. 4
    Google2026.04.02
    81.5%
  5. 5
    OpenAI2025.04.14
    77.1%
  6. 6
    OpenAI2025.08.05 · medium
    75.7%
  7. 7
    NVIDIA2026.03.11
    73.6%
  8. 8
    Meta2025.04.05
    62.9%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。