Swallow Leaderboard — Japanese (avg)

引用多め日本語高いほど良い

東京科学大学のSwallowプロジェクトが運営する日本語リーダーボードの平均スコアです。日本語の大学院レベルの科学問題(GPQA)、日本語コーディング(JHumanEval)、日本固有の知識(JamC-QA)、指示追従(M-IFEval-Ja)、多分野の推論(MMLU-ProX)、高難度の数学(PolyMath)、英日・日英のニュース翻訳の8課題を平均します。スコアは0〜100%です。高いほど良い結果です。

最高スコア71.7%GPT-5.4
測定したモデル8件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    OpenAI2026.03.05 · medium
    71.7%
  2. 2
    OpenAI2025.08.07 · medium
    68.5%
  3. 3
    Google2026.04.02
    67.5%
  4. 4
    OpenAI2025.08.07 · medium
    63.1%
  5. 5
    NVIDIA2026.03.11
    61.1%
  6. 6
    OpenAI2025.04.14
    57.1%
  7. 7
    OpenAI2025.08.05 · medium
    56.6%
  8. 8
    Meta2025.04.05
    48.2%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。