Swallow Leaderboard — Japanese (avg)
引用多め日本語高いほど良い
東京科学大学のSwallowプロジェクトが運営する日本語リーダーボードの平均スコアです。日本語の大学院レベルの科学問題(GPQA)、日本語コーディング(JHumanEval)、日本固有の知識(JamC-QA)、指示追従(M-IFEval-Ja)、多分野の推論(MMLU-ProX)、高難度の数学(PolyMath)、英日・日英のニュース翻訳の8課題を平均します。スコアは0〜100%です。高いほど良い結果です。
最高スコア71.7%GPT-5.4
測定したモデル8件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 1medium2026.03.05$1271.7%
- 2medium2025.08.07$7.8168.5%
- 32026.04.02$0.3467.5%

- 4medium2025.08.07$1.5663.1%
- 52026.03.11$0.3461.1%
- 62025.04.14$6.5057.1%
- 7medium2025.08.05$0.4056.6%
- 82025.04.05$0.3748.2%
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。