Swallow Leaderboard — English (avg)
高いほど良い
Swallowリーダーボードが同じモデルを英語でも測った平均スコアです。数学コンテスト(AIME 2024–2025)、大学院レベルの科学(GPQA)、常識推論(HellaSwag)、競技プログラミング(LiveCodeBench v6)、数学(MATH-500)、指示追従(IFBench)、多分野の推論(MMLU-Pro)の7課題を平均します。日本語スコアと並べると言語による差が分かります。スコアは0〜100%です。高いほど良い結果です。
最高スコア87.4%Gemma 4 31B
測定したモデル8件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 12026.04.02$0.3487.4%

- 2medium2026.03.05$1286.4%
- 3medium2025.08.07$7.8185.4%
- 42026.03.11$0.3482.5%
- 5medium2025.08.07$1.5681.0%
- 6medium2025.08.05$0.4076.8%
- 72025.04.14$6.5064.5%
- 82025.04.05$0.3756.3%
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。