Swallow Leaderboard — English (avg)

高いほど良い

Swallowリーダーボードが同じモデルを英語でも測った平均スコアです。数学コンテスト(AIME 2024–2025)、大学院レベルの科学(GPQA)、常識推論(HellaSwag)、競技プログラミング(LiveCodeBench v6)、数学(MATH-500)、指示追従(IFBench)、多分野の推論(MMLU-Pro)の7課題を平均します。日本語スコアと並べると言語による差が分かります。スコアは0〜100%です。高いほど良い結果です。

最高スコア87.4%Gemma 4 31B
測定したモデル8件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    Google2026.04.02
    87.4%
  2. 2
    OpenAI2026.03.05 · medium
    86.4%
  3. 3
    OpenAI2025.08.07 · medium
    85.4%
  4. 4
    NVIDIA2026.03.11
    82.5%
  5. 5
    OpenAI2025.08.07 · medium
    81.0%
  6. 6
    OpenAI2025.08.05 · medium
    76.8%
  7. 7
    OpenAI2025.04.14
    64.5%
  8. 8
    Meta2025.04.05
    56.3%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。