Swallow Leaderboard — English (avg)

높을수록 좋음

Swallow 순위표가 같은 모델을 영어로도 잰 평균 점수입니다. 수학 경시(AIME 2024–2025), 대학원 수준 과학(GPQA), 상식 추론(HellaSwag), 경쟁 프로그래밍(LiveCodeBench v6), 수학(MATH-500), 지시 따르기(IFBench), 여러 분야 추론(MMLU-Pro) 7개 과제를 평균합니다. 일본어 점수와 나란히 보면 언어에 따른 차이를 알 수 있습니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수87.4%Gemma 4 31B
측정한 모델8개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    Google2026.04.02
    87.4%
  2. 2
    OpenAI2026.03.05 · medium
    86.4%
  3. 3
    OpenAI2025.08.07 · medium
    85.4%
  4. 4
    NVIDIA2026.03.11
    82.5%
  5. 5
    OpenAI2025.08.07 · medium
    81.0%
  6. 6
    OpenAI2025.08.05 · medium
    76.8%
  7. 7
    OpenAI2025.04.14
    64.5%
  8. 8
    Meta2025.04.05
    56.3%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.