Swallow Leaderboard — English (avg)
높을수록 좋음
Swallow 순위표가 같은 모델을 영어로도 잰 평균 점수입니다. 수학 경시(AIME 2024–2025), 대학원 수준 과학(GPQA), 상식 추론(HellaSwag), 경쟁 프로그래밍(LiveCodeBench v6), 수학(MATH-500), 지시 따르기(IFBench), 여러 분야 추론(MMLU-Pro) 7개 과제를 평균합니다. 일본어 점수와 나란히 보면 언어에 따른 차이를 알 수 있습니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수87.4%Gemma 4 31B
측정한 모델8개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
순위모델실행 조건출시일가격/1M점수
- 12026.04.02$0.3487.4%

- 2medium2026.03.05$1286.4%
- 3medium2025.08.07$7.8185.4%
- 42026.03.11$0.3482.5%
- 5medium2025.08.07$1.5681.0%
- 6medium2025.08.05$0.4076.8%
- 72025.04.14$6.5064.5%
- 82025.04.05$0.3756.3%
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.