MATH-500
한 줄 요약 · 경시대회 수준 수학 문제 500개를 얼마나 맞히는지
- 무엇을 측정하나요?
- Artificial Analysis 가 '레거시' 로 분류해 새 모델 측정이 드문 평가입니다(최근 모델은 표에 없을 수 있음). 고등학교 경시대회 수준 수학 문제 500개로 계산·대수·기하·확률 실력을 봅니다. AIME 보다는 쉽고 범위가 넓습니다.
- 누가 어떻게 평가하나요?
- UC 버클리 연구진의 MATH 데이터셋(12,500문항) 가운데 OpenAI 가 2023년 연구에서 대표 표본으로 뽑은 500문항입니다. 정답이 정해져 있어 자동 채점하며, Artificial Analysis 가 직접 실행합니다.
- 점수 읽는 법
- 0~100%. 최신 AI 는 대부분 95% 를 넘어 사실상 만점 경쟁이라, 이 점수만으로는 우열을 가리기 어렵습니다.
순위
최고 점수99.4%GPT-5
측정한 모델10개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
순위모델출시일가격/1M점수
- 12025.08.07$7.8199.4%
- 22025.05.22$1299.1%
- 32025.05.22$6098.2%
- 42025.06.17$1.9598.1%

- 52025.06.17$7.8196.7%

- 62025.04.14$6.5091.3%
- 72025.04.05$0.7088.9%
- 82025.04.05$0.3784.4%
- 92025.01.28$181.7%
- 102026.03.16$0.4956.2%
최근 60일 내 출시된 AI 37개 중 37개는 아직 이 지표에 반영되지 않았습니다 · Claude Haiku 5.5, Decider V1.1 27B, Mistral Large 4 외 34개
출처: Artificial Analysis 데이터 출처·게재 중단 요청점수 해석 시 유의사항
- 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
- '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.