MATH-500

한 줄 요약 · 경시대회 수준 수학 문제 500개를 얼마나 맞히는지

무엇을 측정하나요?
Artificial Analysis 가 '레거시' 로 분류해 새 모델 측정이 드문 평가입니다(최근 모델은 표에 없을 수 있음). 고등학교 경시대회 수준 수학 문제 500개로 계산·대수·기하·확률 실력을 봅니다. AIME 보다는 쉽고 범위가 넓습니다.
누가 어떻게 평가하나요?
UC 버클리 연구진의 MATH 데이터셋(12,500문항) 가운데 OpenAI 가 2023년 연구에서 대표 표본으로 뽑은 500문항입니다. 정답이 정해져 있어 자동 채점하며, Artificial Analysis 가 직접 실행합니다.
점수 읽는 법
0~100%. 최신 AI 는 대부분 95% 를 넘어 사실상 만점 경쟁이라, 이 점수만으로는 우열을 가리기 어렵습니다.

순위

최고 점수99.4%GPT-5
측정한 모델10개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    OpenAI2025.08.07
    99.4%
  2. 2
    Anthropic2025.05.22
    99.1%
  3. 3
    Anthropic2025.05.22
    98.2%
  4. 4
    Google2025.06.17
    98.1%
  5. 5
    Google2025.06.17
    96.7%
  6. 6
    OpenAI2025.04.14
    91.3%
  7. 7
    Meta2025.04.05
    88.9%
  8. 8
    Meta2025.04.05
    84.4%
  9. 9
    Perplexity2025.01.28
    81.7%
  10. 10
    Mistral AI2026.03.16
    56.2%

최근 60일 내 출시된 AI 37개 중 37개는 아직 이 지표에 반영되지 않았습니다 · Claude Haiku 5.5, Decider V1.1 27B, Mistral Large 4 외 34개

출처: Artificial Analysis 데이터 출처·게재 중단 요청

점수 해석 시 유의사항

  • 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
  • '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.