Arena Math
한 줄 요약 · 수학 질문에서 사람들이 더 좋아한 답을 낸 AI 순위
- 무엇을 측정하나요?
- 수학 질문(계산·풀이·증명)에서의 선호도입니다. 정답 대조가 아니라 사람이 고른 답이라, 풀이 과정이 읽기 쉬운 답이 유리합니다.
- 누가 어떻게 평가하나요?
- Arena Intelligence 에서 사용자가 질문을 넣으면 이름을 가린 두 AI 가 답하고, 더 나은 쪽에 투표합니다. 누적 8,200만 표 이상의 투표를 통계 모델(Bradley-Terry)로 집계해 Elo 처럼 보이는 점수로 환산하며, 이 표는 길고 화려하게 꾸민 답을 선호하는 편향을 통계로 걷어낸 '스타일 보정본' 을 공식 데이터셋에서 가져옵니다. 수학 개념을 실제로 적용해 계산·풀이하는 질문을 AI 분류기가 골라 집계합니다.
- 점수 읽는 법
- 시험 점수(정답률 %)가 아니라 대결 성적입니다. 다른 AI 와 맞붙어 선택된 확률로 계산되므로 만점이 없고, 새 AI 가 들어오면 기존 AI 의 점수도 조금씩 움직입니다. 보통 1,000~1,500 사이이며, 두 AI 의 점수 차가 100점이면 앞선 쪽이 약 64%, 200점이면 약 76% 확률로 선택된다는 뜻입니다. 정답을 맞혔는지는 세지 않아 틀린 답도 설명이 친절하면 이길 수 있으므로, 정확성이 중요한 용도라면 정답률 시험(GPQA·AIME 등)을 함께 보는 것이 좋습니다. 점수 차가 수십 점 이내면 순위가 달라도 사실상 같은 등급으로 보는 편이 안전합니다. 정답률 시험(AIME·MATH-500)과는 다른 것을 잽니다 — 맞았는지가 아니라 사람이 마음에 들어했는지입니다.
마지막 업데이트: 2026-10-02
순위
최고 점수1530Gemini 4 Argon
측정한 모델94개
최근 갱신2026.10.02
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
여러 분야 전문가도 어려워하는 문제를 풀 수 있을까?Humanity's Last Exam
Claude Opus 5.5🥇
Claude Opus 5.5🥇연구 수준의 물리 문제를 풀 수 있을까?CritPt
GPT-5.6 Sol🥇
GPT-5.6 Sol🥇
- 🥇GoogleGemini 4 Argon57.1%27.1%1530
- 🥈AnthropicClaude Fable 555.5%28.6%1522
- 🥉AnthropicClaude Fable 5.159.1%31.1%1518
- #4GoogleGemini 3.8 Flash47.8%18.3%1518
- #5AnthropicClaude Opus 554.9%29.1%1516
- #6AnthropicClaude Opus 5.561.4%31.7%1511
- #7MetaMuse Spark 1.348.7%26.0%1509
- #8AnthropicClaude Opus 4.639.9%—1507
- #9GoogleGemini 3.7 Flash47.9%14.3%1503
- #10Z.aiGLM 5.3 Flash39.9%15.4%1503
- #11DeepSeekDeepSeek V4.1 Flash39.2%14.3%1503
- #12GoogleGemini 3.6 Flash40.8%10.6%1501
- #13Moonshot AIKimi K346.9%23.4%1501
- #14OpenAIGPT-5.545.8%27.1%1500
- #15Z.aiGLM 5.342.3%19.1%1494
- #16OpenAIGPT-5.6 Sol49.5%32.3%1494
- #17MetaMuse Spark 1.146.2%15.1%1492
- #18OpenAIGPT-5.443.7%23.4%1492
- #19AnthropicClaude Opus 4.742.3%12.0%1492
- #20OpenAIGPT-6 Astra54.7%31.7%1490
- #21GoogleGemini 3.1 Pro47.0%17.7%1488
- #21Z.aiGLM 5.241.1%20.9%1488
- #23XiaomiMiMo-V2.6-Pro49.4%26.6%1487
- #24AlibabaQwen3.7 Max40.5%13.4%1484
- #25GoogleGemini 3.5 Flash42.7%13.1%1482
- #26XiaomiMiMo V2.5 Pro35.7%4.0%1481
- #27Moonshot AIKimi K2.637.5%8.0%1480
- #28OpenAIGPT-5.6 Terra42.9%30.0%1479
- #29OpenAIGPT-5.6 Luna39.5%20.6%1477
- #30AnthropicClaude Opus 4.848.7%20.9%1477
- #31AlibabaQwen3.6 Max30.8%—1476
- #32Z.aiGLM-5.130.1%4.6%1475
- #33GoogleGemini 3 Flash36.6%—1474
- #34AnthropicClaude Sonnet 541.3%16.9%1474
- #35xAIGrok 4.542.7%15.4%1473
- #36XiaomiMiMo-V2.6-Flash35.1%12.0%1472
- #37Moonshot AIKimi K2.530.7%3.1%1471
- #38GoogleGemma 4 31B23.6%1.4%1469
- #39MetaMuse Spark 1.245.5%17.7%1468
- #40MetaMuse Spark40.7%11.3%1466
- #41AlibabaQwen3.7 Plus35.6%9.1%1466
- #42xAIGrok 4.20 (Reasoning)34.5%—1465
- #43AnthropicClaude Sonnet 4.633.6%3.1%1464
- #44AnthropicClaude Opus 4.530.1%—1463
- #45OpenAIGPT-6 Luna38.5%19.4%1460
- #46AlibabaQwen3.6 Plus27.8%2.9%1454
- #47AlibabaQwen3.5 397B A17B29.0%—1452
- #48OpenAIGPT-6 Sol47.9%30.9%1451
- #49XiaomiMiMo V2 Pro30.4%—1451
- #50ByteDanceDola Seed 2.0 Pro——1450
- #51xAIGrok 4.2027.9%—1449
- #52xAIGrok 4.644.1%19.7%1448
- #53DeepSeekDeepSeek V4 Pro41.0%18.0%1445
- #54xAIGrok 4.743.1%18.0%1444
- #55Z.aiGLM-529.3%—1444
- #56AnthropicClaude Opus 4.112.5%—1443
- #57GoogleGemini 3.5 Flash-Lite18.8%0.0%1442
- #58NVIDIANemotron 3 Ultra28.4%3.1%1442
- #59GoogleGemini 2.5 Pro22.5%2.0%1439
- #60OpenAIGPT-5.4 Mini28.1%10.0%1439
- #61XiaomiMiMo V2.527.2%3.7%1438
- #62Z.aiGLM 5V Turbo17.1%—1437
- #63GoogleGemini 3.1 Flash Lite17.2%1.1%1436
- #64MeituanLongcat Flash Chat5.8%—1435
- #65BaiduERNIE 5.0 Thinking13.3%—1435
- #66OpenAIGPT-528.5%12.6%1434
- #67MiniMaxMiniMax M339.0%3.7%1432
- #68TencentHy333.5%—1431
- #69Mistral AIMistral Medium 3.513.8%0.0%1429
- #70AnthropicClaude Sonnet 4.517.8%1.1%1428
- #71DeepSeekDeepSeek V3.224.6%—1427
- #72DeepSeekDeepSeek V4 Flash38.6%16.6%1425
- #73OpenAIGPT-5.4 Nano28.3%9.3%1425
- #74MiniMaxMiniMax M2.729.6%0.6%1422
- #75AnthropicClaude Opus 412.3%0.3%1421
- #76xAIGrok 4.1 Fast (Reasoning)19.3%—1421
- #77xAIGrok 4.337.2%8.0%1419
- #78UpstageSolar Pro 429.2%—1412
- #79OpenAIGPT-5 Mini21.5%0.0%1405
- #80GoogleGemini 2.5 Flash12.1%1.1%1405
- #81AnthropicClaude Sonnet 410.7%0.3%1404
- #82AnthropicClaude Haiku 4.510.4%0.0%1400
- #83MiniMaxMiniMax M2.520.5%—1393
- #84Arcee AITrinity Large Thinking15.8%0.9%1384
- #85OpenAIGPT OSS 120B19.6%1.1%1381
- #86NVIDIANemotron 3 Super20.8%3.1%1373
- #87GoogleGemini 2.5 Flash Lite7.0%—1362
- #88NVIDIANemotron 3 Nano 30B A3B11.4%—1347
- #89OpenAIGPT-5 Nano9.5%—1346
- #90AmazonNova 2 Lite11.6%—1332
- #91IBMGranite 4.1 8B3.8%—1317
- #92MetaLlama 4 Maverick4.9%0.0%1316
- #93MetaLlama 4 Scout3.8%0.0%1309
- #94OpenAIGPT-4.14.2%—1303
모델 절반이 1452 이하측정: 사용자 선호도 투표최종 갱신 2026-10-02
최근 60일 내 출시된 AI 37개 중 21개는 아직 이 지표에 반영되지 않았습니다 · Claude Haiku 5.5, Decider V1.1 27B, Mistral Large 4 외 18개
출처: Arena Intelligence 데이터 출처·게재 중단 요청점수 해석 시 유의사항
- 선호 투표 기반 지표로, 정답 여부는 평가하지 않습니다. 오답이라도 설명이 충실하면 높은 평가를 받을 수 있습니다.
- 질문의 구성은 투표 참여자에 따라 달라지므로, 실제 용도와 다른 질문이 포함될 수 있습니다.
- '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.