Arena Math

한 줄 요약 · 수학 질문에서 사람들이 더 좋아한 답을 낸 AI 순위

무엇을 측정하나요?
수학 질문(계산·풀이·증명)에서의 선호도입니다. 정답 대조가 아니라 사람이 고른 답이라, 풀이 과정이 읽기 쉬운 답이 유리합니다.
누가 어떻게 평가하나요?
Arena Intelligence 에서 사용자가 질문을 넣으면 이름을 가린 두 AI 가 답하고, 더 나은 쪽에 투표합니다. 누적 8,200만 표 이상의 투표를 통계 모델(Bradley-Terry)로 집계해 Elo 처럼 보이는 점수로 환산하며, 이 표는 길고 화려하게 꾸민 답을 선호하는 편향을 통계로 걷어낸 '스타일 보정본' 을 공식 데이터셋에서 가져옵니다. 수학 개념을 실제로 적용해 계산·풀이하는 질문을 AI 분류기가 골라 집계합니다.
점수 읽는 법
시험 점수(정답률 %)가 아니라 대결 성적입니다. 다른 AI 와 맞붙어 선택된 확률로 계산되므로 만점이 없고, 새 AI 가 들어오면 기존 AI 의 점수도 조금씩 움직입니다. 보통 1,000~1,500 사이이며, 두 AI 의 점수 차가 100점이면 앞선 쪽이 약 64%, 200점이면 약 76% 확률로 선택된다는 뜻입니다. 정답을 맞혔는지는 세지 않아 틀린 답도 설명이 친절하면 이길 수 있으므로, 정확성이 중요한 용도라면 정답률 시험(GPQA·AIME 등)을 함께 보는 것이 좋습니다. 점수 차가 수십 점 이내면 순위가 달라도 사실상 같은 등급으로 보는 편이 안전합니다. 정답률 시험(AIME·MATH-500)과는 다른 것을 잽니다 — 맞았는지가 아니라 사람이 마음에 들어했는지입니다.

마지막 업데이트: 2026-10-02

순위

최고 점수1530Gemini 4 Argon
측정한 모델94개
최근 갱신2026.10.02
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇GoogleGemini 4 Argon57.1%27.1%1530
  2. 🥈AnthropicClaude Fable 555.5%28.6%1522
  3. 🥉AnthropicClaude Fable 5.159.1%31.1%1518
  4. #4GoogleGemini 3.8 Flash47.8%18.3%1518
  5. #5AnthropicClaude Opus 554.9%29.1%1516
  6. #6AnthropicClaude Opus 5.561.4%31.7%1511
  7. #7MetaMuse Spark 1.348.7%26.0%1509
  8. #8AnthropicClaude Opus 4.639.9%—1507
  9. #9GoogleGemini 3.7 Flash47.9%14.3%1503
  10. #10Z.aiGLM 5.3 Flash39.9%15.4%1503
  11. #11DeepSeekDeepSeek V4.1 Flash39.2%14.3%1503
  12. #12GoogleGemini 3.6 Flash40.8%10.6%1501
  13. #13Moonshot AIKimi K346.9%23.4%1501
  14. #14OpenAIGPT-5.545.8%27.1%1500
  15. #15Z.aiGLM 5.342.3%19.1%1494
  16. #16OpenAIGPT-5.6 Sol49.5%32.3%1494
  17. #17MetaMuse Spark 1.146.2%15.1%1492
  18. #18OpenAIGPT-5.443.7%23.4%1492
  19. #19AnthropicClaude Opus 4.742.3%12.0%1492
  20. #20OpenAIGPT-6 Astra54.7%31.7%1490
  21. #21GoogleGemini 3.1 Pro47.0%17.7%1488
  22. #21Z.aiGLM 5.241.1%20.9%1488
  23. #23XiaomiMiMo-V2.6-Pro49.4%26.6%1487
  24. #24AlibabaQwen3.7 Max40.5%13.4%1484
  25. #25GoogleGemini 3.5 Flash42.7%13.1%1482
  26. #26XiaomiMiMo V2.5 Pro35.7%4.0%1481
  27. #27Moonshot AIKimi K2.637.5%8.0%1480
  28. #28OpenAIGPT-5.6 Terra42.9%30.0%1479
  29. #29OpenAIGPT-5.6 Luna39.5%20.6%1477
  30. #30AnthropicClaude Opus 4.848.7%20.9%1477
  31. #31AlibabaQwen3.6 Max30.8%—1476
  32. #32Z.aiGLM-5.130.1%4.6%1475
  33. #33GoogleGemini 3 Flash36.6%—1474
  34. #34AnthropicClaude Sonnet 541.3%16.9%1474
  35. #35xAIGrok 4.542.7%15.4%1473
  36. #36XiaomiMiMo-V2.6-Flash35.1%12.0%1472
  37. #37Moonshot AIKimi K2.530.7%3.1%1471
  38. #38GoogleGemma 4 31B23.6%1.4%1469
  39. #39MetaMuse Spark 1.245.5%17.7%1468
  40. #40MetaMuse Spark40.7%11.3%1466
  41. #41AlibabaQwen3.7 Plus35.6%9.1%1466
  42. #42xAIGrok 4.20 (Reasoning)34.5%—1465
  43. #43AnthropicClaude Sonnet 4.633.6%3.1%1464
  44. #44AnthropicClaude Opus 4.530.1%—1463
  45. #45OpenAIGPT-6 Luna38.5%19.4%1460
  46. #46AlibabaQwen3.6 Plus27.8%2.9%1454
  47. #47AlibabaQwen3.5 397B A17B29.0%—1452
  48. #48OpenAIGPT-6 Sol47.9%30.9%1451
  49. #49XiaomiMiMo V2 Pro30.4%—1451
  50. #50ByteDanceDola Seed 2.0 Pro——1450
  51. #51xAIGrok 4.2027.9%—1449
  52. #52xAIGrok 4.644.1%19.7%1448
  53. #53DeepSeekDeepSeek V4 Pro41.0%18.0%1445
  54. #54xAIGrok 4.743.1%18.0%1444
  55. #55Z.aiGLM-529.3%—1444
  56. #56AnthropicClaude Opus 4.112.5%—1443
  57. #57GoogleGemini 3.5 Flash-Lite18.8%0.0%1442
  58. #58NVIDIANemotron 3 Ultra28.4%3.1%1442
  59. #59GoogleGemini 2.5 Pro22.5%2.0%1439
  60. #60OpenAIGPT-5.4 Mini28.1%10.0%1439
  61. #61XiaomiMiMo V2.527.2%3.7%1438
  62. #62Z.aiGLM 5V Turbo17.1%—1437
  63. #63GoogleGemini 3.1 Flash Lite17.2%1.1%1436
  64. #64MeituanLongcat Flash Chat5.8%—1435
  65. #65BaiduERNIE 5.0 Thinking13.3%—1435
  66. #66OpenAIGPT-528.5%12.6%1434
  67. #67MiniMaxMiniMax M339.0%3.7%1432
  68. #68TencentHy333.5%—1431
  69. #69Mistral AIMistral Medium 3.513.8%0.0%1429
  70. #70AnthropicClaude Sonnet 4.517.8%1.1%1428
  71. #71DeepSeekDeepSeek V3.224.6%—1427
  72. #72DeepSeekDeepSeek V4 Flash38.6%16.6%1425
  73. #73OpenAIGPT-5.4 Nano28.3%9.3%1425
  74. #74MiniMaxMiniMax M2.729.6%0.6%1422
  75. #75AnthropicClaude Opus 412.3%0.3%1421
  76. #76xAIGrok 4.1 Fast (Reasoning)19.3%—1421
  77. #77xAIGrok 4.337.2%8.0%1419
  78. #78UpstageSolar Pro 429.2%—1412
  79. #79OpenAIGPT-5 Mini21.5%0.0%1405
  80. #80GoogleGemini 2.5 Flash12.1%1.1%1405
  81. #81AnthropicClaude Sonnet 410.7%0.3%1404
  82. #82AnthropicClaude Haiku 4.510.4%0.0%1400
  83. #83MiniMaxMiniMax M2.520.5%—1393
  84. #84Arcee AITrinity Large Thinking15.8%0.9%1384
  85. #85OpenAIGPT OSS 120B19.6%1.1%1381
  86. #86NVIDIANemotron 3 Super20.8%3.1%1373
  87. #87GoogleGemini 2.5 Flash Lite7.0%—1362
  88. #88NVIDIANemotron 3 Nano 30B A3B11.4%—1347
  89. #89OpenAIGPT-5 Nano9.5%—1346
  90. #90AmazonNova 2 Lite11.6%—1332
  91. #91IBMGranite 4.1 8B3.8%—1317
  92. #92MetaLlama 4 Maverick4.9%0.0%1316
  93. #93MetaLlama 4 Scout3.8%0.0%1309
  94. #94OpenAIGPT-4.14.2%—1303
모델 절반이 1452 이하측정: 사용자 선호도 투표최종 갱신 2026-10-02

최근 60일 내 출시된 AI 37개 중 21개는 아직 이 지표에 반영되지 않았습니다 · Claude Haiku 5.5, Decider V1.1 27B, Mistral Large 4 외 18개

출처: Arena Intelligence 데이터 출처·게재 중단 요청

점수 해석 시 유의사항

  • 선호 투표 기반 지표로, 정답 여부는 평가하지 않습니다. 오답이라도 설명이 충실하면 높은 평가를 받을 수 있습니다.
  • 질문의 구성은 투표 참여자에 따라 달라지므로, 실제 용도와 다른 질문이 포함될 수 있습니다.
  • '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.