Arena Entertainment, Sports & Media

한 줄 요약 · 엔터·스포츠·미디어 분야의 전문가 수준 질문에서 사람들이 더 좋아한 AI

무엇을 측정하나요?
엔터·스포츠·미디어 분야 전문가 수준의 질문에서 어느 AI 의 답이 선호됐는지입니다. 예: 대본 구성, 콘텐츠 기획, 스포츠 분석. 일반 질문이 아니라 그 일을 실제로 하는 사람이 낼 법한 질문입니다.
누가 어떻게 평가하나요?
Arena Intelligence 에서 사용자가 질문을 넣으면 이름을 가린 두 AI 가 답하고, 더 나은 쪽에 투표합니다. 누적 8,200만 표 이상의 투표를 통계 모델(Bradley-Terry)로 집계해 Elo 처럼 보이는 점수로 환산하며, 이 표는 길고 화려하게 꾸민 답을 선호하는 편향을 통계로 걷어낸 '스타일 보정본' 을 공식 데이터셋에서 가져옵니다. 질문의 추론 깊이와 전문성을 AI 분류기가 판정해 전체의 약 5.5% 만 '전문가 질문' 으로 태깅하고, 이를 다시 미국 노동통계국 직업분류(SOC)에 기반한 직군으로 나눕니다(2025년 11월 신설). 이 표는 그중 '엔터·스포츠·미디어' 으로 분류된 질문만 집계합니다.
점수 읽는 법
시험 점수(정답률 %)가 아니라 대결 성적입니다. 다른 AI 와 맞붙어 선택된 확률로 계산되므로 만점이 없고, 새 AI 가 들어오면 기존 AI 의 점수도 조금씩 움직입니다. 보통 1,000~1,500 사이이며, 두 AI 의 점수 차가 100점이면 앞선 쪽이 약 64%, 200점이면 약 76% 확률로 선택된다는 뜻입니다. 정답을 맞혔는지는 세지 않아 틀린 답도 설명이 친절하면 이길 수 있으므로, 정확성이 중요한 용도라면 정답률 시험(GPQA·AIME 등)을 함께 보는 것이 좋습니다. 점수 차가 수십 점 이내면 순위가 달라도 사실상 같은 등급으로 보는 편이 안전합니다. 이 직군의 질문 수가 적어 상위권 순위가 자주 바뀌므로, 순위보다 점수대와 신뢰구간을 보는 편이 안전합니다.

마지막 업데이트: 2026-10-02

순위

최고 점수1522Gemini 4 Argon
측정한 모델97개
최근 갱신2026.10.02
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇GoogleGemini 4 Argon1522
  2. 🥈AnthropicClaude Opus 5.51501
  3. 🥉AnthropicClaude Fable 51495
  4. #4GoogleGemini 3.7 Flash1480
  5. #5AnthropicClaude Opus 4.61478
  6. #6AnthropicClaude Fable 5.11475
  7. #7AnthropicClaude Opus 4.71473
  8. #8GoogleGemini 3.8 Flash1471
  9. #9OpenAIGPT-5.6 Sol1471
  10. #10GoogleGemini 3.1 Pro1469
  11. #11MetaMuse Spark1462
  12. #12OpenAIGPT-6.1 Sol1462
  13. #13GoogleGemini 3.6 Flash1461
  14. #14AnthropicClaude Opus 51461
  15. #15MetaMuse Spark 1.21460
  16. #16Moonshot AIKimi K31460
  17. #17OpenAIGPT-6 Astra1458
  18. #18GoogleGemini 3.5 Flash1457
  19. #19MetaMuse Spark 1.31456
  20. #20AnthropicClaude Opus 4.51455
  21. #21AnthropicClaude Opus 4.81454
  22. #22GoogleGemini 3 Flash1453
  23. #23DeepSeekDeepSeek V4.1 Flash1453
  24. #24MetaMuse Spark 1.11450
  25. #25xAIGrok 4.201449
  26. #26OpenAIGPT-5.51447
  27. #26XiaomiMiMo-V2.6-Pro1447
  28. #28Z.aiGLM 5.31447
  29. #29Z.aiGLM 5.21446
  30. #30AnthropicClaude Sonnet 4.61446
  31. #31xAIGrok 4.51445
  32. #32xAIGrok 4.20 (Reasoning)1445
  33. #33AnthropicClaude Sonnet 4.51444
  34. #34AlibabaQwen3.7 Max1443
  35. #35xAIGrok 4.61443
  36. #36Z.aiGLM-5.11442
  37. #37OpenAIGPT-6 Sol1442
  38. #38OpenAIGPT-5.41441
  39. #39AnthropicClaude Sonnet 5.51441
  40. #40Z.aiGLM-51439
  41. #41Z.aiGLM 5.3 Flash1439
  42. #42XiaomiMiMo V2.5 Pro1438
  43. #43AnthropicClaude Opus 4.11435
  44. #44DeepSeekDeepSeek V4 Pro1435
  45. #45GoogleGemini 3.5 Flash-Lite1433
  46. #46AnthropicClaude Sonnet 51433
  47. #47OpenAIGPT-5.6 Terra1432
  48. #48GoogleGemini 2.5 Pro1431
  49. #49Moonshot AIKimi K2.61429
  50. #50AlibabaQwen3.6 Max1427
  51. #51XiaomiMiMo V2 Pro1426
  52. #52OpenAIGPT-6 Luna1422
  53. #53AnthropicClaude Opus 41422
  54. #54Moonshot AIKimi K2.51421
  55. #55StepfunStep-51420
  56. #56AlibabaQwen3.7 Plus1419
  57. #57OpenAIGPT-5.6 Luna1418
  58. #58GoogleGemma 4 31B1417
  59. #59xAIGrok 4.71416
  60. #60xAIGrok 4.31416
  61. #61ByteDanceDola Seed 2.0 Pro1414
  62. #62BaiduERNIE 5.0 Thinking1412
  63. #63OpenAIGPT-5.4 Mini1409
  64. #64AlibabaQwen3.6 Plus1407
  65. #65XiaomiMiMo-V2.6-Flash1407
  66. #66MiniMaxMiniMax M31407
  67. #67DeepSeekDeepSeek V4 Flash1405
  68. #68GoogleGemini 3.1 Flash Lite1404
  69. #69XiaomiMiMo V2.51403
  70. #70xAIGrok 4.1 Fast (Reasoning)1402
  71. #71AlibabaQwen3.5 397B A17B1402
  72. #72OpenAIGPT-51398
  73. #73Z.aiGLM 5V Turbo1398
  74. #74MeituanLongcat Flash Chat1397
  75. #75Mistral AIMistral Medium 3.51396
  76. #76DeepSeekDeepSeek V3.21396
  77. #77AnthropicClaude Sonnet 41389
  78. #78AnthropicClaude Haiku 4.51389
  79. #79GoogleGemini 2.5 Flash1386
  80. #80NVIDIANemotron 3 Ultra1378
  81. #81MiniMaxMiniMax M2.71372
  82. #82TencentHy31364
  83. #83MiniMaxMiniMax M2.51362
  84. #84OpenAIGPT-5.4 Nano1352
  85. #85OpenAIGPT-5 Mini1348
  86. #86GoogleGemini 2.5 Flash Lite1346
  87. #87UpstageSolar Pro 41326
  88. #88Arcee AITrinity Large Thinking1324
  89. #89NVIDIANemotron 3 Super1316
  90. #90MetaLlama 4 Maverick1296
  91. #91OpenAIGPT-4.11291
  92. #92MetaLlama 4 Scout1289
  93. #93OpenAIGPT OSS 120B1286
  94. #94AmazonNova 2 Lite1283
  95. #95OpenAIGPT-5 Nano1277
  96. #96NVIDIANemotron 3 Nano 30B A3B1257
  97. #97IBMGranite 4.1 8B1256
모델 절반이 1429 이하측정: 사용자 선호도 투표최종 갱신 2026-10-02

최근 60일 내 출시된 AI 34개 중 15개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Perplexity Decider v1 27B, Clef Flash 외 12개

출처: Arena Intelligence 데이터 출처·게재 중단 요청

점수 해석 시 유의사항

  • 선호 투표 기반 지표로, 정답 여부는 평가하지 않습니다. 오답이라도 설명이 충실하면 높은 평가를 받을 수 있습니다.
  • 질문의 구성은 투표 참여자에 따라 달라지므로, 실제 용도와 다른 질문이 포함될 수 있습니다.
  • '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.