Arena Entertainment, Sports & Media
한 줄 요약 · 엔터·스포츠·미디어 분야의 전문가 수준 질문에서 사람들이 더 좋아한 AI
- 무엇을 측정하나요?
- 엔터·스포츠·미디어 분야 전문가 수준의 질문에서 어느 AI 의 답이 선호됐는지입니다. 예: 대본 구성, 콘텐츠 기획, 스포츠 분석. 일반 질문이 아니라 그 일을 실제로 하는 사람이 낼 법한 질문입니다.
- 누가 어떻게 평가하나요?
- Arena Intelligence 에서 사용자가 질문을 넣으면 이름을 가린 두 AI 가 답하고, 더 나은 쪽에 투표합니다. 누적 8,200만 표 이상의 투표를 통계 모델(Bradley-Terry)로 집계해 Elo 처럼 보이는 점수로 환산하며, 이 표는 길고 화려하게 꾸민 답을 선호하는 편향을 통계로 걷어낸 '스타일 보정본' 을 공식 데이터셋에서 가져옵니다. 질문의 추론 깊이와 전문성을 AI 분류기가 판정해 전체의 약 5.5% 만 '전문가 질문' 으로 태깅하고, 이를 다시 미국 노동통계국 직업분류(SOC)에 기반한 직군으로 나눕니다(2025년 11월 신설). 이 표는 그중 '엔터·스포츠·미디어' 으로 분류된 질문만 집계합니다.
- 점수 읽는 법
- 시험 점수(정답률 %)가 아니라 대결 성적입니다. 다른 AI 와 맞붙어 선택된 확률로 계산되므로 만점이 없고, 새 AI 가 들어오면 기존 AI 의 점수도 조금씩 움직입니다. 보통 1,000~1,500 사이이며, 두 AI 의 점수 차가 100점이면 앞선 쪽이 약 64%, 200점이면 약 76% 확률로 선택된다는 뜻입니다. 정답을 맞혔는지는 세지 않아 틀린 답도 설명이 친절하면 이길 수 있으므로, 정확성이 중요한 용도라면 정답률 시험(GPQA·AIME 등)을 함께 보는 것이 좋습니다. 점수 차가 수십 점 이내면 순위가 달라도 사실상 같은 등급으로 보는 편이 안전합니다. 이 직군의 질문 수가 적어 상위권 순위가 자주 바뀌므로, 순위보다 점수대와 신뢰구간을 보는 편이 안전합니다.
마지막 업데이트: 2026-10-02
순위
최고 점수1522Gemini 4 Argon
측정한 모델97개
최근 갱신2026.10.02
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
대중들이 가장 선호하는 글쓰기·문학 답변을 하는 AI는?Arena Writing, Literature & Language
Gemini 4 Argon🥇
Gemini 4 Argon🥇대화가 길어질 때 대중들이 가장 선호하는 AI는?Arena Multi-turn
Gemini 4 Argon🥇
Gemini 4 Argon🥇형식·길이 같은 까다로운 조건을 빠짐없이 지킬까?IFBench
Grok 4.3🥇
Grok 4.3🥇
- 🥇GoogleGemini 4 Argon1522
- 🥈AnthropicClaude Opus 5.51501
- 🥉AnthropicClaude Fable 51495
- #4GoogleGemini 3.7 Flash1480
- #5AnthropicClaude Opus 4.61478
- #6AnthropicClaude Fable 5.11475
- #7AnthropicClaude Opus 4.71473
- #8GoogleGemini 3.8 Flash1471
- #9OpenAIGPT-5.6 Sol1471
- #10GoogleGemini 3.1 Pro1469
- #11MetaMuse Spark1462
- #12OpenAIGPT-6.1 Sol1462
- #13GoogleGemini 3.6 Flash1461
- #14AnthropicClaude Opus 51461
- #15MetaMuse Spark 1.21460
- #16Moonshot AIKimi K31460
- #17OpenAIGPT-6 Astra1458
- #18GoogleGemini 3.5 Flash1457
- #19MetaMuse Spark 1.31456
- #20AnthropicClaude Opus 4.51455
- #21AnthropicClaude Opus 4.81454
- #22GoogleGemini 3 Flash1453
- #23DeepSeekDeepSeek V4.1 Flash1453
- #24MetaMuse Spark 1.11450
- #25xAIGrok 4.201449
- #26OpenAIGPT-5.51447
- #26XiaomiMiMo-V2.6-Pro1447
- #28Z.aiGLM 5.31447
- #29Z.aiGLM 5.21446
- #30AnthropicClaude Sonnet 4.61446
- #31xAIGrok 4.51445
- #32xAIGrok 4.20 (Reasoning)1445
- #33AnthropicClaude Sonnet 4.51444
- #34AlibabaQwen3.7 Max1443
- #35xAIGrok 4.61443
- #36Z.aiGLM-5.11442
- #37OpenAIGPT-6 Sol1442
- #38OpenAIGPT-5.41441
- #39AnthropicClaude Sonnet 5.51441
- #40Z.aiGLM-51439
- #41Z.aiGLM 5.3 Flash1439
- #42XiaomiMiMo V2.5 Pro1438
- #43AnthropicClaude Opus 4.11435
- #44DeepSeekDeepSeek V4 Pro1435
- #45GoogleGemini 3.5 Flash-Lite1433
- #46AnthropicClaude Sonnet 51433
- #47OpenAIGPT-5.6 Terra1432
- #48GoogleGemini 2.5 Pro1431
- #49Moonshot AIKimi K2.61429
- #50AlibabaQwen3.6 Max1427
- #51XiaomiMiMo V2 Pro1426
- #52OpenAIGPT-6 Luna1422
- #53AnthropicClaude Opus 41422
- #54Moonshot AIKimi K2.51421
- #55StepfunStep-51420
- #56AlibabaQwen3.7 Plus1419
- #57OpenAIGPT-5.6 Luna1418
- #58GoogleGemma 4 31B1417
- #59xAIGrok 4.71416
- #60xAIGrok 4.31416
- #61ByteDanceDola Seed 2.0 Pro1414
- #62BaiduERNIE 5.0 Thinking1412
- #63OpenAIGPT-5.4 Mini1409
- #64AlibabaQwen3.6 Plus1407
- #65XiaomiMiMo-V2.6-Flash1407
- #66MiniMaxMiniMax M31407
- #67DeepSeekDeepSeek V4 Flash1405
- #68GoogleGemini 3.1 Flash Lite1404
- #69XiaomiMiMo V2.51403
- #70xAIGrok 4.1 Fast (Reasoning)1402
- #71AlibabaQwen3.5 397B A17B1402
- #72OpenAIGPT-51398
- #73Z.aiGLM 5V Turbo1398
- #74MeituanLongcat Flash Chat1397
- #75Mistral AIMistral Medium 3.51396
- #76DeepSeekDeepSeek V3.21396
- #77AnthropicClaude Sonnet 41389
- #78AnthropicClaude Haiku 4.51389
- #79GoogleGemini 2.5 Flash1386
- #80NVIDIANemotron 3 Ultra1378
- #81MiniMaxMiniMax M2.71372
- #82TencentHy31364
- #83MiniMaxMiniMax M2.51362
- #84OpenAIGPT-5.4 Nano1352
- #85OpenAIGPT-5 Mini1348
- #86GoogleGemini 2.5 Flash Lite1346
- #87UpstageSolar Pro 41326
- #88Arcee AITrinity Large Thinking1324
- #89NVIDIANemotron 3 Super1316
- #90MetaLlama 4 Maverick1296
- #91OpenAIGPT-4.11291
- #92MetaLlama 4 Scout1289
- #93OpenAIGPT OSS 120B1286
- #94AmazonNova 2 Lite1283
- #95OpenAIGPT-5 Nano1277
- #96NVIDIANemotron 3 Nano 30B A3B1257
- #97IBMGranite 4.1 8B1256
모델 절반이 1429 이하측정: 사용자 선호도 투표최종 갱신 2026-10-02
최근 60일 내 출시된 AI 34개 중 15개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Perplexity Decider v1 27B, Clef Flash 외 12개
출처: Arena Intelligence 데이터 출처·게재 중단 요청점수 해석 시 유의사항
- 선호 투표 기반 지표로, 정답 여부는 평가하지 않습니다. 오답이라도 설명이 충실하면 높은 평가를 받을 수 있습니다.
- 질문의 구성은 투표 참여자에 따라 달라지므로, 실제 용도와 다른 질문이 포함될 수 있습니다.
- '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.