Arena Writing, Literature & Language
한 줄 요약 · 글쓰기·문학·언어 분야의 전문가 수준 질문에서 사람들이 더 좋아한 AI
- 무엇을 측정하나요?
- 글쓰기·문학·언어 분야 전문가 수준의 질문에서 어느 AI 의 답이 선호됐는지입니다. 예: 원고 교정, 문체 분석, 번역 감수. 일반 질문이 아니라 그 일을 실제로 하는 사람이 낼 법한 질문입니다.
- 누가 어떻게 평가하나요?
- Arena Intelligence 에서 사용자가 질문을 넣으면 이름을 가린 두 AI 가 답하고, 더 나은 쪽에 투표합니다. 누적 8,200만 표 이상의 투표를 통계 모델(Bradley-Terry)로 집계해 Elo 처럼 보이는 점수로 환산하며, 이 표는 길고 화려하게 꾸민 답을 선호하는 편향을 통계로 걷어낸 '스타일 보정본' 을 공식 데이터셋에서 가져옵니다. 질문의 추론 깊이와 전문성을 AI 분류기가 판정해 전체의 약 5.5% 만 '전문가 질문' 으로 태깅하고, 이를 다시 미국 노동통계국 직업분류(SOC)에 기반한 직군으로 나눕니다(2025년 11월 신설). 이 표는 그중 '글쓰기·문학·언어' 으로 분류된 질문만 집계합니다.
- 점수 읽는 법
- 시험 점수(정답률 %)가 아니라 대결 성적입니다. 다른 AI 와 맞붙어 선택된 확률로 계산되므로 만점이 없고, 새 AI 가 들어오면 기존 AI 의 점수도 조금씩 움직입니다. 보통 1,000~1,500 사이이며, 두 AI 의 점수 차가 100점이면 앞선 쪽이 약 64%, 200점이면 약 76% 확률로 선택된다는 뜻입니다. 정답을 맞혔는지는 세지 않아 틀린 답도 설명이 친절하면 이길 수 있으므로, 정확성이 중요한 용도라면 정답률 시험(GPQA·AIME 등)을 함께 보는 것이 좋습니다. 점수 차가 수십 점 이내면 순위가 달라도 사실상 같은 등급으로 보는 편이 안전합니다. 이 직군의 질문 수가 적어 상위권 순위가 자주 바뀌므로, 순위보다 점수대와 신뢰구간을 보는 편이 안전합니다.
마지막 업데이트: 2026-10-02
순위
최고 점수1522Gemini 4 Argon
측정한 모델97개
최근 갱신2026.10.02
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
대화가 길어질 때 대중들이 가장 선호하는 AI는?Arena Multi-turn
Gemini 4 Argon🥇
Gemini 4 Argon🥇형식·길이 같은 까다로운 조건을 빠짐없이 지킬까?IFBench
Grok 4.3🥇
Grok 4.3🥇
- 🥇GoogleGemini 4 Argon15221554—
- 🥈AnthropicClaude Opus 5.515191500—
- 🥉AnthropicClaude Fable 51508151863.5%
- #4GoogleGemini 3.7 Flash14961493—
- #5AnthropicClaude Fable 5.114911488—
- #6AnthropicClaude Opus 4.61490151253.1%
- #7GoogleGemini 3.8 Flash14871501—
- #8AnthropicClaude Opus 4.71484151458.6%
- #9OpenAIGPT-5.6 Sol1482148772.7%
- #10GoogleGemini 3.1 Pro1480149777.1%
- #11AnthropicClaude Opus 514801487—
- #12Moonshot AIKimi K314761500—
- #13GoogleGemini 3.6 Flash14741488—
- #14OpenAIGPT-6.1 Sol14721493—
- #15GoogleGemini 3.5 Flash1472147876.3%
- #16MetaMuse Spark 1.314701490—
- #17MetaMuse Spark 1.214701521—
- #18AnthropicClaude Opus 4.81468149462.2%
- #19AnthropicClaude Opus 4.51467148458.0%
- #20OpenAIGPT-5.51466148475.9%
- #21Z.aiGLM 5.314661480—
- #22OpenAIGPT-6 Astra14651488—
- #23OpenAIGPT-5.41465149373.9%
- #24MetaMuse Spark1463149375.9%
- #25AnthropicClaude Sonnet 5.514611473—
- #26GoogleGemini 3 Flash1461148278.0%
- #27MetaMuse Spark 1.114611496—
- #28Z.aiGLM 5.21459147573.3%
- #28XiaomiMiMo-V2.6-Pro14591456—
- #30AlibabaQwen3.7 Max1459148380.5%
- #31xAIGrok 4.514581473—
- #32AnthropicClaude Sonnet 4.61455148156.6%
- #33DeepSeekDeepSeek V4.1 Flash14541461—
- #34AnthropicClaude Sonnet 4.51454147857.3%
- #35xAIGrok 4.201452148349.3%
- #36Z.aiGLM-5.11452147876.3%
- #37AnthropicClaude Sonnet 514521473—
- #38DeepSeekDeepSeek V4 Pro1451147576.5%
- #39XiaomiMiMo V2.5 Pro1450148179.9%
- #40Z.aiGLM-51449147172.3%
- #41xAIGrok 4.20 (Reasoning)1448147981.2%
- #42Z.aiGLM 5.3 Flash14481471—
- #43AlibabaQwen3.6 Max1446146976.6%
- #44AnthropicClaude Opus 4.11446147255.4%
- #45xAIGrok 4.614461444—
- #46GoogleGemini 2.5 Pro1445144848.7%
- #47OpenAIGPT-5.6 Terra1445147071.2%
- #48GoogleGemini 3.5 Flash-Lite14431466—
- #49Moonshot AIKimi K2.61441146176.0%
- #50OpenAIGPT-6 Sol14391469—
- #51AlibabaQwen3.7 Plus1437146478.0%
- #52StepfunStep-514361460—
- #53GoogleGemma 4 31B1435146575.6%
- #54OpenAIGPT-5.6 Luna14331457—
- #55AnthropicClaude Opus 41431143953.7%
- #56XiaomiMiMo V2 Pro1431146668.8%
- #57xAIGrok 4.714311433—
- #58Moonshot AIKimi K2.51428145270.2%
- #59xAIGrok 4.31424144683.3%
- #60OpenAIGPT-5.4 Mini1423146673.3%
- #61AlibabaQwen3.6 Plus1423144575.2%
- #62MiniMaxMiniMax M31422145082.9%
- #63OpenAIGPT-6 Luna14211448—
- #64AlibabaQwen3.5 397B A17B1421145478.8%
- #65GoogleGemini 3.1 Flash Lite1420143577.2%
- #66BaiduERNIE 5.0 Thinking1419144241.4%
- #66XiaomiMiMo-V2.6-Flash14191457—
- #68DeepSeekDeepSeek V4 Flash1416145379.2%
- #69Z.aiGLM 5V Turbo1414143261.1%
- #70XiaomiMiMo V2.51412145167.1%
- #71DeepSeekDeepSeek V3.21410142960.7%
- #72ByteDanceDola Seed 2.0 Pro14091449—
- #73xAIGrok 4.1 Fast (Reasoning)1408141452.7%
- #74Mistral AIMistral Medium 3.51405143368.8%
- #75GoogleGemini 2.5 Flash1402140350.3%
- #76AnthropicClaude Haiku 4.51400142554.3%
- #77AnthropicClaude Sonnet 41398142154.7%
- #78OpenAIGPT-51396142073.1%
- #79MeituanLongcat Flash Chat1392143243.1%
- #80NVIDIANemotron 3 Ultra1392139881.4%
- #81MiniMaxMiniMax M2.71387142675.7%
- #82TencentHy31377141563.1%
- #83GoogleGemini 2.5 Flash Lite1371137452.6%
- #84MiniMaxMiniMax M2.51369139771.6%
- #85OpenAIGPT-5.4 Nano1363141375.9%
- #86OpenAIGPT-5 Mini1352137375.4%
- #87Arcee AITrinity Large Thinking1343134656.3%
- #88UpstageSolar Pro 413401390—
- #89NVIDIANemotron 3 Super1325135171.5%
- #90MetaLlama 4 Maverick1312132643.0%
- #91OpenAIGPT OSS 120B1309132769.0%
- #92OpenAIGPT-4.11308129943.0%
- #93MetaLlama 4 Scout1305131939.5%
- #94AmazonNova 2 Lite1298132370.7%
- #95OpenAIGPT-5 Nano1289132467.6%
- #96IBMGranite 4.1 8B1274127938.6%
- #97NVIDIANemotron 3 Nano 30B A3B1267129071.1%
모델 절반이 1441 이하측정: 사용자 선호도 투표최종 갱신 2026-10-02
최근 60일 내 출시된 AI 34개 중 15개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Perplexity Decider v1 27B, Clef Flash 외 12개
출처: Arena Intelligence 데이터 출처·게재 중단 요청점수 해석 시 유의사항
- 선호 투표 기반 지표로, 정답 여부는 평가하지 않습니다. 오답이라도 설명이 충실하면 높은 평가를 받을 수 있습니다.
- 질문의 구성은 투표 참여자에 따라 달라지므로, 실제 용도와 다른 질문이 포함될 수 있습니다.
- '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.