Arena WebDev
한 줄 요약 · 웹사이트·앱을 만들어 달라고 했을 때 사람들이 더 좋아한 결과를 낸 AI 순위
- 무엇을 측정하나요?
- 웹사이트나 앱을 만들어 달라고 했을 때 누가 더 쓸 만한 결과물을 만드는지 겨루는 순위입니다. 코드를 읽어 채점하는 대신 실제로 돌아가는 화면을 보고 사람이 고르므로, 이 점수가 높은 AI 는 "보기 좋고 동작하는" 결과를 잘 만듭니다.
- 누가 어떻게 평가하나요?
- Arena Intelligence 의 웹 개발 부문에서 사용자가 만들고 싶은 페이지·앱을 설명하면 이름을 가린 두 AI 가 코드를 짜고, 그 결과를 실제로 실행한 화면을 나란히 보여 줍니다. 사용자는 더 나은 쪽에 투표하고, 투표를 텍스트 Arena 와 같은 통계 모델로 점수화합니다.
- 점수 읽는 법
- 시험 점수가 아니라 대결 성적입니다. 다른 AI 와 맞붙어 선택된 확률로 계산되므로 만점이 없고, 두 AI 의 점수 차가 100점이면 앞선 쪽이 약 64% 확률로 선택된다는 뜻입니다. 점수 차가 수십 점 이내면 순위가 달라도 사실상 같은 등급입니다. 이 표의 값은 현재 대략 1,200~1,800 사이입니다. 결과 화면의 첫인상이 투표를 좌우하므로 코드의 유지보수성·보안은 반영되지 않습니다.
마지막 업데이트: 2026-10-01
순위
최고 점수1788GPT-6 Astra
측정한 모델64개
최근 갱신2026.10.01
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
몇 시간 걸리는 개발 일도 컴퓨터를 직접 다루며 혼자 끝낼까?Terminal-Bench 4.0
Claude Sonnet 5.5🥇
Claude Sonnet 5.5🥇대중들이 가장 선호하는 코딩 답변을 하는 AI는?Arena Coding
Gemini 4 Argon🥇
Gemini 4 Argon🥇코드를 실행해 보며 고쳐 과제를 끝낼 수 있을까?LiveBench Agentic Coding
DeepSeek V4.1 Flash🥇
DeepSeek V4.1 Flash🥇
- 🥇OpenAIGPT-6 Astra1788
- 🥈AnthropicClaude Sonnet 5.51786
- 🥉OpenAIGPT-6.1 Sol1758
- #4AnthropicClaude Fable 5.11749
- #5AnthropicClaude Opus 51695
- #6OpenAIGPT-6 Sol1689
- #7GoogleGemini 4 Argon1680
- #8Moonshot AIKimi K31658
- #9MetaMuse Spark 1.31657
- #10xAIGrok 4.71638
- #11AnthropicClaude Fable 51625
- #12Z.aiGLM 5.31623
- #13DeepSeekDeepSeek V4.1 Flash1620
- #14xAIGrok 4.61620
- #15XiaomiMiMo-V2.6-Pro1618
- #16Z.aiGLM 5.3 Flash1616
- #17Z.aiGLM 5.21605
- #18GoogleGemini 3.7 Flash1592
- #19GoogleGemini 3.8 Flash1583
- #20OpenAIGPT-6 Luna1579
- #21AnthropicClaude Opus 4.71555
- #22xAIGrok 4.51552
- #23MetaMuse Spark 1.11542
- #24AnthropicClaude Sonnet 51539
- #25AnthropicClaude Opus 4.61537
- #26GoogleGemini 3.6 Flash1536
- #27AnthropicClaude Opus 4.81534
- #28MetaMuse Spark 1.21532
- #29AnthropicClaude Sonnet 4.61521
- #30Moonshot AIKimi K2.61509
- #31Z.aiGLM-5.11509
- #32GoogleGemini 3.5 Flash1490
- #33MiniMaxMiniMax M31482
- #34AlibabaQwen3.6 Max1482
- #35XiaomiMiMo V2.5 Pro1478
- #36AnthropicClaude Opus 4.51469
- #37AlibabaQwen3.6 Plus1461
- #38GoogleGemini 3.1 Pro1446
- #39DeepSeekDeepSeek V4 Pro1446
- #40GoogleGemini 3.5 Flash-Lite1440
- #41GoogleGemini 3 Flash1439
- #42XiaomiMiMo V2.51438
- #43Moonshot AIKimi K2.51436
- #44Z.aiGLM-51434
- #45XiaomiMiMo V2 Pro1433
- #46Z.aiGLM 5V Turbo1400
- #47AlibabaQwen3.5 397B A17B1399
- #48OpenAIGPT-5.4 Mini1397
- #48MiniMaxMiniMax M2.71397
- #50MiniMaxMiniMax M2.51386
- #51AnthropicClaude Sonnet 4.51384
- #52xAIGrok 4.20 (Reasoning)1374
- #53UpstageSolar Pro 41370
- #54GoogleGemma 4 31B1365
- #55xAIGrok 4.31357
- #56TencentHy31356
- #57AnthropicClaude Haiku 4.51329
- #58DeepSeekDeepSeek V3.21325
- #59Mistral AIMistral Medium 3.51263
- #60GoogleGemini 3.1 Flash Lite1256
- #61xAIGrok 4.1 Fast (Reasoning)1241
- #62Arcee AITrinity Large Thinking1238
- #63GoogleGemini 2.5 Pro1227
- #64IBMGranite 4.1 8B1190
모델 절반이 1486 이하측정: 사용자 선호도 투표최종 갱신 2026-10-01
최근 60일 내 출시된 AI 34개 중 18개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Clef, Perplexity Decider v1 27B 외 15개
출처: Arena Intelligence 데이터 출처·게재 중단 요청점수 해석 시 유의사항
- 선호 투표 기반 지표로, 주문을 정확히 따랐는지는 채점하지 않습니다. 보기·듣기 좋은 결과라면 지시와 조금 달라도 높은 평가를 받을 수 있습니다.
- 투표에 쓰인 주문은 참여자에 따라 달라지므로, 실제 용도와 다른 종류의 요청이 포함될 수 있습니다.
- '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.