Arena WebDev

한 줄 요약 · 웹사이트·앱을 만들어 달라고 했을 때 사람들이 더 좋아한 결과를 낸 AI 순위

무엇을 측정하나요?
웹사이트나 앱을 만들어 달라고 했을 때 누가 더 쓸 만한 결과물을 만드는지 겨루는 순위입니다. 코드를 읽어 채점하는 대신 실제로 돌아가는 화면을 보고 사람이 고르므로, 이 점수가 높은 AI 는 "보기 좋고 동작하는" 결과를 잘 만듭니다.
누가 어떻게 평가하나요?
Arena Intelligence 의 웹 개발 부문에서 사용자가 만들고 싶은 페이지·앱을 설명하면 이름을 가린 두 AI 가 코드를 짜고, 그 결과를 실제로 실행한 화면을 나란히 보여 줍니다. 사용자는 더 나은 쪽에 투표하고, 투표를 텍스트 Arena 와 같은 통계 모델로 점수화합니다.
점수 읽는 법
시험 점수가 아니라 대결 성적입니다. 다른 AI 와 맞붙어 선택된 확률로 계산되므로 만점이 없고, 두 AI 의 점수 차가 100점이면 앞선 쪽이 약 64% 확률로 선택된다는 뜻입니다. 점수 차가 수십 점 이내면 순위가 달라도 사실상 같은 등급입니다. 이 표의 값은 현재 대략 1,200~1,800 사이입니다. 결과 화면의 첫인상이 투표를 좌우하므로 코드의 유지보수성·보안은 반영되지 않습니다.

마지막 업데이트: 2026-10-01

순위

최고 점수1788GPT-6 Astra
측정한 모델64개
최근 갱신2026.10.01
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇OpenAIGPT-6 Astra1788
  2. 🥈AnthropicClaude Sonnet 5.51786
  3. 🥉OpenAIGPT-6.1 Sol1758
  4. #4AnthropicClaude Fable 5.11749
  5. #5AnthropicClaude Opus 51695
  6. #6OpenAIGPT-6 Sol1689
  7. #7GoogleGemini 4 Argon1680
  8. #8Moonshot AIKimi K31658
  9. #9MetaMuse Spark 1.31657
  10. #10xAIGrok 4.71638
  11. #11AnthropicClaude Fable 51625
  12. #12Z.aiGLM 5.31623
  13. #13DeepSeekDeepSeek V4.1 Flash1620
  14. #14xAIGrok 4.61620
  15. #15XiaomiMiMo-V2.6-Pro1618
  16. #16Z.aiGLM 5.3 Flash1616
  17. #17Z.aiGLM 5.21605
  18. #18GoogleGemini 3.7 Flash1592
  19. #19GoogleGemini 3.8 Flash1583
  20. #20OpenAIGPT-6 Luna1579
  21. #21AnthropicClaude Opus 4.71555
  22. #22xAIGrok 4.51552
  23. #23MetaMuse Spark 1.11542
  24. #24AnthropicClaude Sonnet 51539
  25. #25AnthropicClaude Opus 4.61537
  26. #26GoogleGemini 3.6 Flash1536
  27. #27AnthropicClaude Opus 4.81534
  28. #28MetaMuse Spark 1.21532
  29. #29AnthropicClaude Sonnet 4.61521
  30. #30Moonshot AIKimi K2.61509
  31. #31Z.aiGLM-5.11509
  32. #32GoogleGemini 3.5 Flash1490
  33. #33MiniMaxMiniMax M31482
  34. #34AlibabaQwen3.6 Max1482
  35. #35XiaomiMiMo V2.5 Pro1478
  36. #36AnthropicClaude Opus 4.51469
  37. #37AlibabaQwen3.6 Plus1461
  38. #38GoogleGemini 3.1 Pro1446
  39. #39DeepSeekDeepSeek V4 Pro1446
  40. #40GoogleGemini 3.5 Flash-Lite1440
  41. #41GoogleGemini 3 Flash1439
  42. #42XiaomiMiMo V2.51438
  43. #43Moonshot AIKimi K2.51436
  44. #44Z.aiGLM-51434
  45. #45XiaomiMiMo V2 Pro1433
  46. #46Z.aiGLM 5V Turbo1400
  47. #47AlibabaQwen3.5 397B A17B1399
  48. #48OpenAIGPT-5.4 Mini1397
  49. #48MiniMaxMiniMax M2.71397
  50. #50MiniMaxMiniMax M2.51386
  51. #51AnthropicClaude Sonnet 4.51384
  52. #52xAIGrok 4.20 (Reasoning)1374
  53. #53UpstageSolar Pro 41370
  54. #54GoogleGemma 4 31B1365
  55. #55xAIGrok 4.31357
  56. #56TencentHy31356
  57. #57AnthropicClaude Haiku 4.51329
  58. #58DeepSeekDeepSeek V3.21325
  59. #59Mistral AIMistral Medium 3.51263
  60. #60GoogleGemini 3.1 Flash Lite1256
  61. #61xAIGrok 4.1 Fast (Reasoning)1241
  62. #62Arcee AITrinity Large Thinking1238
  63. #63GoogleGemini 2.5 Pro1227
  64. #64IBMGranite 4.1 8B1190
모델 절반이 1486 이하측정: 사용자 선호도 투표최종 갱신 2026-10-01

최근 60일 내 출시된 AI 34개 중 18개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Clef, Perplexity Decider v1 27B 외 15개

출처: Arena Intelligence 데이터 출처·게재 중단 요청

점수 해석 시 유의사항

  • 선호 투표 기반 지표로, 주문을 정확히 따랐는지는 채점하지 않습니다. 보기·듣기 좋은 결과라면 지시와 조금 달라도 높은 평가를 받을 수 있습니다.
  • 투표에 쓰인 주문은 참여자에 따라 달라지므로, 실제 용도와 다른 종류의 요청이 포함될 수 있습니다.
  • '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.