Arena Vision

한 줄 요약 · 사진·도표를 보여 주고 물었을 때 사람들이 더 좋아한 답을 낸 AI 순위

무엇을 측정하나요?
사진·도표·화면 캡처를 보여 주고 질문했을 때 누가 더 좋은 답을 하는지 겨루는 순위입니다. 이 점수가 높은 AI 는 이미지 속 내용을 읽고 설명하는 데 강합니다.
누가 어떻게 평가하나요?
Arena Intelligence 의 시각 부문에서 사용자가 이미지를 올리고 질문하면 이름을 가린 두 AI 가 답하고, 사용자가 더 나은 답에 투표합니다. 투표를 텍스트 Arena 와 같은 통계 모델로 점수화하며, 이미지를 입력으로 받는 AI 만 참여합니다.
점수 읽는 법
시험 점수가 아니라 대결 성적입니다. 다른 AI 와 맞붙어 선택된 확률로 계산되므로 만점이 없고, 두 AI 의 점수 차가 100점이면 앞선 쪽이 약 64% 확률로 선택된다는 뜻입니다. 점수 차가 수십 점 이내면 순위가 달라도 사실상 같은 등급입니다. 이 표의 값은 현재 대략 1,100~1,350 사이입니다. 답의 정답 여부를 채점하지 않으므로, 도표의 숫자를 정확히 읽는 능력은 따로 확인하는 것이 좋습니다.

마지막 업데이트: 2026-10-02

순위

최고 점수1325Claude Fable 5
측정한 모델58개
최근 갱신2026.10.02
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇AnthropicClaude Fable 5132535.8%38.6%
  2. 🥈AnthropicClaude Fable 5.1132070.0%41.9%
  3. 🥉AnthropicClaude Opus 4.7131633.3%24.5%
  4. #4GoogleGemini 3.8 Flash131631.7%38.6%
  5. #5GoogleGemini 3.7 Flash131526.7%—
  6. #6AnthropicClaude Opus 4.6131328.3%—
  7. #7MetaMuse Spark 1.31310——
  8. #8GoogleGemini 3.5 Flash1308—33.6%
  9. #9MetaMuse Spark1305——
  10. #10MetaMuse Spark 1.21305——
  11. #11OpenAIGPT-5.4130237.5%27.1%
  12. #12Z.aiGLM 5.3 Flash1301——
  13. #13OpenAIGPT-5.5129744.2%36.2%
  14. #14GoogleGemini 3.6 Flash129723.3%31.2%
  15. #15GoogleGemini 3.1 Pro129626.7%26.5%
  16. #16MetaMuse Spark 1.11294——
  17. #17AnthropicClaude Sonnet 5.5129075.0%—
  18. #18AnthropicClaude Opus 4.8128942.5%14.5%
  19. #19xAIGrok 4.5128822.5%27.3%
  20. #20GoogleGemini 3 Flash1285—0.0%
  21. #21OpenAIGPT-6.1 Sol128580.0%—
  22. #22AnthropicClaude Sonnet 4.61283—6.7%
  23. #23Moonshot AIKimi K2.6128221.7%3.9%
  24. #24AlibabaQwen3.7 Plus1280——
  25. #25OpenAIGPT-6 Astra128080.0%49.7%
  26. #26OpenAIGPT-5.6 Sol127956.7%33.6%
  27. #27StepfunStep-51278——
  28. #28GoogleGemma 4 31B1277——
  29. #29AnthropicClaude Sonnet 51275—24.9%
  30. #30ByteDanceDola Seed 2.0 Pro1275——
  31. #31OpenAIGPT-5.6 Terra127154.2%30.8%
  32. #32Moonshot AIKimi K2.51269——
  33. #33GoogleGemini 3.5 Flash-Lite1267——
  34. #34xAIGrok 4.6126540.0%33.2%
  35. #35Z.aiGLM 5V Turbo1264——
  36. #36AlibabaQwen3.5 397B A17B1264——
  37. #37XiaomiMiMo-V2.6-Pro1264——
  38. #38GoogleGemini 2.5 Pro1263——
  39. #39xAIGrok 4.20 (Reasoning)1263——
  40. #40OpenAIGPT-5.6 Luna126042.5%22.6%
  41. #41XiaomiMiMo-V2.6-Flash1259——
  42. #42MiniMaxMiniMax M31254——
  43. #43XiaomiMiMo V2.51246——
  44. #44OpenAIGPT-5.4 Mini1245——
  45. #45GoogleGemini 3.1 Flash Lite1240——
  46. #46GoogleGemini 2.5 Flash1236——
  47. #47xAIGrok 4.31230—0.0%
  48. #48Mistral AIMistral Medium 3.51222——
  49. #49OpenAIGPT-51208——
  50. #50OpenAIGPT-5 Mini1202——
  51. #51xAIGrok 4.1 Fast (Reasoning)1201——
  52. #52GoogleGemini 2.5 Flash Lite1198——
  53. #53OpenAIGPT-5.4 Nano1196——
  54. #54AnthropicClaude Opus 41192——
  55. #55AnthropicClaude Sonnet 41191——
  56. #56OpenAIGPT-5 Nano1159——
  57. #57MetaLlama 4 Maverick1142——
  58. #58MetaLlama 4 Scout1118——
모델 절반이 1275 이하측정: 사용자 선호도 투표최종 갱신 2026-10-02

최근 60일 내 출시된 AI 25개 중 13개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Clef, Perplexity Decider v1 27B 외 10개

출처: Arena Intelligence 데이터 출처·게재 중단 요청

점수 해석 시 유의사항

  • 선호 투표 기반 지표로, 정답 여부는 평가하지 않습니다. 오답이라도 설명이 충실하면 높은 평가를 받을 수 있습니다.
  • 질문의 구성은 투표 참여자에 따라 달라지므로, 실제 용도와 다른 질문이 포함될 수 있습니다.
  • '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.