Arena Vision
한 줄 요약 · 사진·도표를 보여 주고 물었을 때 사람들이 더 좋아한 답을 낸 AI 순위
- 무엇을 측정하나요?
- 사진·도표·화면 캡처를 보여 주고 질문했을 때 누가 더 좋은 답을 하는지 겨루는 순위입니다. 이 점수가 높은 AI 는 이미지 속 내용을 읽고 설명하는 데 강합니다.
- 누가 어떻게 평가하나요?
- Arena Intelligence 의 시각 부문에서 사용자가 이미지를 올리고 질문하면 이름을 가린 두 AI 가 답하고, 사용자가 더 나은 답에 투표합니다. 투표를 텍스트 Arena 와 같은 통계 모델로 점수화하며, 이미지를 입력으로 받는 AI 만 참여합니다.
- 점수 읽는 법
- 시험 점수가 아니라 대결 성적입니다. 다른 AI 와 맞붙어 선택된 확률로 계산되므로 만점이 없고, 두 AI 의 점수 차가 100점이면 앞선 쪽이 약 64% 확률로 선택된다는 뜻입니다. 점수 차가 수십 점 이내면 순위가 달라도 사실상 같은 등급입니다. 이 표의 값은 현재 대략 1,100~1,350 사이입니다. 답의 정답 여부를 채점하지 않으므로, 도표의 숫자를 정확히 읽는 능력은 따로 확인하는 것이 좋습니다.
마지막 업데이트: 2026-10-02
순위
최고 점수1325Claude Fable 5
측정한 모델58개
최근 갱신2026.10.02
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
조립 사진을 보고 잘못된 단계를 찾아낼까?Furniture Assembly
Claude Opus 5.5🥇
Claude Opus 5.5🥇집 안 사진 여러 장으로 평면도를 그릴 수 있을까?Blueprint-Bench 2
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇AnthropicClaude Fable 5132535.8%38.6%
- 🥈AnthropicClaude Fable 5.1132070.0%41.9%
- 🥉AnthropicClaude Opus 4.7131633.3%24.5%
- #4GoogleGemini 3.8 Flash131631.7%38.6%
- #5GoogleGemini 3.7 Flash131526.7%—
- #6AnthropicClaude Opus 4.6131328.3%—
- #7MetaMuse Spark 1.31310——
- #8GoogleGemini 3.5 Flash1308—33.6%
- #9MetaMuse Spark1305——
- #10MetaMuse Spark 1.21305——
- #11OpenAIGPT-5.4130237.5%27.1%
- #12Z.aiGLM 5.3 Flash1301——
- #13OpenAIGPT-5.5129744.2%36.2%
- #14GoogleGemini 3.6 Flash129723.3%31.2%
- #15GoogleGemini 3.1 Pro129626.7%26.5%
- #16MetaMuse Spark 1.11294——
- #17AnthropicClaude Sonnet 5.5129075.0%—
- #18AnthropicClaude Opus 4.8128942.5%14.5%
- #19xAIGrok 4.5128822.5%27.3%
- #20GoogleGemini 3 Flash1285—0.0%
- #21OpenAIGPT-6.1 Sol128580.0%—
- #22AnthropicClaude Sonnet 4.61283—6.7%
- #23Moonshot AIKimi K2.6128221.7%3.9%
- #24AlibabaQwen3.7 Plus1280——
- #25OpenAIGPT-6 Astra128080.0%49.7%
- #26OpenAIGPT-5.6 Sol127956.7%33.6%
- #27StepfunStep-51278——
- #28GoogleGemma 4 31B1277——
- #29AnthropicClaude Sonnet 51275—24.9%
- #30ByteDanceDola Seed 2.0 Pro1275——
- #31OpenAIGPT-5.6 Terra127154.2%30.8%
- #32Moonshot AIKimi K2.51269——
- #33GoogleGemini 3.5 Flash-Lite1267——
- #34xAIGrok 4.6126540.0%33.2%
- #35Z.aiGLM 5V Turbo1264——
- #36AlibabaQwen3.5 397B A17B1264——
- #37XiaomiMiMo-V2.6-Pro1264——
- #38GoogleGemini 2.5 Pro1263——
- #39xAIGrok 4.20 (Reasoning)1263——
- #40OpenAIGPT-5.6 Luna126042.5%22.6%
- #41XiaomiMiMo-V2.6-Flash1259——
- #42MiniMaxMiniMax M31254——
- #43XiaomiMiMo V2.51246——
- #44OpenAIGPT-5.4 Mini1245——
- #45GoogleGemini 3.1 Flash Lite1240——
- #46GoogleGemini 2.5 Flash1236——
- #47xAIGrok 4.31230—0.0%
- #48Mistral AIMistral Medium 3.51222——
- #49OpenAIGPT-51208——
- #50OpenAIGPT-5 Mini1202——
- #51xAIGrok 4.1 Fast (Reasoning)1201——
- #52GoogleGemini 2.5 Flash Lite1198——
- #53OpenAIGPT-5.4 Nano1196——
- #54AnthropicClaude Opus 41192——
- #55AnthropicClaude Sonnet 41191——
- #56OpenAIGPT-5 Nano1159——
- #57MetaLlama 4 Maverick1142——
- #58MetaLlama 4 Scout1118——
모델 절반이 1275 이하측정: 사용자 선호도 투표최종 갱신 2026-10-02
최근 60일 내 출시된 AI 25개 중 13개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Clef, Perplexity Decider v1 27B 외 10개
출처: Arena Intelligence 데이터 출처·게재 중단 요청점수 해석 시 유의사항
- 선호 투표 기반 지표로, 정답 여부는 평가하지 않습니다. 오답이라도 설명이 충실하면 높은 평가를 받을 수 있습니다.
- 질문의 구성은 투표 참여자에 따라 달라지므로, 실제 용도와 다른 질문이 포함될 수 있습니다.
- '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.