Arena Text-to-Image (Art)

한 줄 요약 · 그림·일러스트 스타일에서 사람들이 더 좋아한 AI

무엇을 측정하나요?
회화·일러스트 등 예술 스타일 그림에서의 선호도입니다. 실사 카테고리와는 거의 겹치지 않는(1% 미만) 별개의 실력입니다.
누가 어떻게 평가하나요?
Arena Intelligence 의 이미지 부문에서 사용자가 주문(프롬프트) 한 줄을 넣으면 이름을 가린 두 AI 가 그림을 만들고, 더 나은 쪽에 투표합니다. 400만 건 이상의 주문에서 모은 투표를 텍스트와 같은 통계 모델로 점수화하며, 2026년 2월부터 모호한 주문 약 15% 를 걸러 낸 뒤 집계합니다. 이 표는 공식 데이터셋의 이미지 순위를 가져옵니다. 이 표는 주문 내용이 '아트' 으로 분류된 투표만 집계합니다(2026년 2월 신설).
점수 읽는 법
시험 점수가 아니라 대결 성적입니다. 다른 AI 와 맞붙어 선택된 확률로 계산되므로 만점이 없고, 보통 1,000~1,500 사이이며 두 AI 의 점수 차가 100점이면 앞선 쪽이 약 64% 확률로 선택된다는 뜻입니다. 그림에는 정답이 없어 순수하게 보는 사람의 취향을 재며, 해상도·생성 속도·비용은 반영되지 않습니다. 점수 차가 수십 점 이내면 순위가 달라도 사실상 같은 등급입니다. 아트에서 강한 AI 가 실사에서도 강하다는 보장은 없습니다.

마지막 업데이트: 2026-10-06

순위

최고 점수1393GPT Image 2.5 Sunburst
측정한 모델23개
최근 갱신2026.10.06
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇OpenAIGPT Image 2.5 Sunburst1393
  2. 🥈OpenAIGPT Image 2.5 Flare1371
  3. 🥉OpenAIGPT Image 21366
  4. #4MicrosoftMAI-Image-2.61336
  5. #5MicrosoftMAI-Image-2.51277
  6. #6ByteDanceSeedream 5.0 Pro1265
  7. #7MetaMuse Image1259
  8. #8OpenAIGPT Image 1.51226
  9. #9GoogleNano Banana Pro1215
  10. #10RecraftRecraft V4.11178
  11. #11xAIGrok Imagine1178
  12. #12Black Forest LabsFLUX.2 Max1169
  13. #13xAIGrok Imagine Pro1165
  14. #14ByteDanceSeedream 4.01164
  15. #15Black Forest LabsFLUX.2 Pro1161
  16. #16ByteDanceSeedream 4.51157
  17. #17Black Forest LabsFLUX.2 Flex1155
  18. #18ByteDanceSeedream 5.0 Lite1139
  19. #19RecraftRecraft V4.1 Flash1126
  20. #20RecraftRecraft V41126
  21. #21OpenAIGPT Image 11116
  22. #22OpenAIGPT Image 1 Mini1112
  23. #23Black Forest LabsFLUX.2 Klein 4B1028
모델 절반이 1169 이하측정: 사용자 선호도 투표최종 갱신 2026-10-06

이전 순위표 기준 점수

최신 순위표(2026.10.06)에 반영되지 않은 점수입니다. 출처에서 빠졌거나 아직 갱신되지 않은 모델로, 마지막으로 받은 점수를 참고로 보여 주며 순위는 매기지 않습니다.

  1. —
    Google2026.06.18 · 2026.04.23 기준
    1256
  2. —
    xAI2026.05.19 · 2026.08.07 기준
    1210

최근 60일 내 출시된 AI 8개 중 4개는 아직 이 지표에 반영되지 않았습니다 · Nano Banana 2.1, FLUX 3 Image, Hy Image 3.5 Preview 외 1개

출처: Arena Intelligence 데이터 출처·게재 중단 요청

점수 해석 시 유의사항

  • 선호 투표 기반 지표로, 주문을 정확히 따랐는지는 채점하지 않습니다. 보기·듣기 좋은 결과라면 지시와 조금 달라도 높은 평가를 받을 수 있습니다.
  • 투표에 쓰인 주문은 참여자에 따라 달라지므로, 실제 용도와 다른 종류의 요청이 포함될 수 있습니다.
  • '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.