Arena Korean

한 줄 요약 · 한국어로 물었을 때 사람들이 더 좋아한 답을 낸 AI

무엇을 측정하나요?
한국어로 입력된 질문만 따로 모아 센 순위입니다. 영어 성적이 좋아도 한국어 표현과 맥락 이해가 떨어지는 AI 를 가려낼 수 있습니다.
누가 어떻게 평가하나요?
Arena Intelligence 에서 사용자가 질문을 넣으면 이름을 가린 두 AI 가 답하고, 더 나은 쪽에 투표합니다. 누적 8,200만 표 이상의 투표를 통계 모델(Bradley-Terry)로 집계해 Elo 처럼 보이는 점수로 환산하며, 이 표는 길고 화려하게 꾸민 답을 선호하는 편향을 통계로 걷어낸 '스타일 보정본' 을 공식 데이터셋에서 가져옵니다. 질문의 언어를 자동 감지해 한국어 질문만 집계합니다.
점수 읽는 법
시험 점수(정답률 %)가 아니라 대결 성적입니다. 다른 AI 와 맞붙어 선택된 확률로 계산되므로 만점이 없고, 새 AI 가 들어오면 기존 AI 의 점수도 조금씩 움직입니다. 보통 1,000~1,500 사이이며, 두 AI 의 점수 차가 100점이면 앞선 쪽이 약 64%, 200점이면 약 76% 확률로 선택된다는 뜻입니다. 정답을 맞혔는지는 세지 않아 틀린 답도 설명이 친절하면 이길 수 있으므로, 정확성이 중요한 용도라면 정답률 시험(GPQA·AIME 등)을 함께 보는 것이 좋습니다. 점수 차가 수십 점 이내면 순위가 달라도 사실상 같은 등급으로 보는 편이 안전합니다. 영어 종합 순위보다 표본이 작아 순위 변동이 크고, 한국어 순위는 다른 언어 순위와 상관이 낮은 편이라 따로 보는 것이 맞습니다.

마지막 업데이트: 2026-10-02

순위

최고 점수1514Claude Fable 5.1
측정한 모델79개
최근 갱신2026.10.02
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    Anthropic2026.09.01
    1514
  2. 2
    Meta2026.09.02
    1513
  3. 3
    Anthropic2026.07.24
    1498
  4. 4
    Anthropic2026.06.09
    1497
  5. 5
    Z.ai2026.08.18
    1481
  6. 6
    Google2026.08.13
    1480
  7. 7
    Meta2026.07.09
    1477
  8. 8
    Moonshot AI2026.07.17
    1473
  9. 9
    Meta2026.04.08
    1472
  10. 10
    Anthropic2026.04.16
    1472

최근 60일 내 출시된 AI 34개 중 26개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Perplexity Decider v1 27B, Clef Flash 외 23개

출처: Arena Intelligence 데이터 출처·게재 중단 요청

점수 해석 시 유의사항

  • 선호 투표 기반 지표로, 정답 여부는 평가하지 않습니다. 오답이라도 설명이 충실하면 높은 평가를 받을 수 있습니다.
  • 질문의 구성은 투표 참여자에 따라 달라지므로, 실제 용도와 다른 질문이 포함될 수 있습니다.
  • '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.