Arena Legal & Government

한 줄 요약 · 법률·정부·행정 분야의 전문가 수준 질문에서 사람들이 더 좋아한 AI

무엇을 측정하나요?
법률·정부·행정 분야 전문가 수준의 질문에서 어느 AI 의 답이 선호됐는지입니다. 예: 계약 조항 검토, 판례 비교, 규정 해석. 일반 질문이 아니라 그 일을 실제로 하는 사람이 낼 법한 질문입니다.
누가 어떻게 평가하나요?
Arena Intelligence 에서 사용자가 질문을 넣으면 이름을 가린 두 AI 가 답하고, 더 나은 쪽에 투표합니다. 누적 8,200만 표 이상의 투표를 통계 모델(Bradley-Terry)로 집계해 Elo 처럼 보이는 점수로 환산하며, 이 표는 길고 화려하게 꾸민 답을 선호하는 편향을 통계로 걷어낸 '스타일 보정본' 을 공식 데이터셋에서 가져옵니다. 질문의 추론 깊이와 전문성을 AI 분류기가 판정해 전체의 약 5.5% 만 '전문가 질문' 으로 태깅하고, 이를 다시 미국 노동통계국 직업분류(SOC)에 기반한 직군으로 나눕니다(2025년 11월 신설). 이 표는 그중 '법률·정부·행정' 으로 분류된 질문만 집계합니다.
점수 읽는 법
시험 점수(정답률 %)가 아니라 대결 성적입니다. 다른 AI 와 맞붙어 선택된 확률로 계산되므로 만점이 없고, 새 AI 가 들어오면 기존 AI 의 점수도 조금씩 움직입니다. 보통 1,000~1,500 사이이며, 두 AI 의 점수 차가 100점이면 앞선 쪽이 약 64%, 200점이면 약 76% 확률로 선택된다는 뜻입니다. 정답을 맞혔는지는 세지 않아 틀린 답도 설명이 친절하면 이길 수 있으므로, 정확성이 중요한 용도라면 정답률 시험(GPQA·AIME 등)을 함께 보는 것이 좋습니다. 점수 차가 수십 점 이내면 순위가 달라도 사실상 같은 등급으로 보는 편이 안전합니다. 이 직군의 질문 수가 적어 상위권 순위가 자주 바뀌므로, 순위보다 점수대와 신뢰구간을 보는 편이 안전합니다.

마지막 업데이트: 2026-10-02

순위

최고 점수1537Muse Spark 1.2
측정한 모델97개
최근 갱신2026.10.02
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    Meta2026.08.05
    1537
  2. 2
    Google2026.09.30
    1533
  3. 3
    Moonshot AI2026.07.17
    1512
  4. 4
    OpenAI2026.09.29
    1511
  5. 5
    Anthropic2026.06.09
    1511
  6. 6
    Anthropic2026.02.04
    1506
  7. 7
    Meta2026.09.02
    1504
  8. 8
    Anthropic2026.07.24
    1503
  9. 9
    Meta2026.04.08
    1501
  10. 10
    Google2026.02.19
    1500

최근 60일 내 출시된 AI 37개 중 18개는 아직 이 지표에 반영되지 않았습니다 · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions 외 15개

출처: Arena Intelligence 데이터 출처·게재 중단 요청

점수 해석 시 유의사항

  • 선호 투표 기반 지표로, 정답 여부는 평가하지 않습니다. 오답이라도 설명이 충실하면 높은 평가를 받을 수 있습니다.
  • 질문의 구성은 투표 참여자에 따라 달라지므로, 실제 용도와 다른 질문이 포함될 수 있습니다.
  • '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.