Arena Legal & Government
한 줄 요약 · 법률·정부·행정 분야의 전문가 수준 질문에서 사람들이 더 좋아한 AI
- 무엇을 측정하나요?
- 법률·정부·행정 분야 전문가 수준의 질문에서 어느 AI 의 답이 선호됐는지입니다. 예: 계약 조항 검토, 판례 비교, 규정 해석. 일반 질문이 아니라 그 일을 실제로 하는 사람이 낼 법한 질문입니다.
- 누가 어떻게 평가하나요?
- Arena Intelligence 에서 사용자가 질문을 넣으면 이름을 가린 두 AI 가 답하고, 더 나은 쪽에 투표합니다. 누적 8,200만 표 이상의 투표를 통계 모델(Bradley-Terry)로 집계해 Elo 처럼 보이는 점수로 환산하며, 이 표는 길고 화려하게 꾸민 답을 선호하는 편향을 통계로 걷어낸 '스타일 보정본' 을 공식 데이터셋에서 가져옵니다. 질문의 추론 깊이와 전문성을 AI 분류기가 판정해 전체의 약 5.5% 만 '전문가 질문' 으로 태깅하고, 이를 다시 미국 노동통계국 직업분류(SOC)에 기반한 직군으로 나눕니다(2025년 11월 신설). 이 표는 그중 '법률·정부·행정' 으로 분류된 질문만 집계합니다.
- 점수 읽는 법
- 시험 점수(정답률 %)가 아니라 대결 성적입니다. 다른 AI 와 맞붙어 선택된 확률로 계산되므로 만점이 없고, 새 AI 가 들어오면 기존 AI 의 점수도 조금씩 움직입니다. 보통 1,000~1,500 사이이며, 두 AI 의 점수 차가 100점이면 앞선 쪽이 약 64%, 200점이면 약 76% 확률로 선택된다는 뜻입니다. 정답을 맞혔는지는 세지 않아 틀린 답도 설명이 친절하면 이길 수 있으므로, 정확성이 중요한 용도라면 정답률 시험(GPQA·AIME 등)을 함께 보는 것이 좋습니다. 점수 차가 수십 점 이내면 순위가 달라도 사실상 같은 등급으로 보는 편이 안전합니다. 이 직군의 질문 수가 적어 상위권 순위가 자주 바뀌므로, 순위보다 점수대와 신뢰구간을 보는 편이 안전합니다.
마지막 업데이트: 2026-10-02
순위
최고 점수1537Muse Spark 1.2
측정한 모델97개
최근 갱신2026.10.02
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
순위모델출시일가격/1M점수
- 12026.08.05$3.501537
- 22026.09.30$81533

- 32026.07.17$111512
- 42026.09.29$81511
- 52026.06.09$401511
- 62026.02.04$201506
- 72026.09.02$3.501504
- 82026.07.24$201503
- 92026.04.08—1501
- 102026.02.19$9.501500

최근 60일 내 출시된 AI 37개 중 18개는 아직 이 지표에 반영되지 않았습니다 · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions 외 15개
출처: Arena Intelligence 데이터 출처·게재 중단 요청점수 해석 시 유의사항
- 선호 투표 기반 지표로, 정답 여부는 평가하지 않습니다. 오답이라도 설명이 충실하면 높은 평가를 받을 수 있습니다.
- 질문의 구성은 투표 참여자에 따라 달라지므로, 실제 용도와 다른 질문이 포함될 수 있습니다.
- '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.