Harvey's Legal Agent Benchmark
인용 많음높을수록 좋음
법률 AI 회사 Harvey가 만들고 Vals AI가 비공개 세트로 측정하는 법률 업무 에이전트 시험으로, AI가 파일 도구로 계약서·엑셀·발표 자료를 다루며 실제 법률 업무 결과물을 만듭니다. 과제별 기준을 전부 충족해야 통과로 치며, 두 AI 심사위원의 통과율 평균입니다. 상위 모델도 개별 기준은 약 90%를 맞히지만 과제 전체 통과는 드뭅니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수25.4%Muse Spark 1.2
측정한 모델62개
최근 갱신2026.10.06
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
긴 문서 여러 개에 흩어진 정보를 모아 답할 수 있을까?Long Context Reasoning
Kimi K3🥇
Kimi K3🥇표를 읽고 원하는 형태로 정리할 수 있을까?LiveBench Data Analysis
GPT-6 Astra🥇
GPT-6 Astra🥇대중들이 가장 선호하는 사업 관련 답변을 하는 AI는?Arena Business, Management & Finance
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇MetaMuse Spark 1.2추론 강도: Extra High25.4%
- 🥈MetaMuse Spark 1.323.8%
- 🥉MetaMuse Spark 1.1추론 강도: Extra High20.0%
- #4GoogleGemini 4 Argon추론 강도: High19.6%
- #5xAIGrok 4.6추론 강도: High15.8%
- #5Mistral AIMistral Large 4추론 강도: High15.8%
- #7xAIGrok 4.5추론 강도: High12.9%
- #7Moonshot AIKimi K3추론 강도: Max12.9%
- #9xAIGrok 4.7추론 강도: Extra High12.5%
- #10XiaomiMiMo-V2.6-Flash11.3%
- #10AnthropicClaude Fable 511.3%
- #12XiaomiMiMo-V2.6-Pro10.8%
- #13GoogleGemini 3.8 Flash추론 강도: High10.0%
- #14AnthropicClaude Opus 4.89.6%
- #15TencentHy4 preview9.2%
- #16GoogleGemini 3.7 Flash추론 강도: High8.8%
- #17Z.aiGLM 5.3추론 강도: Max8.3%
- #17DeepSeekDeepSeek V4 Flash추론 강도: High8.3%
- #19DeepSeekDeepSeek V4 Pro추론 강도: Max7.5%
- #20Z.aiGLM 5.2추론 강도: Max7.1%
- #21AnthropicClaude Fable 5.16.7%
- #21DeepSeekDeepSeek V4.1 Flash추론 강도: Max6.7%
- #21AnthropicClaude Opus 4.76.7%
- #21AnthropicClaude Opus 56.7%
- #21Z.aiGLM 5.3 Flash추론 강도: Max6.7%
- #26OpenAIGPT-6.1 Sol추론 강도: Max5.4%
- #26OpenAIGPT-6 Astra추론 강도: Max5.4%
- #28AnthropicClaude Sonnet 55.0%
- #28AnthropicClaude Sonnet 4.65.0%
- #30MiniMaxMiniMax M34.2%
- #31OpenAIGPT-5.5추론 강도: Extra High3.8%
- #31AnthropicClaude Opus 5.53.8%
- #33GoogleGemini 3.6 Flash추론 강도: High3.3%
- #34OpenAIGPT-6 Luna추론 강도: Max2.9%
- #34AnthropicClaude Sonnet 5.52.9%
- #36GoogleGemini 3.5 Flash추론 강도: High2.5%
- #36OpenAIGPT-5.6 Sol추론 강도: Max2.5%
- #38XiaomiMiMo V2.5 Pro2.1%
- #39OpenAIGPT-6 Sol추론 강도: Max1.7%
- #39AlibabaQwen3.7 Max1.7%
- #39XiaomiMiMo V2.51.7%
- #39Moonshot AIKimi K2.61.7%
- #43AlibabaQwen3.6 Plus1.3%
- #43OpenAIGPT-5.6 Luna추론 강도: Max1.3%
- #45AnthropicClaude Haiku 4.5추론 강도: Thinking0.8%
- #45OpenAIGPT-5.6 Terra추론 강도: Max0.8%
- #47NVIDIANemotron 3 Ultra0.4%
- #47xAIGrok 4.3추론 강도: High0.4%
- #47Mistral AIMistral Medium 3.5추론 강도: High0.4%
- #50MiniMaxMiniMax M2.70.0%
- #50AlibabaQwen3.7 Plus0.0%
- #50GoogleGemini 3.5 Flash-Lite추론 강도: High0.0%
- #50GoogleGemini 3 Flash추론 강도: High0.0%
- #50OpenAIGPT-5.4 Nano추론 강도: High0.0%
- #50GoogleGemini 3.1 Pro추론 강도: High0.0%
- #50GoogleGemini 3.1 Flash Lite추론 강도: High0.0%
- #50Z.aiGLM-5.10.0%
- #50PoolsideLaguna M.10.0%
- #50xAIGrok 4.20 (Reasoning)0.0%
- #50OpenAIGPT-5.4 Mini추론 강도: Extra High0.0%
- #50Moonshot AIKimi K2.5추론 강도: Thinking0.0%
- #50OpenAIGPT-5.4추론 강도: Extra High0.0%
어려운 시험 · 최고 점수 25.4% · 모델 절반이 3.8% 이하최종 갱신 2026-10-07
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.