Harvey's Legal Agent Benchmark
Often citedHigher is better
A legal-work agent test created by the legal-AI company Harvey and measured by Vals AI on its held-out set: using file tools, the AI works with documents, spreadsheets and slide decks to produce real legal work product. A task passes only if every one of its criteria is met, and the score is the average pass rate of two AI judges. Top models meet about 90% of individual criteria yet rarely pass a whole task. Scores run from 0 to 100%. Higher is better.
Top score25.4%Muse Spark 1.2
Models tested62
Last updated2026.10.06
Model release date (newest on the right)
Best score so farHigher on the chart is better
Can it pull scattered facts from several long documents into one answer?Long Context Reasoning
Kimi K3🥇
Kimi K3🥇Can it read tables and reshape them as needed?LiveBench Data Analysis
GPT-6 Astra🥇
GPT-6 Astra🥇Which AI gives the business answers people prefer most?Arena Business, Management & Finance
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇MetaMuse Spark 1.2Reasoning effort: Extra High25.4%
- 🥈MetaMuse Spark 1.323.8%
- 🥉MetaMuse Spark 1.1Reasoning effort: Extra High20.0%
- #4GoogleGemini 4 ArgonReasoning effort: High19.6%
- #5xAIGrok 4.6Reasoning effort: High15.8%
- #5Mistral AIMistral Large 4Reasoning effort: High15.8%
- #7xAIGrok 4.5Reasoning effort: High12.9%
- #7Moonshot AIKimi K3Reasoning effort: Max12.9%
- #9xAIGrok 4.7Reasoning effort: Extra High12.5%
- #10XiaomiMiMo-V2.6-Flash11.3%
- #10AnthropicClaude Fable 511.3%
- #12XiaomiMiMo-V2.6-Pro10.8%
- #13GoogleGemini 3.8 FlashReasoning effort: High10.0%
- #14AnthropicClaude Opus 4.89.6%
- #15TencentHy4 preview9.2%
- #16GoogleGemini 3.7 FlashReasoning effort: High8.8%
- #17Z.aiGLM 5.3Reasoning effort: Max8.3%
- #17DeepSeekDeepSeek V4 FlashReasoning effort: High8.3%
- #19DeepSeekDeepSeek V4 ProReasoning effort: Max7.5%
- #20Z.aiGLM 5.2Reasoning effort: Max7.1%
- #21AnthropicClaude Fable 5.16.7%
- #21DeepSeekDeepSeek V4.1 FlashReasoning effort: Max6.7%
- #21AnthropicClaude Opus 4.76.7%
- #21AnthropicClaude Opus 56.7%
- #21Z.aiGLM 5.3 FlashReasoning effort: Max6.7%
- #26OpenAIGPT-6.1 SolReasoning effort: Max5.4%
- #26OpenAIGPT-6 AstraReasoning effort: Max5.4%
- #28AnthropicClaude Sonnet 55.0%
- #28AnthropicClaude Sonnet 4.65.0%
- #30MiniMaxMiniMax M34.2%
- #31OpenAIGPT-5.5Reasoning effort: Extra High3.8%
- #31AnthropicClaude Opus 5.53.8%
- #33GoogleGemini 3.6 FlashReasoning effort: High3.3%
- #34OpenAIGPT-6 LunaReasoning effort: Max2.9%
- #34AnthropicClaude Sonnet 5.52.9%
- #36GoogleGemini 3.5 FlashReasoning effort: High2.5%
- #36OpenAIGPT-5.6 SolReasoning effort: Max2.5%
- #38XiaomiMiMo V2.5 Pro2.1%
- #39OpenAIGPT-6 SolReasoning effort: Max1.7%
- #39AlibabaQwen3.7 Max1.7%
- #39XiaomiMiMo V2.51.7%
- #39Moonshot AIKimi K2.61.7%
- #43AlibabaQwen3.6 Plus1.3%
- #43OpenAIGPT-5.6 LunaReasoning effort: Max1.3%
- #45AnthropicClaude Haiku 4.5Reasoning effort: Thinking0.8%
- #45OpenAIGPT-5.6 TerraReasoning effort: Max0.8%
- #47NVIDIANemotron 3 Ultra0.4%
- #47xAIGrok 4.3Reasoning effort: High0.4%
- #47Mistral AIMistral Medium 3.5Reasoning effort: High0.4%
- #50MiniMaxMiniMax M2.70.0%
- #50AlibabaQwen3.7 Plus0.0%
- #50GoogleGemini 3.5 Flash-LiteReasoning effort: High0.0%
- #50GoogleGemini 3 FlashReasoning effort: High0.0%
- #50OpenAIGPT-5.4 NanoReasoning effort: High0.0%
- #50GoogleGemini 3.1 ProReasoning effort: High0.0%
- #50GoogleGemini 3.1 Flash LiteReasoning effort: High0.0%
- #50Z.aiGLM-5.10.0%
- #50PoolsideLaguna M.10.0%
- #50xAIGrok 4.20 (Reasoning)0.0%
- #50OpenAIGPT-5.4 MiniReasoning effort: Extra High0.0%
- #50Moonshot AIKimi K2.5Reasoning effort: Thinking0.0%
- #50OpenAIGPT-5.4Reasoning effort: Extra High0.0%
Hard test · top score 25.4% · Half of models ≤ 3.8%Last updated 2026-10-07
The "harness" is the agent program the AI used to carry out the task. The same model can score very differently depending on its harness and reasoning effort.