Harvey's Legal Agent Benchmark

Often citedHigher is better

A legal-work agent test created by the legal-AI company Harvey and measured by Vals AI on its held-out set: using file tools, the AI works with documents, spreadsheets and slide decks to produce real legal work product. A task passes only if every one of its criteria is met, and the score is the average pass rate of two AI judges. Top models meet about 90% of individual criteria yet rarely pass a whole task. Scores run from 0 to 100%. Higher is better.

Top score25.4%Muse Spark 1.2
Models tested62
Last updated2026.10.06
Model release date (newest on the right)
Best score so farHigher on the chart is better
  1. 🥇MetaMuse Spark 1.2Reasoning effort: Extra High25.4%
  2. 🥈MetaMuse Spark 1.323.8%
  3. 🥉MetaMuse Spark 1.1Reasoning effort: Extra High20.0%
  4. #4GoogleGemini 4 ArgonReasoning effort: High19.6%
  5. #5xAIGrok 4.6Reasoning effort: High15.8%
  6. #5Mistral AIMistral Large 4Reasoning effort: High15.8%
  7. #7xAIGrok 4.5Reasoning effort: High12.9%
  8. #7Moonshot AIKimi K3Reasoning effort: Max12.9%
  9. #9xAIGrok 4.7Reasoning effort: Extra High12.5%
  10. #10XiaomiMiMo-V2.6-Flash11.3%
  11. #10AnthropicClaude Fable 511.3%
  12. #12XiaomiMiMo-V2.6-Pro10.8%
  13. #13GoogleGemini 3.8 FlashReasoning effort: High10.0%
  14. #14AnthropicClaude Opus 4.89.6%
  15. #15TencentHy4 preview9.2%
  16. #16GoogleGemini 3.7 FlashReasoning effort: High8.8%
  17. #17Z.aiGLM 5.3Reasoning effort: Max8.3%
  18. #17DeepSeekDeepSeek V4 FlashReasoning effort: High8.3%
  19. #19DeepSeekDeepSeek V4 ProReasoning effort: Max7.5%
  20. #20Z.aiGLM 5.2Reasoning effort: Max7.1%
  21. #21AnthropicClaude Fable 5.16.7%
  22. #21DeepSeekDeepSeek V4.1 FlashReasoning effort: Max6.7%
  23. #21AnthropicClaude Opus 4.76.7%
  24. #21AnthropicClaude Opus 56.7%
  25. #21Z.aiGLM 5.3 FlashReasoning effort: Max6.7%
  26. #26OpenAIGPT-6.1 SolReasoning effort: Max5.4%
  27. #26OpenAIGPT-6 AstraReasoning effort: Max5.4%
  28. #28AnthropicClaude Sonnet 55.0%
  29. #28AnthropicClaude Sonnet 4.65.0%
  30. #30MiniMaxMiniMax M34.2%
  31. #31OpenAIGPT-5.5Reasoning effort: Extra High3.8%
  32. #31AnthropicClaude Opus 5.53.8%
  33. #33GoogleGemini 3.6 FlashReasoning effort: High3.3%
  34. #34OpenAIGPT-6 LunaReasoning effort: Max2.9%
  35. #34AnthropicClaude Sonnet 5.52.9%
  36. #36GoogleGemini 3.5 FlashReasoning effort: High2.5%
  37. #36OpenAIGPT-5.6 SolReasoning effort: Max2.5%
  38. #38XiaomiMiMo V2.5 Pro2.1%
  39. #39OpenAIGPT-6 SolReasoning effort: Max1.7%
  40. #39AlibabaQwen3.7 Max1.7%
  41. #39XiaomiMiMo V2.51.7%
  42. #39Moonshot AIKimi K2.61.7%
  43. #43AlibabaQwen3.6 Plus1.3%
  44. #43OpenAIGPT-5.6 LunaReasoning effort: Max1.3%
  45. #45AnthropicClaude Haiku 4.5Reasoning effort: Thinking0.8%
  46. #45OpenAIGPT-5.6 TerraReasoning effort: Max0.8%
  47. #47NVIDIANemotron 3 Ultra0.4%
  48. #47xAIGrok 4.3Reasoning effort: High0.4%
  49. #47Mistral AIMistral Medium 3.5Reasoning effort: High0.4%
  50. #50MiniMaxMiniMax M2.70.0%
  51. #50AlibabaQwen3.7 Plus0.0%
  52. #50GoogleGemini 3.5 Flash-LiteReasoning effort: High0.0%
  53. #50GoogleGemini 3 FlashReasoning effort: High0.0%
  54. #50OpenAIGPT-5.4 NanoReasoning effort: High0.0%
  55. #50GoogleGemini 3.1 ProReasoning effort: High0.0%
  56. #50GoogleGemini 3.1 Flash LiteReasoning effort: High0.0%
  57. #50Z.aiGLM-5.10.0%
  58. #50PoolsideLaguna M.10.0%
  59. #50xAIGrok 4.20 (Reasoning)0.0%
  60. #50OpenAIGPT-5.4 MiniReasoning effort: Extra High0.0%
  61. #50Moonshot AIKimi K2.5Reasoning effort: Thinking0.0%
  62. #50OpenAIGPT-5.4Reasoning effort: Extra High0.0%
Hard test · top score 25.4% · Half of models ≤ 3.8%Last updated 2026-10-07

The "harness" is the agent program the AI used to carry out the task. The same model can score very differently depending on its harness and reasoning effort.