Tax Agent Bench

Often citedHigher is better

Vals AI's tax-research agent test: the AI uses tools to find statutes, regulations and IRS guidance and answers practical questions, mostly on US corporate income tax, citing its sources. Only the final answer is graded, against a rubric written by tax professionals; missing any must-have element scores the question 0, and citations that do not resolve to a real document reduce the score. Scores run from 0 to 100%. Higher is better.

Top score77.6%Claude Fable 5.1
Models tested55
Last updated2026.10.06
Model release date (newest on the right)
Best score so farHigher on the chart is better
  1. 🥇AnthropicClaude Fable 5.177.6%
  2. 🥈GoogleGemini 4 ArgonReasoning effort: High76.2%
  3. 🥉AnthropicClaude Opus 575.1%
  4. #4AnthropicClaude Sonnet 5.573.4%
  5. #5Z.aiGLM 5.3Reasoning effort: Max73.1%
  6. #6MetaMuse Spark 1.372.4%
  7. #7xAIGrok 4.6Reasoning effort: High70.8%
  8. #8AnthropicClaude Opus 5.570.5%
  9. #9AnthropicClaude Fable 569.8%
  10. #10Moonshot AIKimi K3Reasoning effort: Max68.7%
  11. #11OpenAIGPT-5.6 SolReasoning effort: Max68.0%
  12. #12GoogleGemini 3.8 FlashReasoning effort: High66.8%
  13. #13xAIGrok 4.7Reasoning effort: Extra High65.6%
  14. #14OpenAIGPT-5.6 TerraReasoning effort: Max65.2%
  15. #15XiaomiMiMo-V2.6-Pro64.9%
  16. #16AnthropicClaude Opus 4.864.9%
  17. #17AnthropicClaude Sonnet 4.664.9%
  18. #18xAIGrok 4.5Reasoning effort: High64.3%
  19. #19AnthropicClaude Opus 4.763.9%
  20. #20TencentHy4 preview63.7%
  21. #21OpenAIGPT-6 AstraReasoning effort: Max63.3%
  22. #22Mistral AIMistral Large 4Reasoning effort: High63.3%
  23. #23DeepSeekDeepSeek V4 FlashReasoning effort: High62.6%
  24. #24DeepSeekDeepSeek V4.1 FlashReasoning effort: High62.5%
  25. #25OpenAIGPT-6.1 SolReasoning effort: Max62.3%
  26. #26AnthropicClaude Sonnet 562.3%
  27. #27Z.aiGLM 5.3 FlashReasoning effort: Max62.0%
  28. #28OpenAIGPT-5.6 LunaReasoning effort: Max60.8%
  29. #29OpenAIGPT-5.5Reasoning effort: Extra High60.5%
  30. #30XiaomiMiMo-V2.6-Flash59.9%
  31. #31OpenAIGPT-6 LunaReasoning effort: Max58.9%
  32. #32DeepSeekDeepSeek V4 ProReasoning effort: Max58.7%
  33. #33GoogleGemini 3.7 FlashReasoning effort: High57.7%
  34. #34MetaMuse Spark 1.2Reasoning effort: Extra High56.9%
  35. #35GoogleGemini 3.5 FlashReasoning effort: High53.5%
  36. #36OpenAIGPT-6 SolReasoning effort: Max53.0%
  37. #37GoogleGemini 3.6 FlashReasoning effort: High49.9%
  38. #38MiniMaxMiniMax M349.7%
  39. #39AlibabaQwen3.7 Max47.4%
  40. #40Moonshot AIKimi K2.645.1%
  41. #41AlibabaQwen3.7 Plus38.7%
  42. #42GoogleGemini 3.1 ProReasoning effort: High37.8%
  43. #43GoogleGemini 3 FlashReasoning effort: High37.6%
  44. #44GoogleGemini 3.5 Flash-LiteReasoning effort: High37.5%
  45. #45OpenAIGPT-5.4 MiniReasoning effort: Extra High36.6%
  46. #46XiaomiMiMo V2.5 Pro34.8%
  47. #47xAIGrok 4.3Reasoning effort: High34.4%
  48. #48AlibabaQwen3.6 Plus32.8%
  49. #49xAIGrok 4.20 (Reasoning)31.2%
  50. #50XiaomiMiMo V2.529.2%
  51. #51AnthropicClaude Haiku 4.5Reasoning effort: Thinking28.3%
  52. #52Mistral AIMistral Medium 3.5Reasoning effort: High27.3%
  53. #53OpenAIGPT-5.4 NanoReasoning effort: High26.6%
  54. #54MiniMaxMiniMax M2.725.4%
  55. #55GoogleGemini 3.1 Flash LiteReasoning effort: High20.1%
Half of models ≤ 60.8%Last updated 2026-10-07

The "harness" is the agent program the AI used to carry out the task. The same model can score very differently depending on its harness and reasoning effort.