Tax Agent Bench

인용 많음높을수록 좋음

Vals AI가 만든 세무 조사 에이전트 시험으로, AI가 도구로 법령·규정·국세청 지침을 찾아 미국 법인세 중심의 실무 질문에 근거를 인용해 답합니다. 세무 전문가가 쓴 채점 기준으로 답만 채점하며, 꼭 들어가야 할 항목을 하나라도 빠뜨리면 그 문항은 0점이고, 인용한 근거가 실제 문서가 아니면 점수가 깎입니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수77.6%Claude Fable 5.1
측정한 모델55개
최근 갱신2026.10.06
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇AnthropicClaude Fable 5.177.6%
  2. 🥈GoogleGemini 4 Argon추론 강도: High76.2%
  3. 🥉AnthropicClaude Opus 575.1%
  4. #4AnthropicClaude Sonnet 5.573.4%
  5. #5Z.aiGLM 5.3추론 강도: Max73.1%
  6. #6MetaMuse Spark 1.372.4%
  7. #7xAIGrok 4.6추론 강도: High70.8%
  8. #8AnthropicClaude Opus 5.570.5%
  9. #9AnthropicClaude Fable 569.8%
  10. #10Moonshot AIKimi K3추론 강도: Max68.7%
  11. #11OpenAIGPT-5.6 Sol추론 강도: Max68.0%
  12. #12GoogleGemini 3.8 Flash추론 강도: High66.8%
  13. #13xAIGrok 4.7추론 강도: Extra High65.6%
  14. #14OpenAIGPT-5.6 Terra추론 강도: Max65.2%
  15. #15XiaomiMiMo-V2.6-Pro64.9%
  16. #16AnthropicClaude Opus 4.864.9%
  17. #17AnthropicClaude Sonnet 4.664.9%
  18. #18xAIGrok 4.5추론 강도: High64.3%
  19. #19AnthropicClaude Opus 4.763.9%
  20. #20TencentHy4 preview63.7%
  21. #21OpenAIGPT-6 Astra추론 강도: Max63.3%
  22. #22Mistral AIMistral Large 4추론 강도: High63.3%
  23. #23DeepSeekDeepSeek V4 Flash추론 강도: High62.6%
  24. #24DeepSeekDeepSeek V4.1 Flash추론 강도: High62.5%
  25. #25OpenAIGPT-6.1 Sol추론 강도: Max62.3%
  26. #26AnthropicClaude Sonnet 562.3%
  27. #27Z.aiGLM 5.3 Flash추론 강도: Max62.0%
  28. #28OpenAIGPT-5.6 Luna추론 강도: Max60.8%
  29. #29OpenAIGPT-5.5추론 강도: Extra High60.5%
  30. #30XiaomiMiMo-V2.6-Flash59.9%
  31. #31OpenAIGPT-6 Luna추론 강도: Max58.9%
  32. #32DeepSeekDeepSeek V4 Pro추론 강도: Max58.7%
  33. #33GoogleGemini 3.7 Flash추론 강도: High57.7%
  34. #34MetaMuse Spark 1.2추론 강도: Extra High56.9%
  35. #35GoogleGemini 3.5 Flash추론 강도: High53.5%
  36. #36OpenAIGPT-6 Sol추론 강도: Max53.0%
  37. #37GoogleGemini 3.6 Flash추론 강도: High49.9%
  38. #38MiniMaxMiniMax M349.7%
  39. #39AlibabaQwen3.7 Max47.4%
  40. #40Moonshot AIKimi K2.645.1%
  41. #41AlibabaQwen3.7 Plus38.7%
  42. #42GoogleGemini 3.1 Pro추론 강도: High37.8%
  43. #43GoogleGemini 3 Flash추론 강도: High37.6%
  44. #44GoogleGemini 3.5 Flash-Lite추론 강도: High37.5%
  45. #45OpenAIGPT-5.4 Mini추론 강도: Extra High36.6%
  46. #46XiaomiMiMo V2.5 Pro34.8%
  47. #47xAIGrok 4.3추론 강도: High34.4%
  48. #48AlibabaQwen3.6 Plus32.8%
  49. #49xAIGrok 4.20 (Reasoning)31.2%
  50. #50XiaomiMiMo V2.529.2%
  51. #51AnthropicClaude Haiku 4.5추론 강도: Thinking28.3%
  52. #52Mistral AIMistral Medium 3.5추론 강도: High27.3%
  53. #53OpenAIGPT-5.4 Nano추론 강도: High26.6%
  54. #54MiniMaxMiniMax M2.725.4%
  55. #55GoogleGemini 3.1 Flash Lite추론 강도: High20.1%
모델 절반이 60.8% 이하최종 갱신 2026-10-07

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.