Tax Agent Bench
인용 많음높을수록 좋음
Vals AI가 만든 세무 조사 에이전트 시험으로, AI가 도구로 법령·규정·국세청 지침을 찾아 미국 법인세 중심의 실무 질문에 근거를 인용해 답합니다. 세무 전문가가 쓴 채점 기준으로 답만 채점하며, 꼭 들어가야 할 항목을 하나라도 빠뜨리면 그 문항은 0점이고, 인용한 근거가 실제 문서가 아니면 점수가 깎입니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수77.6%Claude Fable 5.1
측정한 모델55개
최근 갱신2026.10.06
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
긴 문서 여러 개에 흩어진 정보를 모아 답할 수 있을까?Long Context Reasoning
Kimi K3🥇
Kimi K3🥇표를 읽고 원하는 형태로 정리할 수 있을까?LiveBench Data Analysis
GPT-6 Astra🥇
GPT-6 Astra🥇대중들이 가장 선호하는 사업 관련 답변을 하는 AI는?Arena Business, Management & Finance
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇AnthropicClaude Fable 5.177.6%
- 🥈GoogleGemini 4 Argon추론 강도: High76.2%
- 🥉AnthropicClaude Opus 575.1%
- #4AnthropicClaude Sonnet 5.573.4%
- #5Z.aiGLM 5.3추론 강도: Max73.1%
- #6MetaMuse Spark 1.372.4%
- #7xAIGrok 4.6추론 강도: High70.8%
- #8AnthropicClaude Opus 5.570.5%
- #9AnthropicClaude Fable 569.8%
- #10Moonshot AIKimi K3추론 강도: Max68.7%
- #11OpenAIGPT-5.6 Sol추론 강도: Max68.0%
- #12GoogleGemini 3.8 Flash추론 강도: High66.8%
- #13xAIGrok 4.7추론 강도: Extra High65.6%
- #14OpenAIGPT-5.6 Terra추론 강도: Max65.2%
- #15XiaomiMiMo-V2.6-Pro64.9%
- #16AnthropicClaude Opus 4.864.9%
- #17AnthropicClaude Sonnet 4.664.9%
- #18xAIGrok 4.5추론 강도: High64.3%
- #19AnthropicClaude Opus 4.763.9%
- #20TencentHy4 preview63.7%
- #21OpenAIGPT-6 Astra추론 강도: Max63.3%
- #22Mistral AIMistral Large 4추론 강도: High63.3%
- #23DeepSeekDeepSeek V4 Flash추론 강도: High62.6%
- #24DeepSeekDeepSeek V4.1 Flash추론 강도: High62.5%
- #25OpenAIGPT-6.1 Sol추론 강도: Max62.3%
- #26AnthropicClaude Sonnet 562.3%
- #27Z.aiGLM 5.3 Flash추론 강도: Max62.0%
- #28OpenAIGPT-5.6 Luna추론 강도: Max60.8%
- #29OpenAIGPT-5.5추론 강도: Extra High60.5%
- #30XiaomiMiMo-V2.6-Flash59.9%
- #31OpenAIGPT-6 Luna추론 강도: Max58.9%
- #32DeepSeekDeepSeek V4 Pro추론 강도: Max58.7%
- #33GoogleGemini 3.7 Flash추론 강도: High57.7%
- #34MetaMuse Spark 1.2추론 강도: Extra High56.9%
- #35GoogleGemini 3.5 Flash추론 강도: High53.5%
- #36OpenAIGPT-6 Sol추론 강도: Max53.0%
- #37GoogleGemini 3.6 Flash추론 강도: High49.9%
- #38MiniMaxMiniMax M349.7%
- #39AlibabaQwen3.7 Max47.4%
- #40Moonshot AIKimi K2.645.1%
- #41AlibabaQwen3.7 Plus38.7%
- #42GoogleGemini 3.1 Pro추론 강도: High37.8%
- #43GoogleGemini 3 Flash추론 강도: High37.6%
- #44GoogleGemini 3.5 Flash-Lite추론 강도: High37.5%
- #45OpenAIGPT-5.4 Mini추론 강도: Extra High36.6%
- #46XiaomiMiMo V2.5 Pro34.8%
- #47xAIGrok 4.3추론 강도: High34.4%
- #48AlibabaQwen3.6 Plus32.8%
- #49xAIGrok 4.20 (Reasoning)31.2%
- #50XiaomiMiMo V2.529.2%
- #51AnthropicClaude Haiku 4.5추론 강도: Thinking28.3%
- #52Mistral AIMistral Medium 3.5추론 강도: High27.3%
- #53OpenAIGPT-5.4 Nano추론 강도: High26.6%
- #54MiniMaxMiniMax M2.725.4%
- #55GoogleGemini 3.1 Flash Lite추론 강도: High20.1%
모델 절반이 60.8% 이하최종 갱신 2026-10-07
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.