MedCode
Often citedHigher is better
Vals AI's medical-coding test: the AI reads de-identified hospital records (discharge summaries, progress notes and consult notes) and assigns primary and secondary diagnosis codes under the US ICD-10-CM standard. The answer key is the codes two certified professional coders assigned independently and then reconciled. Scores run from 0 to 100%. Higher is better.
Top score63.6%Claude Opus 5
Models tested72
Last updated2026.10.06
Model release date (newest on the right)
Best score so farHigher on the chart is better
Can it pull scattered facts from several long documents into one answer?Long Context Reasoning
Kimi K3🥇
Kimi K3🥇Can it read tables and reshape them as needed?LiveBench Data Analysis
GPT-6 Astra🥇
GPT-6 Astra🥇Which AI gives the business answers people prefer most?Arena Business, Management & Finance
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇AnthropicClaude Opus 563.6%
- 🥈GoogleGemini 3.1 ProReasoning effort: High59.1%
- 🥉GoogleGemini 4 ArgonReasoning effort: High58.8%
- #4AnthropicClaude Fable 556.1%
- #5GoogleGemini 3 FlashReasoning effort: High55.9%
- #6GoogleGemini 3.5 FlashReasoning effort: High55.8%
- #7AnthropicClaude Opus 4.754.9%
- #8AnthropicClaude Fable 5.153.5%
- #9GoogleGemini 3.7 FlashReasoning effort: High53.4%
- #10AnthropicClaude Opus 4.853.2%
- #11GoogleGemini 3.6 FlashReasoning effort: High53.2%
- #12AnthropicClaude Sonnet 5.552.9%
- #13MetaMuse Spark51.3%
- #14GoogleGemini 2.5 Pro50.6%
- #15AnthropicClaude Opus 5.549.8%
- #16OpenAIGPT-5Reasoning effort: High49.6%
- #17xAIGrok 4.7Reasoning effort: Extra High49.6%
- #18Moonshot AIKimi K3Reasoning effort: Max49.4%
- #19MetaMuse Spark 1.2Reasoning effort: Extra High49.3%
- #20AnthropicClaude Opus 4.5Reasoning effort: Thinking49.2%
- #21AnthropicClaude Opus 4.6Reasoning effort: Thinking49.1%
- #22OpenAIGPT-5.5Reasoning effort: Extra High49.1%
- #23OpenAIGPT-6.1 SolReasoning effort: Max48.8%
- #24OpenAIGPT-6 AstraReasoning effort: Max48.5%
- #25GoogleGemini 3.8 FlashReasoning effort: High48.1%
- #26GoogleGemini 3.1 Flash LiteReasoning effort: High47.6%
- #27AnthropicClaude Sonnet 547.5%
- #28AnthropicClaude Opus 4.1Reasoning effort: Thinking47.2%
- #29OpenAIGPT-6 SolReasoning effort: Max47.1%
- #30MiniMaxMiniMax M346.3%
- #31XiaomiMiMo-V2.6-Pro45.0%
- #32xAIGrok 4.6Reasoning effort: High44.7%
- #33OpenAIGPT-6 LunaReasoning effort: Max44.7%
- #34AnthropicClaude Sonnet 4.5Reasoning effort: Thinking44.1%
- #35OpenAIGPT-5.6 SolReasoning effort: Max44.0%
- #36GoogleGemini 3.5 Flash-LiteReasoning effort: High43.5%
- #37OpenAIGPT-5.6 TerraReasoning effort: Extra High43.4%
- #38xAIGrok 4.5Reasoning effort: High43.3%
- #39TencentHy4 preview43.2%
- #40OpenAIGPT-5 MiniReasoning effort: High43.0%
- #41Z.aiGLM 5.3Reasoning effort: Max42.9%
- #42DeepSeekDeepSeek V4 ProReasoning effort: Max42.5%
- #43OpenAIGPT-5.6 LunaReasoning effort: Max42.4%
- #44Z.aiGLM-5.141.6%
- #45DeepSeekDeepSeek V4 FlashReasoning effort: High41.4%
- #46OpenAIGPT-5.4Reasoning effort: Extra High41.3%
- #47DeepSeekDeepSeek V4.1 FlashReasoning effort: High41.2%
- #48XiaomiMiMo-V2.6-Flash41.1%
- #49OpenAIGPT-5.4 NanoReasoning effort: High41.0%
- #50Z.aiGLM 5.240.8%
- #51Mistral AIMistral Large 4Reasoning effort: High40.7%
- #52GoogleGemini 2.5 FlashReasoning effort: Thinking40.4%
- #53Moonshot AIKimi K2.640.1%
- #54Moonshot AIKimi K2.5Reasoning effort: Thinking39.3%
- #55AlibabaQwen3.7 Max38.8%
- #56NVIDIANemotron 3 Ultra38.6%
- #57xAIGrok 4.338.1%
- #58AlibabaQwen3.6 Plus36.9%
- #59MetaLlama 4 Maverick36.5%
- #60AnthropicClaude Sonnet 4Reasoning effort: Thinking35.0%
- #61MiniMaxMiniMax M2.734.4%
- #62GoogleGemini 2.5 Flash LiteReasoning effort: Thinking34.2%
- #63Mistral AIMistral Medium 3.5Reasoning effort: High33.8%
- #64AnthropicClaude Haiku 4.5Reasoning effort: Thinking32.7%
- #65XiaomiMiMo V2.5 Pro32.5%
- #66xAIGrok 4.20 (Reasoning)32.2%
- #67XiaomiMiMo V2.531.9%
- #68OpenAIGPT-5 NanoReasoning effort: High30.4%
- #69xAIGrok 4.1 Fast28.3%
- #70xAIGrok 4.1 Fast (Reasoning)28.1%
- #71MetaLlama 4 Scout23.3%
- #72PoolsideLaguna M.123.1%
Half of models ≤ 43.5%Last updated 2026-10-07
The "harness" is the agent program the AI used to carry out the task. The same model can score very differently depending on its harness and reasoning effort.