MedCode

Often citedHigher is better

Vals AI's medical-coding test: the AI reads de-identified hospital records (discharge summaries, progress notes and consult notes) and assigns primary and secondary diagnosis codes under the US ICD-10-CM standard. The answer key is the codes two certified professional coders assigned independently and then reconciled. Scores run from 0 to 100%. Higher is better.

Top score63.6%Claude Opus 5
Models tested72
Last updated2026.10.06
Model release date (newest on the right)
Best score so farHigher on the chart is better
  1. 🥇AnthropicClaude Opus 563.6%
  2. 🥈GoogleGemini 3.1 ProReasoning effort: High59.1%
  3. 🥉GoogleGemini 4 ArgonReasoning effort: High58.8%
  4. #4AnthropicClaude Fable 556.1%
  5. #5GoogleGemini 3 FlashReasoning effort: High55.9%
  6. #6GoogleGemini 3.5 FlashReasoning effort: High55.8%
  7. #7AnthropicClaude Opus 4.754.9%
  8. #8AnthropicClaude Fable 5.153.5%
  9. #9GoogleGemini 3.7 FlashReasoning effort: High53.4%
  10. #10AnthropicClaude Opus 4.853.2%
  11. #11GoogleGemini 3.6 FlashReasoning effort: High53.2%
  12. #12AnthropicClaude Sonnet 5.552.9%
  13. #13MetaMuse Spark51.3%
  14. #14GoogleGemini 2.5 Pro50.6%
  15. #15AnthropicClaude Opus 5.549.8%
  16. #16OpenAIGPT-5Reasoning effort: High49.6%
  17. #17xAIGrok 4.7Reasoning effort: Extra High49.6%
  18. #18Moonshot AIKimi K3Reasoning effort: Max49.4%
  19. #19MetaMuse Spark 1.2Reasoning effort: Extra High49.3%
  20. #20AnthropicClaude Opus 4.5Reasoning effort: Thinking49.2%
  21. #21AnthropicClaude Opus 4.6Reasoning effort: Thinking49.1%
  22. #22OpenAIGPT-5.5Reasoning effort: Extra High49.1%
  23. #23OpenAIGPT-6.1 SolReasoning effort: Max48.8%
  24. #24OpenAIGPT-6 AstraReasoning effort: Max48.5%
  25. #25GoogleGemini 3.8 FlashReasoning effort: High48.1%
  26. #26GoogleGemini 3.1 Flash LiteReasoning effort: High47.6%
  27. #27AnthropicClaude Sonnet 547.5%
  28. #28AnthropicClaude Opus 4.1Reasoning effort: Thinking47.2%
  29. #29OpenAIGPT-6 SolReasoning effort: Max47.1%
  30. #30MiniMaxMiniMax M346.3%
  31. #31XiaomiMiMo-V2.6-Pro45.0%
  32. #32xAIGrok 4.6Reasoning effort: High44.7%
  33. #33OpenAIGPT-6 LunaReasoning effort: Max44.7%
  34. #34AnthropicClaude Sonnet 4.5Reasoning effort: Thinking44.1%
  35. #35OpenAIGPT-5.6 SolReasoning effort: Max44.0%
  36. #36GoogleGemini 3.5 Flash-LiteReasoning effort: High43.5%
  37. #37OpenAIGPT-5.6 TerraReasoning effort: Extra High43.4%
  38. #38xAIGrok 4.5Reasoning effort: High43.3%
  39. #39TencentHy4 preview43.2%
  40. #40OpenAIGPT-5 MiniReasoning effort: High43.0%
  41. #41Z.aiGLM 5.3Reasoning effort: Max42.9%
  42. #42DeepSeekDeepSeek V4 ProReasoning effort: Max42.5%
  43. #43OpenAIGPT-5.6 LunaReasoning effort: Max42.4%
  44. #44Z.aiGLM-5.141.6%
  45. #45DeepSeekDeepSeek V4 FlashReasoning effort: High41.4%
  46. #46OpenAIGPT-5.4Reasoning effort: Extra High41.3%
  47. #47DeepSeekDeepSeek V4.1 FlashReasoning effort: High41.2%
  48. #48XiaomiMiMo-V2.6-Flash41.1%
  49. #49OpenAIGPT-5.4 NanoReasoning effort: High41.0%
  50. #50Z.aiGLM 5.240.8%
  51. #51Mistral AIMistral Large 4Reasoning effort: High40.7%
  52. #52GoogleGemini 2.5 FlashReasoning effort: Thinking40.4%
  53. #53Moonshot AIKimi K2.640.1%
  54. #54Moonshot AIKimi K2.5Reasoning effort: Thinking39.3%
  55. #55AlibabaQwen3.7 Max38.8%
  56. #56NVIDIANemotron 3 Ultra38.6%
  57. #57xAIGrok 4.338.1%
  58. #58AlibabaQwen3.6 Plus36.9%
  59. #59MetaLlama 4 Maverick36.5%
  60. #60AnthropicClaude Sonnet 4Reasoning effort: Thinking35.0%
  61. #61MiniMaxMiniMax M2.734.4%
  62. #62GoogleGemini 2.5 Flash LiteReasoning effort: Thinking34.2%
  63. #63Mistral AIMistral Medium 3.5Reasoning effort: High33.8%
  64. #64AnthropicClaude Haiku 4.5Reasoning effort: Thinking32.7%
  65. #65XiaomiMiMo V2.5 Pro32.5%
  66. #66xAIGrok 4.20 (Reasoning)32.2%
  67. #67XiaomiMiMo V2.531.9%
  68. #68OpenAIGPT-5 NanoReasoning effort: High30.4%
  69. #69xAIGrok 4.1 Fast28.3%
  70. #70xAIGrok 4.1 Fast (Reasoning)28.1%
  71. #71MetaLlama 4 Scout23.3%
  72. #72PoolsideLaguna M.123.1%
Half of models ≤ 43.5%Last updated 2026-10-07

The "harness" is the agent program the AI used to carry out the task. The same model can score very differently depending on its harness and reasoning effort.