MedScribe

Often citedHigher is better

Vals AI's medical-documentation test: the AI reads transcripts of doctor–patient visits and writes clinical notes in the standard SOAP format. An AI judge grades the notes against 100 rubrics built by medical scribes and clinicians; the top models are bunched around 90%, so the gaps between them are small. Scores run from 0 to 100%. Higher is better.

Top score91.4%Claude Opus 5.5
Models tested73
Last updated2026.10.06
Model release date (newest on the right)
Best score so farHigher on the chart is better
  1. 🥇AnthropicClaude Opus 5.591.4%
  2. 🥈AnthropicClaude Fable 5.191.3%
  3. 🥉AnthropicClaude Sonnet 5.591.1%
  4. #4AnthropicClaude Opus 591.0%
  5. #5MetaMuse Spark 1.2Reasoning effort: Extra High90.1%
  6. #6xAIGrok 4.7Reasoning effort: Extra High89.4%
  7. #7Z.aiGLM 5.3 FlashReasoning effort: Max88.9%
  8. #8MetaMuse Spark 1.1Reasoning effort: Extra High88.9%
  9. #9Z.aiGLM 5.3Reasoning effort: Max88.8%
  10. #10AnthropicClaude Fable 588.5%
  11. #11XiaomiMiMo-V2.6-Pro88.3%
  12. #12Moonshot AIKimi K3Reasoning effort: Max88.0%
  13. #13OpenAIGPT-6 AstraReasoning effort: Max87.9%
  14. #14GoogleGemini 4 ArgonReasoning effort: High87.4%
  15. #15MiniMaxMiniMax M387.3%
  16. #16xAIGrok 4.5Reasoning effort: High86.9%
  17. #17OpenAIGPT-5.5Reasoning effort: Extra High86.9%
  18. #18AnthropicClaude Opus 4.686.7%
  19. #19xAIGrok 4.6Reasoning effort: High86.5%
  20. #20OpenAIGPT-6.1 SolReasoning effort: Max86.5%
  21. #21MetaMuse Spark85.9%
  22. #22AnthropicClaude Opus 4.885.8%
  23. #23DeepSeekDeepSeek V4.1 FlashReasoning effort: High85.5%
  24. #24AnthropicClaude Opus 4.5Reasoning effort: Thinking85.3%
  25. #25XiaomiMiMo-V2.6-Flash85.3%
  26. #26OpenAIGPT-5.6 SolReasoning effort: Max85.2%
  27. #27AnthropicClaude Haiku 4.5Reasoning effort: Thinking85.2%
  28. #28AnthropicClaude Sonnet 4.584.5%
  29. #29GoogleGemini 3.8 FlashReasoning effort: High84.5%
  30. #30OpenAIGPT-5.6 LunaReasoning effort: Max84.4%
  31. #31GoogleGemini 3.7 FlashReasoning effort: High83.9%
  32. #32XiaomiMiMo V2.5 Pro83.7%
  33. #33OpenAIGPT-6 LunaReasoning effort: Max83.7%
  34. #34OpenAIGPT-5Reasoning effort: High83.7%
  35. #35TencentHy4 preview83.6%
  36. #36Z.aiGLM 5.283.5%
  37. #37GoogleGemini 2.5 FlashReasoning effort: Thinking83.0%
  38. #38AnthropicClaude Opus 4.783.0%
  39. #39OpenAIGPT-5.6 TerraReasoning effort: Extra High82.9%
  40. #40OpenAIGPT-6 SolReasoning effort: Max82.0%
  41. #41OpenAIGPT-5 MiniReasoning effort: High80.6%
  42. #42Mistral AIMistral Large 4Reasoning effort: High80.4%
  43. #43DeepSeekDeepSeek V4 FlashReasoning effort: High80.4%
  44. #44DeepSeekDeepSeek V4 ProReasoning effort: Max80.2%
  45. #45MiniMaxMiniMax M2.779.9%
  46. #46GoogleGemini 3.6 FlashReasoning effort: High79.7%
  47. #47AlibabaQwen3.7 Max79.4%
  48. #48xAIGrok 4.1 Fast (Reasoning)78.7%
  49. #49Moonshot AIKimi K2.678.1%
  50. #50OpenAIGPT-5.4Reasoning effort: Extra High77.5%
  51. #51xAIGrok 4.1 Fast77.5%
  52. #52OpenAIGPT-5.4 NanoReasoning effort: High77.1%
  53. #53AlibabaQwen3.6 Plus77.0%
  54. #54GoogleGemini 3.5 FlashReasoning effort: High76.6%
  55. #55Moonshot AIKimi K2.5Reasoning effort: Thinking76.4%
  56. #56GoogleGemini 3.1 ProReasoning effort: High76.1%
  57. #57AnthropicClaude Sonnet 576.1%
  58. #58GoogleGemini 2.5 Flash Lite75.8%
  59. #59xAIGrok 4.374.4%
  60. #60AnthropicClaude Opus 4.1Reasoning effort: Thinking73.9%
  61. #61GoogleGemini 2.5 Pro73.6%
  62. #62OpenAIGPT-5 NanoReasoning effort: High72.9%
  63. #63AnthropicClaude Sonnet 472.4%
  64. #64Z.aiGLM-5.172.3%
  65. #65XiaomiMiMo V2.572.2%
  66. #66GoogleGemini 3.5 Flash-LiteReasoning effort: High70.9%
  67. #67GoogleGemini 3 FlashReasoning effort: High69.9%
  68. #68Mistral AIMistral Medium 3.5Reasoning effort: High67.7%
  69. #69PoolsideLaguna M.165.9%
  70. #70GoogleGemini 3.1 Flash LiteReasoning effort: High63.9%
  71. #71xAIGrok 4.20 (Reasoning)63.4%
  72. #72MetaLlama 4 Maverick54.2%
  73. #73MetaLlama 4 Scout50.6%
Top 5 near 91.4% · hard to separate the best · Half of models ≤ 83.0%Last updated 2026-10-07

The "harness" is the agent program the AI used to carry out the task. The same model can score very differently depending on its harness and reasoning effort.