MedCode

인용 많음높을수록 좋음

Vals AI가 만든 의료 코딩 시험으로, AI가 비식별화된 입원 기록(퇴원 요약·경과 기록·협진 기록)을 읽고 미국 표준(ICD-10-CM)의 주 진단·부 진단 코드를 붙입니다. 정답은 공인 코딩 전문가 두 명이 따로 붙인 뒤 합의한 코드입니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수63.6%Claude Opus 5
측정한 모델72개
최근 갱신2026.10.06
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇AnthropicClaude Opus 563.6%
  2. 🥈GoogleGemini 3.1 Pro추론 강도: High59.1%
  3. 🥉GoogleGemini 4 Argon추론 강도: High58.8%
  4. #4AnthropicClaude Fable 556.1%
  5. #5GoogleGemini 3 Flash추론 강도: High55.9%
  6. #6GoogleGemini 3.5 Flash추론 강도: High55.8%
  7. #7AnthropicClaude Opus 4.754.9%
  8. #8AnthropicClaude Fable 5.153.5%
  9. #9GoogleGemini 3.7 Flash추론 강도: High53.4%
  10. #10AnthropicClaude Opus 4.853.2%
  11. #11GoogleGemini 3.6 Flash추론 강도: High53.2%
  12. #12AnthropicClaude Sonnet 5.552.9%
  13. #13MetaMuse Spark51.3%
  14. #14GoogleGemini 2.5 Pro50.6%
  15. #15AnthropicClaude Opus 5.549.8%
  16. #16OpenAIGPT-5추론 강도: High49.6%
  17. #17xAIGrok 4.7추론 강도: Extra High49.6%
  18. #18Moonshot AIKimi K3추론 강도: Max49.4%
  19. #19MetaMuse Spark 1.2추론 강도: Extra High49.3%
  20. #20AnthropicClaude Opus 4.5추론 강도: Thinking49.2%
  21. #21AnthropicClaude Opus 4.6추론 강도: Thinking49.1%
  22. #22OpenAIGPT-5.5추론 강도: Extra High49.1%
  23. #23OpenAIGPT-6.1 Sol추론 강도: Max48.8%
  24. #24OpenAIGPT-6 Astra추론 강도: Max48.5%
  25. #25GoogleGemini 3.8 Flash추론 강도: High48.1%
  26. #26GoogleGemini 3.1 Flash Lite추론 강도: High47.6%
  27. #27AnthropicClaude Sonnet 547.5%
  28. #28AnthropicClaude Opus 4.1추론 강도: Thinking47.2%
  29. #29OpenAIGPT-6 Sol추론 강도: Max47.1%
  30. #30MiniMaxMiniMax M346.3%
  31. #31XiaomiMiMo-V2.6-Pro45.0%
  32. #32xAIGrok 4.6추론 강도: High44.7%
  33. #33OpenAIGPT-6 Luna추론 강도: Max44.7%
  34. #34AnthropicClaude Sonnet 4.5추론 강도: Thinking44.1%
  35. #35OpenAIGPT-5.6 Sol추론 강도: Max44.0%
  36. #36GoogleGemini 3.5 Flash-Lite추론 강도: High43.5%
  37. #37OpenAIGPT-5.6 Terra추론 강도: Extra High43.4%
  38. #38xAIGrok 4.5추론 강도: High43.3%
  39. #39TencentHy4 preview43.2%
  40. #40OpenAIGPT-5 Mini추론 강도: High43.0%
  41. #41Z.aiGLM 5.3추론 강도: Max42.9%
  42. #42DeepSeekDeepSeek V4 Pro추론 강도: Max42.5%
  43. #43OpenAIGPT-5.6 Luna추론 강도: Max42.4%
  44. #44Z.aiGLM-5.141.6%
  45. #45DeepSeekDeepSeek V4 Flash추론 강도: High41.4%
  46. #46OpenAIGPT-5.4추론 강도: Extra High41.3%
  47. #47DeepSeekDeepSeek V4.1 Flash추론 강도: High41.2%
  48. #48XiaomiMiMo-V2.6-Flash41.1%
  49. #49OpenAIGPT-5.4 Nano추론 강도: High41.0%
  50. #50Z.aiGLM 5.240.8%
  51. #51Mistral AIMistral Large 4추론 강도: High40.7%
  52. #52GoogleGemini 2.5 Flash추론 강도: Thinking40.4%
  53. #53Moonshot AIKimi K2.640.1%
  54. #54Moonshot AIKimi K2.5추론 강도: Thinking39.3%
  55. #55AlibabaQwen3.7 Max38.8%
  56. #56NVIDIANemotron 3 Ultra38.6%
  57. #57xAIGrok 4.338.1%
  58. #58AlibabaQwen3.6 Plus36.9%
  59. #59MetaLlama 4 Maverick36.5%
  60. #60AnthropicClaude Sonnet 4추론 강도: Thinking35.0%
  61. #61MiniMaxMiniMax M2.734.4%
  62. #62GoogleGemini 2.5 Flash Lite추론 강도: Thinking34.2%
  63. #63Mistral AIMistral Medium 3.5추론 강도: High33.8%
  64. #64AnthropicClaude Haiku 4.5추론 강도: Thinking32.7%
  65. #65XiaomiMiMo V2.5 Pro32.5%
  66. #66xAIGrok 4.20 (Reasoning)32.2%
  67. #67XiaomiMiMo V2.531.9%
  68. #68OpenAIGPT-5 Nano추론 강도: High30.4%
  69. #69xAIGrok 4.1 Fast28.3%
  70. #70xAIGrok 4.1 Fast (Reasoning)28.1%
  71. #71MetaLlama 4 Scout23.3%
  72. #72PoolsideLaguna M.123.1%
모델 절반이 43.5% 이하최종 갱신 2026-10-07

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.