MedCode
인용 많음높을수록 좋음
Vals AI가 만든 의료 코딩 시험으로, AI가 비식별화된 입원 기록(퇴원 요약·경과 기록·협진 기록)을 읽고 미국 표준(ICD-10-CM)의 주 진단·부 진단 코드를 붙입니다. 정답은 공인 코딩 전문가 두 명이 따로 붙인 뒤 합의한 코드입니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수63.6%Claude Opus 5
측정한 모델72개
최근 갱신2026.10.06
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
긴 문서 여러 개에 흩어진 정보를 모아 답할 수 있을까?Long Context Reasoning
Kimi K3🥇
Kimi K3🥇표를 읽고 원하는 형태로 정리할 수 있을까?LiveBench Data Analysis
GPT-6 Astra🥇
GPT-6 Astra🥇대중들이 가장 선호하는 사업 관련 답변을 하는 AI는?Arena Business, Management & Finance
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇AnthropicClaude Opus 563.6%
- 🥈GoogleGemini 3.1 Pro추론 강도: High59.1%
- 🥉GoogleGemini 4 Argon추론 강도: High58.8%
- #4AnthropicClaude Fable 556.1%
- #5GoogleGemini 3 Flash추론 강도: High55.9%
- #6GoogleGemini 3.5 Flash추론 강도: High55.8%
- #7AnthropicClaude Opus 4.754.9%
- #8AnthropicClaude Fable 5.153.5%
- #9GoogleGemini 3.7 Flash추론 강도: High53.4%
- #10AnthropicClaude Opus 4.853.2%
- #11GoogleGemini 3.6 Flash추론 강도: High53.2%
- #12AnthropicClaude Sonnet 5.552.9%
- #13MetaMuse Spark51.3%
- #14GoogleGemini 2.5 Pro50.6%
- #15AnthropicClaude Opus 5.549.8%
- #16OpenAIGPT-5추론 강도: High49.6%
- #17xAIGrok 4.7추론 강도: Extra High49.6%
- #18Moonshot AIKimi K3추론 강도: Max49.4%
- #19MetaMuse Spark 1.2추론 강도: Extra High49.3%
- #20AnthropicClaude Opus 4.5추론 강도: Thinking49.2%
- #21AnthropicClaude Opus 4.6추론 강도: Thinking49.1%
- #22OpenAIGPT-5.5추론 강도: Extra High49.1%
- #23OpenAIGPT-6.1 Sol추론 강도: Max48.8%
- #24OpenAIGPT-6 Astra추론 강도: Max48.5%
- #25GoogleGemini 3.8 Flash추론 강도: High48.1%
- #26GoogleGemini 3.1 Flash Lite추론 강도: High47.6%
- #27AnthropicClaude Sonnet 547.5%
- #28AnthropicClaude Opus 4.1추론 강도: Thinking47.2%
- #29OpenAIGPT-6 Sol추론 강도: Max47.1%
- #30MiniMaxMiniMax M346.3%
- #31XiaomiMiMo-V2.6-Pro45.0%
- #32xAIGrok 4.6추론 강도: High44.7%
- #33OpenAIGPT-6 Luna추론 강도: Max44.7%
- #34AnthropicClaude Sonnet 4.5추론 강도: Thinking44.1%
- #35OpenAIGPT-5.6 Sol추론 강도: Max44.0%
- #36GoogleGemini 3.5 Flash-Lite추론 강도: High43.5%
- #37OpenAIGPT-5.6 Terra추론 강도: Extra High43.4%
- #38xAIGrok 4.5추론 강도: High43.3%
- #39TencentHy4 preview43.2%
- #40OpenAIGPT-5 Mini추론 강도: High43.0%
- #41Z.aiGLM 5.3추론 강도: Max42.9%
- #42DeepSeekDeepSeek V4 Pro추론 강도: Max42.5%
- #43OpenAIGPT-5.6 Luna추론 강도: Max42.4%
- #44Z.aiGLM-5.141.6%
- #45DeepSeekDeepSeek V4 Flash추론 강도: High41.4%
- #46OpenAIGPT-5.4추론 강도: Extra High41.3%
- #47DeepSeekDeepSeek V4.1 Flash추론 강도: High41.2%
- #48XiaomiMiMo-V2.6-Flash41.1%
- #49OpenAIGPT-5.4 Nano추론 강도: High41.0%
- #50Z.aiGLM 5.240.8%
- #51Mistral AIMistral Large 4추론 강도: High40.7%
- #52GoogleGemini 2.5 Flash추론 강도: Thinking40.4%
- #53Moonshot AIKimi K2.640.1%
- #54Moonshot AIKimi K2.5추론 강도: Thinking39.3%
- #55AlibabaQwen3.7 Max38.8%
- #56NVIDIANemotron 3 Ultra38.6%
- #57xAIGrok 4.338.1%
- #58AlibabaQwen3.6 Plus36.9%
- #59MetaLlama 4 Maverick36.5%
- #60AnthropicClaude Sonnet 4추론 강도: Thinking35.0%
- #61MiniMaxMiniMax M2.734.4%
- #62GoogleGemini 2.5 Flash Lite추론 강도: Thinking34.2%
- #63Mistral AIMistral Medium 3.5추론 강도: High33.8%
- #64AnthropicClaude Haiku 4.5추론 강도: Thinking32.7%
- #65XiaomiMiMo V2.5 Pro32.5%
- #66xAIGrok 4.20 (Reasoning)32.2%
- #67XiaomiMiMo V2.531.9%
- #68OpenAIGPT-5 Nano추론 강도: High30.4%
- #69xAIGrok 4.1 Fast28.3%
- #70xAIGrok 4.1 Fast (Reasoning)28.1%
- #71MetaLlama 4 Scout23.3%
- #72PoolsideLaguna M.123.1%
모델 절반이 43.5% 이하최종 갱신 2026-10-07
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.