MedCode
引用多め高いほど良い
Vals AIが作った医療コーディングの試験で、AIが匿名化された入院記録(退院サマリー・経過記録・コンサルト記録)を読み、米国の標準(ICD-10-CM)の主診断・副診断コードを付けます。正解は、認定コーダー2人が別々に付けたうえで合意したコードです。スコアは0〜100%です。高いほど良い結果です。
最高スコア63.6%Claude Opus 5
測定したモデル72件
最終更新2026.10.06
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
複数の長い文書に散らばった情報を、まとめて答えられる?Long Context Reasoning
Kimi K3🥇
Kimi K3🥇表を読んで、求める形に整理できる?LiveBench Data Analysis
GPT-6 Astra🥇
GPT-6 Astra🥇多くの人に最も好まれるビジネスの回答をするAIは?Arena Business, Management & Finance
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇AnthropicClaude Opus 563.6%
- 🥈GoogleGemini 3.1 Pro推論強度: High59.1%
- 🥉GoogleGemini 4 Argon推論強度: High58.8%
- #4AnthropicClaude Fable 556.1%
- #5GoogleGemini 3 Flash推論強度: High55.9%
- #6GoogleGemini 3.5 Flash推論強度: High55.8%
- #7AnthropicClaude Opus 4.754.9%
- #8AnthropicClaude Fable 5.153.5%
- #9GoogleGemini 3.7 Flash推論強度: High53.4%
- #10AnthropicClaude Opus 4.853.2%
- #11GoogleGemini 3.6 Flash推論強度: High53.2%
- #12AnthropicClaude Sonnet 5.552.9%
- #13MetaMuse Spark51.3%
- #14GoogleGemini 2.5 Pro50.6%
- #15AnthropicClaude Opus 5.549.8%
- #16OpenAIGPT-5推論強度: High49.6%
- #17xAIGrok 4.7推論強度: Extra High49.6%
- #18Moonshot AIKimi K3推論強度: Max49.4%
- #19MetaMuse Spark 1.2推論強度: Extra High49.3%
- #20AnthropicClaude Opus 4.5推論強度: Thinking49.2%
- #21AnthropicClaude Opus 4.6推論強度: Thinking49.1%
- #22OpenAIGPT-5.5推論強度: Extra High49.1%
- #23OpenAIGPT-6.1 Sol推論強度: Max48.8%
- #24OpenAIGPT-6 Astra推論強度: Max48.5%
- #25GoogleGemini 3.8 Flash推論強度: High48.1%
- #26GoogleGemini 3.1 Flash Lite推論強度: High47.6%
- #27AnthropicClaude Sonnet 547.5%
- #28AnthropicClaude Opus 4.1推論強度: Thinking47.2%
- #29OpenAIGPT-6 Sol推論強度: Max47.1%
- #30MiniMaxMiniMax M346.3%
- #31XiaomiMiMo-V2.6-Pro45.0%
- #32xAIGrok 4.6推論強度: High44.7%
- #33OpenAIGPT-6 Luna推論強度: Max44.7%
- #34AnthropicClaude Sonnet 4.5推論強度: Thinking44.1%
- #35OpenAIGPT-5.6 Sol推論強度: Max44.0%
- #36GoogleGemini 3.5 Flash-Lite推論強度: High43.5%
- #37OpenAIGPT-5.6 Terra推論強度: Extra High43.4%
- #38xAIGrok 4.5推論強度: High43.3%
- #39TencentHy4 preview43.2%
- #40OpenAIGPT-5 Mini推論強度: High43.0%
- #41Z.aiGLM 5.3推論強度: Max42.9%
- #42DeepSeekDeepSeek V4 Pro推論強度: Max42.5%
- #43OpenAIGPT-5.6 Luna推論強度: Max42.4%
- #44Z.aiGLM-5.141.6%
- #45DeepSeekDeepSeek V4 Flash推論強度: High41.4%
- #46OpenAIGPT-5.4推論強度: Extra High41.3%
- #47DeepSeekDeepSeek V4.1 Flash推論強度: High41.2%
- #48XiaomiMiMo-V2.6-Flash41.1%
- #49OpenAIGPT-5.4 Nano推論強度: High41.0%
- #50Z.aiGLM 5.240.8%
- #51Mistral AIMistral Large 4推論強度: High40.7%
- #52GoogleGemini 2.5 Flash推論強度: Thinking40.4%
- #53Moonshot AIKimi K2.640.1%
- #54Moonshot AIKimi K2.5推論強度: Thinking39.3%
- #55AlibabaQwen3.7 Max38.8%
- #56NVIDIANemotron 3 Ultra38.6%
- #57xAIGrok 4.338.1%
- #58AlibabaQwen3.6 Plus36.9%
- #59MetaLlama 4 Maverick36.5%
- #60AnthropicClaude Sonnet 4推論強度: Thinking35.0%
- #61MiniMaxMiniMax M2.734.4%
- #62GoogleGemini 2.5 Flash Lite推論強度: Thinking34.2%
- #63Mistral AIMistral Medium 3.5推論強度: High33.8%
- #64AnthropicClaude Haiku 4.5推論強度: Thinking32.7%
- #65XiaomiMiMo V2.5 Pro32.5%
- #66xAIGrok 4.20 (Reasoning)32.2%
- #67XiaomiMiMo V2.531.9%
- #68OpenAIGPT-5 Nano推論強度: High30.4%
- #69xAIGrok 4.1 Fast28.3%
- #70xAIGrok 4.1 Fast (Reasoning)28.1%
- #71MetaLlama 4 Scout23.3%
- #72PoolsideLaguna M.123.1%
モデルの半数が43.5%以下最終更新 2026-10-07
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。