MedScribe
引用多め高いほど良い
Vals AIが作った医療記録作成の試験で、AIが医師と患者の診察の会話記録を読み、標準形式(SOAP)の診療記録を書きます。記録の専門家・医療者が作った採点基準100個でAIの審査員が採点し、上位モデルは約90%に集中していて差は小さいです。スコアは0〜100%です。高いほど良い結果です。
最高スコア91.4%Claude Opus 5.5
測定したモデル73件
最終更新2026.10.06
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
多くの人に最も好まれる文章・文学の回答をするAIは?Arena Writing, Literature & Language
Gemini 4 Argon🥇
Gemini 4 Argon🥇会話が長くなったとき、多くの人に最も好まれるAIは?Arena Multi-turn
Gemini 4 Argon🥇
Gemini 4 Argon🥇形式や長さなどの細かい条件を、漏れなく守れる?IFBench
Grok 4.3🥇
Grok 4.3🥇
- 🥇AnthropicClaude Opus 5.591.4%
- 🥈AnthropicClaude Fable 5.191.3%
- 🥉AnthropicClaude Sonnet 5.591.1%
- #4AnthropicClaude Opus 591.0%
- #5MetaMuse Spark 1.2推論強度: Extra High90.1%
- #6xAIGrok 4.7推論強度: Extra High89.4%
- #7Z.aiGLM 5.3 Flash推論強度: Max88.9%
- #8MetaMuse Spark 1.1推論強度: Extra High88.9%
- #9Z.aiGLM 5.3推論強度: Max88.8%
- #10AnthropicClaude Fable 588.5%
- #11XiaomiMiMo-V2.6-Pro88.3%
- #12Moonshot AIKimi K3推論強度: Max88.0%
- #13OpenAIGPT-6 Astra推論強度: Max87.9%
- #14GoogleGemini 4 Argon推論強度: High87.4%
- #15MiniMaxMiniMax M387.3%
- #16xAIGrok 4.5推論強度: High86.9%
- #17OpenAIGPT-5.5推論強度: Extra High86.9%
- #18AnthropicClaude Opus 4.686.7%
- #19xAIGrok 4.6推論強度: High86.5%
- #20OpenAIGPT-6.1 Sol推論強度: Max86.5%
- #21MetaMuse Spark85.9%
- #22AnthropicClaude Opus 4.885.8%
- #23DeepSeekDeepSeek V4.1 Flash推論強度: High85.5%
- #24AnthropicClaude Opus 4.5推論強度: Thinking85.3%
- #25XiaomiMiMo-V2.6-Flash85.3%
- #26OpenAIGPT-5.6 Sol推論強度: Max85.2%
- #27AnthropicClaude Haiku 4.5推論強度: Thinking85.2%
- #28AnthropicClaude Sonnet 4.584.5%
- #29GoogleGemini 3.8 Flash推論強度: High84.5%
- #30OpenAIGPT-5.6 Luna推論強度: Max84.4%
- #31GoogleGemini 3.7 Flash推論強度: High83.9%
- #32XiaomiMiMo V2.5 Pro83.7%
- #33OpenAIGPT-6 Luna推論強度: Max83.7%
- #34OpenAIGPT-5推論強度: High83.7%
- #35TencentHy4 preview83.6%
- #36Z.aiGLM 5.283.5%
- #37GoogleGemini 2.5 Flash推論強度: Thinking83.0%
- #38AnthropicClaude Opus 4.783.0%
- #39OpenAIGPT-5.6 Terra推論強度: Extra High82.9%
- #40OpenAIGPT-6 Sol推論強度: Max82.0%
- #41OpenAIGPT-5 Mini推論強度: High80.6%
- #42Mistral AIMistral Large 4推論強度: High80.4%
- #43DeepSeekDeepSeek V4 Flash推論強度: High80.4%
- #44DeepSeekDeepSeek V4 Pro推論強度: Max80.2%
- #45MiniMaxMiniMax M2.779.9%
- #46GoogleGemini 3.6 Flash推論強度: High79.7%
- #47AlibabaQwen3.7 Max79.4%
- #48xAIGrok 4.1 Fast (Reasoning)78.7%
- #49Moonshot AIKimi K2.678.1%
- #50OpenAIGPT-5.4推論強度: Extra High77.5%
- #51xAIGrok 4.1 Fast77.5%
- #52OpenAIGPT-5.4 Nano推論強度: High77.1%
- #53AlibabaQwen3.6 Plus77.0%
- #54GoogleGemini 3.5 Flash推論強度: High76.6%
- #55Moonshot AIKimi K2.5推論強度: Thinking76.4%
- #56GoogleGemini 3.1 Pro推論強度: High76.1%
- #57AnthropicClaude Sonnet 576.1%
- #58GoogleGemini 2.5 Flash Lite75.8%
- #59xAIGrok 4.374.4%
- #60AnthropicClaude Opus 4.1推論強度: Thinking73.9%
- #61GoogleGemini 2.5 Pro73.6%
- #62OpenAIGPT-5 Nano推論強度: High72.9%
- #63AnthropicClaude Sonnet 472.4%
- #64Z.aiGLM-5.172.3%
- #65XiaomiMiMo V2.572.2%
- #66GoogleGemini 3.5 Flash-Lite推論強度: High70.9%
- #67GoogleGemini 3 Flash推論強度: High69.9%
- #68Mistral AIMistral Medium 3.5推論強度: High67.7%
- #69PoolsideLaguna M.165.9%
- #70GoogleGemini 3.1 Flash Lite推論強度: High63.9%
- #71xAIGrok 4.20 (Reasoning)63.4%
- #72MetaLlama 4 Maverick54.2%
- #73MetaLlama 4 Scout50.6%
上位5件が91.4%付近 · 最上位は見分けにくい · モデルの半数が83.0%以下最終更新 2026-10-07
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。