MedScribe

引用多め高いほど良い

Vals AIが作った医療記録作成の試験で、AIが医師と患者の診察の会話記録を読み、標準形式(SOAP)の診療記録を書きます。記録の専門家・医療者が作った採点基準100個でAIの審査員が採点し、上位モデルは約90%に集中していて差は小さいです。スコアは0〜100%です。高いほど良い結果です。

最高スコア91.4%Claude Opus 5.5
測定したモデル73件
最終更新2026.10.06
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇AnthropicClaude Opus 5.591.4%
  2. 🥈AnthropicClaude Fable 5.191.3%
  3. 🥉AnthropicClaude Sonnet 5.591.1%
  4. #4AnthropicClaude Opus 591.0%
  5. #5MetaMuse Spark 1.2推論強度: Extra High90.1%
  6. #6xAIGrok 4.7推論強度: Extra High89.4%
  7. #7Z.aiGLM 5.3 Flash推論強度: Max88.9%
  8. #8MetaMuse Spark 1.1推論強度: Extra High88.9%
  9. #9Z.aiGLM 5.3推論強度: Max88.8%
  10. #10AnthropicClaude Fable 588.5%
  11. #11XiaomiMiMo-V2.6-Pro88.3%
  12. #12Moonshot AIKimi K3推論強度: Max88.0%
  13. #13OpenAIGPT-6 Astra推論強度: Max87.9%
  14. #14GoogleGemini 4 Argon推論強度: High87.4%
  15. #15MiniMaxMiniMax M387.3%
  16. #16xAIGrok 4.5推論強度: High86.9%
  17. #17OpenAIGPT-5.5推論強度: Extra High86.9%
  18. #18AnthropicClaude Opus 4.686.7%
  19. #19xAIGrok 4.6推論強度: High86.5%
  20. #20OpenAIGPT-6.1 Sol推論強度: Max86.5%
  21. #21MetaMuse Spark85.9%
  22. #22AnthropicClaude Opus 4.885.8%
  23. #23DeepSeekDeepSeek V4.1 Flash推論強度: High85.5%
  24. #24AnthropicClaude Opus 4.5推論強度: Thinking85.3%
  25. #25XiaomiMiMo-V2.6-Flash85.3%
  26. #26OpenAIGPT-5.6 Sol推論強度: Max85.2%
  27. #27AnthropicClaude Haiku 4.5推論強度: Thinking85.2%
  28. #28AnthropicClaude Sonnet 4.584.5%
  29. #29GoogleGemini 3.8 Flash推論強度: High84.5%
  30. #30OpenAIGPT-5.6 Luna推論強度: Max84.4%
  31. #31GoogleGemini 3.7 Flash推論強度: High83.9%
  32. #32XiaomiMiMo V2.5 Pro83.7%
  33. #33OpenAIGPT-6 Luna推論強度: Max83.7%
  34. #34OpenAIGPT-5推論強度: High83.7%
  35. #35TencentHy4 preview83.6%
  36. #36Z.aiGLM 5.283.5%
  37. #37GoogleGemini 2.5 Flash推論強度: Thinking83.0%
  38. #38AnthropicClaude Opus 4.783.0%
  39. #39OpenAIGPT-5.6 Terra推論強度: Extra High82.9%
  40. #40OpenAIGPT-6 Sol推論強度: Max82.0%
  41. #41OpenAIGPT-5 Mini推論強度: High80.6%
  42. #42Mistral AIMistral Large 4推論強度: High80.4%
  43. #43DeepSeekDeepSeek V4 Flash推論強度: High80.4%
  44. #44DeepSeekDeepSeek V4 Pro推論強度: Max80.2%
  45. #45MiniMaxMiniMax M2.779.9%
  46. #46GoogleGemini 3.6 Flash推論強度: High79.7%
  47. #47AlibabaQwen3.7 Max79.4%
  48. #48xAIGrok 4.1 Fast (Reasoning)78.7%
  49. #49Moonshot AIKimi K2.678.1%
  50. #50OpenAIGPT-5.4推論強度: Extra High77.5%
  51. #51xAIGrok 4.1 Fast77.5%
  52. #52OpenAIGPT-5.4 Nano推論強度: High77.1%
  53. #53AlibabaQwen3.6 Plus77.0%
  54. #54GoogleGemini 3.5 Flash推論強度: High76.6%
  55. #55Moonshot AIKimi K2.5推論強度: Thinking76.4%
  56. #56GoogleGemini 3.1 Pro推論強度: High76.1%
  57. #57AnthropicClaude Sonnet 576.1%
  58. #58GoogleGemini 2.5 Flash Lite75.8%
  59. #59xAIGrok 4.374.4%
  60. #60AnthropicClaude Opus 4.1推論強度: Thinking73.9%
  61. #61GoogleGemini 2.5 Pro73.6%
  62. #62OpenAIGPT-5 Nano推論強度: High72.9%
  63. #63AnthropicClaude Sonnet 472.4%
  64. #64Z.aiGLM-5.172.3%
  65. #65XiaomiMiMo V2.572.2%
  66. #66GoogleGemini 3.5 Flash-Lite推論強度: High70.9%
  67. #67GoogleGemini 3 Flash推論強度: High69.9%
  68. #68Mistral AIMistral Medium 3.5推論強度: High67.7%
  69. #69PoolsideLaguna M.165.9%
  70. #70GoogleGemini 3.1 Flash Lite推論強度: High63.9%
  71. #71xAIGrok 4.20 (Reasoning)63.4%
  72. #72MetaLlama 4 Maverick54.2%
  73. #73MetaLlama 4 Scout50.6%
上位5件が91.4%付近 · 最上位は見分けにくい · モデルの半数が83.0%以下最終更新 2026-10-07

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。