PostTrainBench

引用多め高いほど良い

テュービンゲンの研究者が作った試験で、AIエージェントが小さな基本言語モデル4種をGPU1枚で10時間以内に追加学習させ、数学・コード・医療など7つの試験のスコアを上げる必要があります。学習済みモデルが得たスコアの加重平均が結果です。スコアは0〜100%です。高いほど良い結果です。

最高スコア41.8%Claude Fable 5
測定したモデル11件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    Anthropic2026.06.09 · Claude Code · max
    41.8%
  2. 2
    OpenAI2026.07.09 · Codex CLI · max
    36.2%
  3. 3
    Anthropic2026.07.24 · Claude Code
    35.0%
  4. 4
    Anthropic2026.05.27 · Claude Code · high
    33.8%
  5. 5
    Moonshot AI2026.07.17 · Claude Code
    32.0%
  6. 6
    Z.ai2026.06.16 · Claude Code · max
    31.7%
  7. 7
    Anthropic2026.04.16 · Claude Code · xhigh
    28.6%
  8. 8
    OpenAI2026.04.23 · Codex CLI · xhigh
    27.2%
  9. 9
    xAI2026.07.08 · Cursor CLI · high
    23.4%
  10. 10
    Google2026.02.19 · OpenCode
    22.0%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。