PostTrainBench
引用多め高いほど良い
テュービンゲンの研究者が作った試験で、AIエージェントが小さな基本言語モデル4種をGPU1枚で10時間以内に追加学習させ、数学・コード・医療など7つの試験のスコアを上げる必要があります。学習済みモデルが得たスコアの加重平均が結果です。スコアは0〜100%です。高いほど良い結果です。
最高スコア41.8%Claude Fable 5
測定したモデル11件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 1Claude Code · max2026.06.09$4041.8%
- 2Codex CLI · max2026.07.09$1636.2%
- 3Claude Code2026.07.24$2035.0%
- 4Claude Code · high2026.05.27$2033.8%
- 5Claude Code2026.07.17$1132.0%
- 6Claude Code · max2026.06.16$3.5731.7%
- 7Claude Code · xhigh2026.04.16$2028.6%
- 8Codex CLI · xhigh2026.04.23$2427.2%
- 9Cursor CLI · high2026.07.08$523.4%
- 10OpenCode2026.02.19$9.5022.0%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。