PostTrainBench
인용 많음높을수록 좋음
튀빙겐의 연구진이 만든 시험으로, AI 에이전트가 작은 기본 언어 모델 4종을 GPU 한 장으로 10시간 안에 추가 학습시켜 수학·코드·의료 등 7개 시험 점수를 올려야 합니다. 학습된 모델들이 얻은 점수의 가중 평균이 결과입니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수41.8%Claude Fable 5
측정한 모델11개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
순위모델실행 조건출시일가격/1M점수
- 1Claude Code · max2026.06.09$4041.8%
- 2Codex CLI · max2026.07.09$1636.2%
- 3Claude Code2026.07.24$2035.0%
- 4Claude Code · high2026.05.27$2033.8%
- 5Claude Code2026.07.17$1132.0%
- 6Claude Code · max2026.06.16$3.5731.7%
- 7Claude Code · xhigh2026.04.16$2028.6%
- 8Codex CLI · xhigh2026.04.23$2427.2%
- 9Cursor CLI · high2026.07.08$523.4%
- 10OpenCode2026.02.19$9.5022.0%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.