PostTrainBench

인용 많음높을수록 좋음

튀빙겐의 연구진이 만든 시험으로, AI 에이전트가 작은 기본 언어 모델 4종을 GPU 한 장으로 10시간 안에 추가 학습시켜 수학·코드·의료 등 7개 시험 점수를 올려야 합니다. 학습된 모델들이 얻은 점수의 가중 평균이 결과입니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수41.8%Claude Fable 5
측정한 모델11개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    Anthropic2026.06.09 · Claude Code · max
    41.8%
  2. 2
    OpenAI2026.07.09 · Codex CLI · max
    36.2%
  3. 3
    Anthropic2026.07.24 · Claude Code
    35.0%
  4. 4
    Anthropic2026.05.27 · Claude Code · high
    33.8%
  5. 5
    Moonshot AI2026.07.17 · Claude Code
    32.0%
  6. 6
    Z.ai2026.06.16 · Claude Code · max
    31.7%
  7. 7
    Anthropic2026.04.16 · Claude Code · xhigh
    28.6%
  8. 8
    OpenAI2026.04.23 · Codex CLI · xhigh
    27.2%
  9. 9
    xAI2026.07.08 · Cursor CLI · high
    23.4%
  10. 10
    Google2026.02.19 · OpenCode
    22.0%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.