StateM, 에이전트 런타임 정확도 개선
- •StateM은 Terminal-Bench 2.1 445회 trial에서 95.3% raw accuracy를 기록했다
- •Harness scaling은 GPT-5.5 xhigh를 92.1%로 끌어올려 83.1% reference를 넘었다
- •BusinessBench 런북은 held-out 평가에서 0.55 macro, 1.34 micro 점수 향상을 냈다
지헝 친(Ziheng Qin), 야신 루(Yaxin Lu), 장양 아틀라스 왕(Zhangyang Atlas Wang), 카이 왕(Kai Wang)은 장기 실행 에이전트를 위한 런타임 시스템 StateM을 Aug 15 공개했으며, 카이 왕은 Aug 18 이 논문을 Hugging Face에 제출했다. StateM은 모델 가중치를 바꾸는 대신 모델 주변의 harness를 확장해 에이전트 실행을 개선하려 한다. 이를 위해 durable states, phase-local context, checked transitions, recoverable runbooks, versioned procedural practices를 사용하며, 에이전트와 사용자가 이 절차를 함께 점검할 수 있게 한다.
논문은 장기 실행 에이전트가 개별 단계는 풀 수 있는 모델을 쓰더라도 실패할 수 있다고 설명한다. mutable state를 잃거나, 이전 실행에서 얻은 교훈을 재사용하지 못하거나, 알려진 절차를 건너뛰거나, 너무 일찍 멈출 수 있기 때문이다. StateM은 일부 postmortem 결과를 지속적이고 실행 가능한 precondition과 practice로 바꾸며, stateful control을 통해 학습된 통제를 명시화한다.
Terminal-Bench 2.1에서 StateM은 GPT-5.5 xhigh를 83.1% reference에서 92.1%로 높였고, 91.9%의 GPT-5.6 Sol Ultra를 앞섰다. 같은 런북은 변경 없이 GPT-5.6에도 이전됐다. GPT-5.6 Sol xhigh에서는 445회 trial 기준 95.3% raw accuracy를 기록했고, 89개 task 전체에서 최소 1회 이상 성공했다. frozen profile은 GPT-5.6 Luna를 76.7에서 85.4%로 높여 84.9% Sol xhigh reference를 넘었다.
같은 런타임, 런북 구조, golden rules를 사용했을 때 38 미만의 adaptation으로 DeepSeek-V4 Flash는 표준 timeout에서 82.7에서 88.1%로 올랐고, 88-task common core에서는 89.1%를 기록했다. 남은 latency-sensitive task만 확장한 결과는 보고된 88.8% GPT-5.6 Sol max 결과와 같았다. final-score API 사용량은 GPT reference의 574.68 대비 약 15였고, 전체 DeepSeek expenditure는 52.22였다.
BusinessBench에서는 development set 기반의 family-specific 런북이 held-out 평가에서 0.55 macro, 1.34 micro 점수 향상을 만들었다. 한편 mechanism-matched family 2개는 10.04점 개선됐다. 저자들은 task가 실행 구조를 공유할 때 구체적 규칙이 일반화된다고 밝혔으며, 코드는 github.com/henryqin1997/statem에서 공개됐다.