HarnessEval-W, 시각 세계 모델 평가
- •HarnessEval-W는 계층형 하위 에이전트와 투명한 추론 체인으로 시각 세계 모델을 평가한다
- •연구진은 HarnessEval-W를 대표 세계 모델 18개와 평가 사례 330개에 적용했다
- •오픈소스 라이브 벤치마크는 Hugging Face Papers에서 오늘의 논문 #1에 올랐다
웨이량 천(Weiliang Chen)이 이끈 연구진과 공동저자 20명 이상은 시각 세계 모델을 평가하는 벤치마크 파이프라인 HarnessEval-W를 Hugging Face Papers에 공개했다. 이 논문은 Aug 17에 게재됐고, Aug 18에 Jialong Wu가 제출했다. 논문은 롤아웃을 판단하려면 물리, 인과관계, 세계 상태가 올바르게 변하는지 확인해야 하므로, 세계 모델 벤치마크가 단일 점수 이상을 제공해야 한다고 밝혔다.
HarnessEval-W는 LLM 생태계의 harness 패러다임을 세계 모델 벤치마킹에 맞게 바꾼 에이전트형 평가 파이프라인(AI 에이전트가 평가 작업을 맡는 방식)을 사용한다. 고정된 채점 기준을 적용하는 대신, 시스템은 각 평가 사례를 해석하고 질문을 측정 가능한 하위 문제로 나눈 뒤, 맞춤형 맥락과 진단 도구를 갖춘 전문 하위 에이전트를 만든다.
상위 에이전트는 하위 에이전트가 수집한 증거를 검증하고 이를 최종 판정으로 전환한다. 저자들은 각 평가를 투명한 증거 트리(평가 단계의 구조화된 증명)로 설명하며, 점수의 근거를 밝히고 검사하거나 검증할 수 있는 완전한 추론 체인을 제공한다고 밝혔다.
연구팀은 HarnessEval-W를 대표 세계 모델 18개와 평가 사례 330개에 적용했다. 논문은 HarnessEval-W의 판단이 인간 선호와 밀접하게 일치하면서도, 생성된 모든 롤아웃에 대해 검증 가능하고 세밀한 진단을 제공한다고 밝혔다. 저자들은 전체 파이프라인을 라이브 벤치마크로 오픈소스 공개했으며, 세계 모델이 발전함에 따라 새로운 기술과 평가 사례에 대한 커뮤니티 기여를 요청했다. Hugging Face 페이지에서 이 논문은 오늘의 논문 #1로 표시됐고 104개 추천을 받았다.