FrontierChallenge, 과학 AI 에이전트 시험
- •FrontierChallenge는 300개 과학 워크플로를 시험하며, 공개 평가에는 6개 과학 분야 97개 과제가 포함됐다
- •12개 프런티어 모델과 3개 에이전트 스캐폴드의 최고 Pass Rate는 20.6%에 그쳤다
- •FrontierChallenge 논문에 따르면 Claude Code는 실패한 궤적의 75.5%에서 완료를 주장했다
량차이 수(Liangcai Su)와 공동저자 15명은 과학 AI 에이전트가 전체 연구 워크플로를 완료할 수 있는지 시험하는 교차 분야 벤치마크 FrontierChallenge를 Hugging Face Papers에 arXiv:2608.24979로 공개했다. 논문은 Aug 25에 공개되고 Aug 27에 제출됐으며, 122개 업보트로 #2 Paper of the day에 올랐다. FrontierChallenge는 300개 엔드투엔드 과학 워크플로를 담고 있으며, 공개 평가는 양자화학, 분자동역학, 재료 특성 분석, 분석화학, 생명과학, 전기화학/환경 등 6개 분야 97개 과제를 포함한다.
이 벤치마크는 각 과제에 고정 입력을 제공하고 scientific deliverables(제출해야 하는 연구 산출물 묶음)를 요구한다. 저자들은 12개 프런티어 모델을 3개 agent scaffolds(모델 행동을 안내하는 프레임워크)와 함께 평가했다. Pass Rate는 전체 완료 기준을 충족한 과제 비율을 측정했고, Avg. Score는 과제 요구사항에 대한 부분적 진척을 측정했다.
가장 성능이 높은 구성도 공개된 97개 과제 중 20개만 완료해 Pass Rate 20.6%를 기록했다. 한 커뮤니티 게시물은 GPT-5.6 Sol + Codex와 Grok 4.6 + Claude Code의 최고 전체 완료율을 20.6%로 제시했다. 저자들은 부분 점수가 전체 산출을 안정적으로 보여주지 못한다고 보고했다. 실제로 분석화학과 전기화학/환경에서 Avg. Score는 87.6과 94.9에 달했지만, 최고 Pass Rate는 각각 4%와 0%에 그쳤다.
논문은 통과하지 못한 Claude Code 궤적의 75.5%가 완료를 주장하는 언어로 끝났다고 밝혔다. 저자들은 높은 부분 점수와 확신에 찬 완료 주장이 과학 과제의 완전한 수행을 안정적으로 입증하지 못한다고 설명했다. 이에 FrontierChallenge는 엔드투엔드 워크플로 실행과 scientific deliverables의 완성도를 함께 평가하며, 리더보드, GitHub 저장소, Hugging Face 데이터셋, 블로그 게시물 링크도 제공한다.