BDH-CQ, ARC-AGI 비용 기준 경신
- •BDH-CQ가 공개 ARC-AGI-1 평가 세트에서 29.5% pass@2를 기록했다
- •150M-parameter 모델은 작업당 추론 비용을 $0.0007로 산정했다고 보고했다
- •모델은 언어화된 중간 추론 없이 in-context learning과 recurrent latent reasoning을 결합했다
비요른 엥달(Björn Engdahl), 아드리안 코소프스키(Adrian Kosowski), 얀 호로프스키(Jan Chorowski), 주잔나 스타미로프스카(Zuzanna Stamirowska), 프셰미스와프 우즈난스키(Przemysław Uznański), 준린 장(Junlin Jiang), 로한 파드케(Rohan Phadke), 레미기우시 키나스(Remigiusz Kinas), 리처드 중(Richard Zhong) 연구진은 Aug 10 공개 논문에서 150M-parameter 추론 모델 BDH-CQ를 소개했다. 얀 호로프스키는 Aug 11 해당 논문을 Hugging Face Papers에 제출했으며, Hugging Face는 페이지에 이 연구를 #3 Paper of the day로 표시하고 109 upvotes를 함께 보여줬다.
BDH-CQ는 in-context learning(프롬프트 예시로 배우는 방식)과 recurrent latent reasoning(숨은 상태를 반복 계산하는 방식)을 결합한다. 논문에 따르면 추론 시점에 제시된 입력은 모델의 순환 메모리를 계속 갱신하고, 이후 모델은 고차원 latent space(많은 특징을 담은 내부 표현)에서 반복 계산으로 질의를 해결한다. 이 과정에서 중간 추론은 언어로 표현하지 않는다.
저자들은 공개 ARC-AGI-1 평가 세트에서 BDH-CQ를 평가하고, ARC와 유사한 통제 개입을 사용해 모델이 시연에서 무엇을 학습하는지, 추론한 변환을 얼마나 일관되게 적용하는지, 어떤 개념이 여전히 어려운지 시험했다. 페이지는 150M-parameter 구성이 작업당 산정 추론 비용 $0.0007로 29.5% pass@2에 도달했다고 보고했다.
저자들은 작업당 $0.0007에서 29.5% pass@2를 기록한 결과가 이전에 보고된 ARC-AGI-1 비용-정확도 Pareto frontier를 넘어섰다고 밝혔다. 논문 페이지에 따르면 이 운영 지점은 벤치마크 비용 효율성에서 새로운 state of the art를 세웠다.