Reflection, 5010억 매개변수 Beam 발표
- •Reflection, 첫 오픈 웨이트 모델 Beam을 10월 5일 발표
- •5010억 매개변수 중 230억 사용…GB300 1만 500대 4주간 학습
- •10월 중 Apache 2.0으로 가중치 공개 예정, FP8·NVFP4 양자화 버전도 제공
미국 AI 스타트업 Reflection은 2026년 10월 5일 코딩과 추론, AI 에이전트 작업을 지원하는 첫 오픈 웨이트 모델 Beam을 발표했습니다. 전체 매개변수는 5010억 개이며, 텍스트를 처리할 때 실제로 사용하는 활성 매개변수는 230억 개입니다. 일부 이용자에게 먼저 제공하고 있으며, 학습된 매개변수인 가중치는 10월 중 Apache 2.0 라이선스로 공개할 예정입니다.
Beam은 입력에 따라 여러 전문 구성 요소 중 일부를 선택하는 전문가 혼합 구조를 채택해, 각 토큰 처리에 전체 5010억 개가 아닌 230억 개의 매개변수를 사용합니다. Reflection은 모델을 처음부터 사전 학습한 뒤 강화학습으로 추론과 도구 사용 능력을 높였습니다. 공개 점수는 장기 소프트웨어 개발 평가인 DeepSWE v1.1에서 44.4, 터미널 작업 평가인 Terminal Bench v2.1에서 80.1이었습니다. GLM 5.2는 같은 순서로 44.0과 81.0을 기록했고, Qwen 3.8-Max는 51.0과 86.6으로 두 평가 모두 Beam을 앞섰습니다.
Reflection에 따르면 Beam은 고급 추론 평가에서 GLM 5.2와 비슷한 점수를 추론 연산량을 약 3분의 1에서 4분의 1만 사용해 달성했습니다. 연산량은 처리에 투입한 매개변수 수와 추론 과정 및 최종 답변의 길이로 추정했으며, 입력 처리, 긴 문맥을 다루는 계산, 서비스 운영 부담은 포함하지 않았습니다. 이는 실제 이용 요금이나 응답 속도를 직접 비교한 결과는 아닙니다. 이용자는 과제에 맞춰 추론 연산량을 조절할 수 있으며, 낮은 설정에서는 짧게, 높은 설정에서는 어려운 과제에 더 긴 추론을 적용합니다.
사전 학습에는 23.8조 토큰을 사용했습니다. 웹 자료와 공개 자료, 라이선스를 취득한 데이터를 선별해 코드, 기술 문서, 수학·과학 지식을 학습시켰습니다. 강화학습에는 NVIDIA GB300 GPU 1만 500대를 4주간 가동해 과제 시도 1억 회 이상을 생성했습니다. 코딩, 도구 사용, 과학·기술 분야 등을 위한 학습 환경 약 100만 개를 마련하고, 과제 난이도와 품질을 반복 조정했다고 밝혔습니다. Reflection은 강화학습 연산량을 늘리는 동안 DeepSWE 평가 성능이 계속 향상됐다고 설명했습니다.
Beam은 악용이나 예상 밖의 작동을 살피는 레드팀 평가와 공개 전 최종 평가를 진행하고 있습니다. Reflection은 10월 중 가중치, 기술 보고서, 성능과 제약을 담은 모델 카드, 실행·평가·추가 학습에 필요한 개발 자료를 공개할 예정입니다. 가중치에는 Apache 2.0 라이선스를 적용하며, 메모리 사용량과 연산 부담을 줄이는 FP8·NVFP4 양자화 버전도 제공할 계획입니다. 현재 사전 이용 등록을 받고 있습니다.