Black Forest Labs, 로봇 제어용 FLUX 3 공개
- •Black Forest Labs와 mimic이 로봇 제어용 영상-행동 모델인 FLUX-mimic을 공동 출시했다.
- •FLUX 3는 이미지, 영상, 음성 및 로봇 행동 예측을 단일 백본으로 통합 처리하는 모델이다.
- •해당 모델은 Audi 생산 라인에서 테스트를 거쳤으며, 101ms의 반응 속도를 기록했다.
Black Forest Labs(BFL)가 2026년 7월 23일, 시청각 콘텐츠 생성은 물론 물리적 로봇을 제어할 수 있는 멀티모달 기반 모델 FLUX 3를 발표했다. 특히 로봇 공학 기업 mimic과 협력해 개발한 FLUX-mimic은 Audi 생산 라인에 도입되어 성능 검증을 마쳤다. FLUX 3는 이미지, 영상, 음성 데이터를 통합 학습하며, 전체 연산 비용의 95% 이상을 영상 예측에 할당한다. 또한 오디오 예측은 720p 영상 토큰 데이터의 0.5% 미만을 차지하며, 행동 예측은 영상에 담긴 물리적 현실과 연동된 모달리티로 취급된다.
학습 초기 단계에서는 행동 예측 도입으로 인해 텍스트-영상 및 이미지-영상 생성 품질이 최대 10% 저하되는 현상이 나타났다. 그러나 3500번의 학습 단계를 거치며 모델은 본래의 품질을 회복함과 동시에 행동 예측 능력을 확보했다. FLUX-mimic은 FLUX 3 백본의 중간 특성을 활용하는 경량 행동 디코더를 사용한다. 이 구조는 생성과 표현 학습을 통합하여 고품질의 세계 모델을 구축하는 프레임워크인 Self-Flow를 기반으로 설계되었다.
벤치마크 결과, FLUX-mimic의 행동 디코더는 기존 비전-언어-행동 모델들의 성능을 상회하며 백본 미세 조정 시 최고 수준의 성공률을 달성했다. 일부 실험에서는 Self-Flow를 통해 기존 모델 대비 절반의 학습 단계만으로도 높은 효율성을 보였다. 실제 공장 현장에서 이 시스템은 키팅(부품 조립 준비), 전자 제어 장치 삽입, 씰 및 케이블과 같은 유연한 소재 조작 작업을 수행한다. FLUX-mimic 백본은 NVIDIA RTX 5090 GPU 상에서 80ms 이내에 세계 표현을 생성하도록 최적화되었다. 최적화된 배포 스택과 결합된 이 시스템의 총 반응 시간은 101ms로, 이는 인간의 시각적 반응 속도와 유사한 수준이다. 현재 Audi는 기존 자동화 기술로 해결하기 어려웠던 유연한 물체 조작 작업에 이 로봇을 투입하여 테스트하고 있다.