AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

Ai2, 3D 동작 예측 모델 'MolmoMotion' 공개

Ai2, 3D 동작 예측 모델 'MolmoMotion' 공개

HuggingFace Blog·2026년 6월 18일 (목)
  • •Ai2가 비디오 프레임과 언어 지침을 바탕으로 3D 객체의 움직임을 예측하는 MolmoMotion을 공개했다.
  • •모델 학습을 위한 116만 개의 비디오 데이터셋과 정확도 측정을 위한 2700개의 클립 벤치마크가 포함됐다.
  • •MolmoMotion은 로봇 물체 집기 작업에서 76.3%의 성공률을 기록해 기존 Molmo 2의 56.0% 성능을 앞질렀다.
  • •Ai2가 비디오 프레임과 언어 지침을 바탕으로 3D 객체의 움직임을 예측하는 MolmoMotion을 공개했다.
  • •모델 학습을 위한 116만 개의 비디오 데이터셋과 정확도 측정을 위한 2700개의 클립 벤치마크가 포함됐다.
  • •MolmoMotion은 로봇 물체 집기 작업에서 76.3%의 성공률을 기록해 기존 Molmo 2의 56.0% 성능을 앞질렀다.

앨런 인공지능 연구소(Allen Institute for AI, Ai2)가 2026년 6월 17일, 시각 정보와 언어 지침을 결합해 미래의 3D 동작을 예측하는 새로운 모델인 MolmoMotion을 발표했다. 기존 컴퓨터 비전 시스템이 영상 내 과거 움직임을 인식하는 데 치중했다면, MolmoMotion은 미래 움직임을 예측해 로봇 제어나 물리적으로 자연스러운 영상 생성 분야에 활용된다. 모델은 영상 프레임과 객체의 3D 좌표, 텍스트 지침을 입력받아 미래 경로를 출력하는 방식이다.

MolmoMotion은 Molmo 2 백본을 기반으로 시각적 특징과 텍스트 기반 행동 지시를 결합한다. 모델은 시간순으로 미래 좌표를 예측하는 자기회귀(Autoregressive) 방식의 MolmoMotion-AR과 미래 움직임의 불확실성을 반영하는 플로우 매칭(Flow-matching) 방식의 MolmoMotion-FM 두 가지로 제공된다. 연구팀은 736가지 동작 유형과 5600개의 객체가 포함된 116만 개의 3D 궤적 데이터셋을 구축했으며, 2700개의 영상으로 구성된 벤치마크 'PointMotionBench'도 함께 공개했다.

실험 결과 MolmoMotion은 기존 픽셀 기반 생성기나 파라메트릭 모델보다 뛰어난 성능을 보였다. 로봇 시뮬레이션 환경에서 물체 집기 작업의 성공률은 76.3%로, Molmo 2의 56.0%보다 높았다. 특히 1만 번의 학습 단계 이후 MolmoMotion은 51%의 성공률을 기록한 반면, 기존 모델은 19% 수준에 머물렀다. 실제 로봇 하드웨어 실험에서도 MolmoMotion은 약 2000번의 학습 단계 만에 목표 성능에 도달해, 기존 모델의 1만 2000번 대비 학습 속도가 비약적으로 빨랐다.

연구팀은 현재 학습 시 객체당 8개의 쿼리 포인트만 사용해 복잡한 표면 변형 표현에 한계가 있다고 언급했다. 그럼에도 불구하고 모델 가중치와 데이터셋, 벤치마크 도구를 공개함으로써 동작 예측 및 상호작용 지능 분야의 추가 연구를 독려하고 있다.

앨런 인공지능 연구소(Allen Institute for AI, Ai2)가 2026년 6월 17일, 시각 정보와 언어 지침을 결합해 미래의 3D 동작을 예측하는 새로운 모델인 MolmoMotion을 발표했다. 기존 컴퓨터 비전 시스템이 영상 내 과거 움직임을 인식하는 데 치중했다면, MolmoMotion은 미래 움직임을 예측해 로봇 제어나 물리적으로 자연스러운 영상 생성 분야에 활용된다. 모델은 영상 프레임과 객체의 3D 좌표, 텍스트 지침을 입력받아 미래 경로를 출력하는 방식이다.

MolmoMotion은 Molmo 2 백본을 기반으로 시각적 특징과 텍스트 기반 행동 지시를 결합한다. 모델은 시간순으로 미래 좌표를 예측하는 자기회귀(Autoregressive) 방식의 MolmoMotion-AR과 미래 움직임의 불확실성을 반영하는 플로우 매칭(Flow-matching) 방식의 MolmoMotion-FM 두 가지로 제공된다. 연구팀은 736가지 동작 유형과 5600개의 객체가 포함된 116만 개의 3D 궤적 데이터셋을 구축했으며, 2700개의 영상으로 구성된 벤치마크 'PointMotionBench'도 함께 공개했다.

실험 결과 MolmoMotion은 기존 픽셀 기반 생성기나 파라메트릭 모델보다 뛰어난 성능을 보였다. 로봇 시뮬레이션 환경에서 물체 집기 작업의 성공률은 76.3%로, Molmo 2의 56.0%보다 높았다. 특히 1만 번의 학습 단계 이후 MolmoMotion은 51%의 성공률을 기록한 반면, 기존 모델은 19% 수준에 머물렀다. 실제 로봇 하드웨어 실험에서도 MolmoMotion은 약 2000번의 학습 단계 만에 목표 성능에 도달해, 기존 모델의 1만 2000번 대비 학습 속도가 비약적으로 빨랐다.

연구팀은 현재 학습 시 객체당 8개의 쿼리 포인트만 사용해 복잡한 표면 변형 표현에 한계가 있다고 언급했다. 그럼에도 불구하고 모델 가중치와 데이터셋, 벤치마크 도구를 공개함으로써 동작 예측 및 상호작용 지능 분야의 추가 연구를 독려하고 있다.

원문 보기 (영어)·2026년 6월 17일
#motion forecasting#robotics#3d vision#molmomotion#allen institute for ai#video generation