AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

구글, 멀티 에이전트 영상 생성 프레임워크 공개

구글, 멀티 에이전트 영상 생성 프레임워크 공개

Google Research Blog·2026년 9월 25일 (금)
  • •구글 연구진이 인물과 배경의 일관성을 유지하는 수분 길이 영상 생성 프레임워크를 소개했다
  • •Co-Director는 GenAD-Bench에서 최고 81.4점을 기록했고, CANVAS는 장면 간 인물과 소품 상태를 추적한다
  • •A²RD는 10분짜리 영상을 선보였으며, VQQA는 시각적 피드백으로 텍스트 프롬프트를 개선한다
  • •구글 연구진이 인물과 배경의 일관성을 유지하는 수분 길이 영상 생성 프레임워크를 소개했다
  • •Co-Director는 GenAD-Bench에서 최고 81.4점을 기록했고, CANVAS는 장면 간 인물과 소품 상태를 추적한다
  • •A²RD는 10분짜리 영상을 선보였으며, VQQA는 시각적 피드백으로 텍스트 프롬프트를 개선한다
  • •구글 연구진이 인물과 배경의 일관성을 유지하는 수분 길이 영상 생성 프레임워크를 소개했다
  • •Co-Director는 GenAD-Bench에서 최고 81.4점을 기록했고, CANVAS는 장면 간 인물과 소품 상태를 추적한다
  • •A²RD는 10분짜리 영상을 선보였으며, VQQA는 시각적 피드백으로 텍스트 프롬프트를 개선한다
  • •구글 연구진이 인물과 배경의 일관성을 유지하는 수분 길이 영상 생성 프레임워크를 소개했다
  • •Co-Director는 GenAD-Bench에서 최고 81.4점을 기록했고, CANVAS는 장면 간 인물과 소품 상태를 추적한다
  • •A²RD는 10분짜리 영상을 선보였으며, VQQA는 시각적 피드백으로 텍스트 프롬프트를 개선한다

Google Research 연구진인 예일 송(Yale Song)과 이원 송(Yiwen Song)은 인물과 배경이 장면마다 달라지는 문제, 연결된 AI 영상 생성 과정에서 오류가 퍼지는 문제를 줄이기 위해 수분 길이의 일관된 영상을 만드는 멀티 에이전트 프레임워크를 공개했다. 이 프레임워크는 Google의 Gemini와 Veo 모델 위에서 작동하며 Co-Director, CANVAS, A²RD, VQQA를 포함한다. 프롬프트 작성, 장면 연결, 영상 개선을 자동화하고 SynthID 워터마크를 적용한다. 연구진은 각각 안전한 장면이라도 완성 영상에서 의도치 않은 상호작용이 생겼는지 추가 안전 분류기가 확인할 수 있다고 밝혔다.

Co-Director는 여러 창작 전략 가운데 선택하는 다중 팔 밴딧 알고리즘을 사용한다. 사전 제작 에이전트가 스토리보드를 만들면 제작 에이전트들이 키프레임과 영상, 오디오를 생성한다. 멀티모달 언어 모델 심사자가 완성 영상을 평가하고, 반복 생성 과정에서 선택을 다듬도록 피드백을 보낸다. 연구진은 GenAD-Bench에서 최고 81.4점을 기록했으며 ViStoryBench에서 이야기 일관성이 개선됐다고 보고했다.

CANVAS는 인물과 장소, 사물 상태를 구조화해 기록하고 장면이 다시 등장할 때 시각 자료를 불러온다. 박물관 강도 장면 비교에서 연구진은 CANVAS가 여러 샷에 걸쳐 인물의 외모와 방 구조, 소품을 유지했지만 Gemini-3.1-Pro 단독 사용과 AutoStudio 프레임워크에서는 불일치가 나타났다고 밝혔다. CANVAS는 중간 장면 뒤에 앞선 장면이 다시 나오는 사례를 포함해 ST-Bench와 HardContinuityBench에서 평가됐다.

A²RD는 멀티모달 영상 기억을 활용해 검색, 합성, 개선, 갱신 과정을 반복하며 영상을 구간별로 만든다. 이야기를 진행하는 외삽과 다시 등장하는 인물 및 배경을 고정하는 보간을 번갈아 적용한다. 연구진은 10분 길이의 생성 영상을 공개하고 첫 장면부터 마지막 프레임까지 인물 정체성과 의상 세부 사항, 장면의 공간 구성이 유지됐다고 밝혔다. HardContinuityBench는 GPT-5.2로 만든 스토리보드를 사용해 장거리 장면 일관성을 시험한다. LVBench-C는 텍스트만으로 구성된 120개 시나리오를 담았으며, 핵심 시각 요소가 최소 10개 구간 동안 사라졌다가 돌아오도록 설계됐다.

VQQA는 프롬프트에 관한 질문을 만들고 비전-언어 모델의 비평을 자연어 지침으로 활용해 텍스트 프롬프트를 수정함으로써 영상의 시각적 문제를 찾는다. 픽셀을 직접 편집하지 않고 프롬프트를 최적화하며, 전체 평가자가 반복 생성된 영상 가운데 원래 프롬프트에 가장 부합하는 결과를 고른다. 연구진은 풍선 같은 재질로 표현된 직육면체 풍선과 장면 전환 때 연주자들의 악기가 바뀌는 문제를 수정한 사례를 보였다. GenAD-Bench는 가상 브랜드 50개의 제품을 각각 4개씩 포함한 400개 시나리오를 시험한다. 결과 부분은 CANVAS의 성능 향상도 보고하지만, 추가 수치를 제시하기 전에 끝난다.

Google Research 연구진인 예일 송(Yale Song)과 이원 송(Yiwen Song)은 인물과 배경이 장면마다 달라지는 문제, 연결된 AI 영상 생성 과정에서 오류가 퍼지는 문제를 줄이기 위해 수분 길이의 일관된 영상을 만드는 멀티 에이전트 프레임워크를 공개했다. 이 프레임워크는 Google의 Gemini와 Veo 모델 위에서 작동하며 Co-Director, CANVAS, A²RD, VQQA를 포함한다. 프롬프트 작성, 장면 연결, 영상 개선을 자동화하고 SynthID 워터마크를 적용한다. 연구진은 각각 안전한 장면이라도 완성 영상에서 의도치 않은 상호작용이 생겼는지 추가 안전 분류기가 확인할 수 있다고 밝혔다.

Co-Director는 여러 창작 전략 가운데 선택하는 다중 팔 밴딧 알고리즘을 사용한다. 사전 제작 에이전트가 스토리보드를 만들면 제작 에이전트들이 키프레임과 영상, 오디오를 생성한다. 멀티모달 언어 모델 심사자가 완성 영상을 평가하고, 반복 생성 과정에서 선택을 다듬도록 피드백을 보낸다. 연구진은 GenAD-Bench에서 최고 81.4점을 기록했으며 ViStoryBench에서 이야기 일관성이 개선됐다고 보고했다.

CANVAS는 인물과 장소, 사물 상태를 구조화해 기록하고 장면이 다시 등장할 때 시각 자료를 불러온다. 박물관 강도 장면 비교에서 연구진은 CANVAS가 여러 샷에 걸쳐 인물의 외모와 방 구조, 소품을 유지했지만 Gemini-3.1-Pro 단독 사용과 AutoStudio 프레임워크에서는 불일치가 나타났다고 밝혔다. CANVAS는 중간 장면 뒤에 앞선 장면이 다시 나오는 사례를 포함해 ST-Bench와 HardContinuityBench에서 평가됐다.

A²RD는 멀티모달 영상 기억을 활용해 검색, 합성, 개선, 갱신 과정을 반복하며 영상을 구간별로 만든다. 이야기를 진행하는 외삽과 다시 등장하는 인물 및 배경을 고정하는 보간을 번갈아 적용한다. 연구진은 10분 길이의 생성 영상을 공개하고 첫 장면부터 마지막 프레임까지 인물 정체성과 의상 세부 사항, 장면의 공간 구성이 유지됐다고 밝혔다. HardContinuityBench는 GPT-5.2로 만든 스토리보드를 사용해 장거리 장면 일관성을 시험한다. LVBench-C는 텍스트만으로 구성된 120개 시나리오를 담았으며, 핵심 시각 요소가 최소 10개 구간 동안 사라졌다가 돌아오도록 설계됐다.

VQQA는 프롬프트에 관한 질문을 만들고 비전-언어 모델의 비평을 자연어 지침으로 활용해 텍스트 프롬프트를 수정함으로써 영상의 시각적 문제를 찾는다. 픽셀을 직접 편집하지 않고 프롬프트를 최적화하며, 전체 평가자가 반복 생성된 영상 가운데 원래 프롬프트에 가장 부합하는 결과를 고른다. 연구진은 풍선 같은 재질로 표현된 직육면체 풍선과 장면 전환 때 연주자들의 악기가 바뀌는 문제를 수정한 사례를 보였다. GenAD-Bench는 가상 브랜드 50개의 제품을 각각 4개씩 포함한 400개 시나리오를 시험한다. 결과 부분은 CANVAS의 성능 향상도 보고하지만, 추가 수치를 제시하기 전에 끝난다.

원문 보기 (영어)·2026년 9월 24일
#google research#video generation#multi agent framework#co director#canvas#a2rd#vqqa#genad bench#hardcontinuitybench#synthid