AI 영상은 왜 길어질수록 무너질까? 멀티에이전트 공동감독의 해법

좋은 클립을 이어 붙이는 것만으로 영화가 되지 않는 이유와, 전체 기획·시각 기억·구간 생성·질문 기반 검수로 장편 일관성을 만드는 새로운 구조를 분석합니다.

AIZIGOO 편집팀
AI 영상은 왜 길어질수록 무너질까? 멀티에이전트 공동감독의 해법

AI 영상 모델은 몇 초짜리 장면에서는 놀라울 만큼 자연스럽습니다. 하지만 여러 숏을 연결하면 같은 인물의 옷이 달라지고, 방금 놓아둔 소품이 사라지며, 되돌아온 장소의 구조가 바뀝니다. 개별 클립은 훌륭한데 이야기 전체는 서서히 무너집니다.

2026년 9월 24일 Google Research는 이 문제를 단일 영상 모델의 성능 경쟁이 아니라 전체 계획, 세계 상태, 장기 기억과 반복 검수의 문제로 다시 정의한 연구 묶음을 공개했습니다. 핵심은 영상을 한 번에 길게 생성하는 것이 아니라 감독·스토리보드·키프레임·영상·음향·검수 역할을 나누고, 결과를 다시 전체 이야기와 대조하는 것입니다.

여러 숏으로 갈수록 캐릭터와 배경의 오류가 누적되는 AI 영상

한 장면의 품질과 한 편의 일관성은 다른 문제다

선형 파이프라인은 대개 대본에서 이미지를 만들고, 이미지에서 클립을 만들고, 클립을 순서대로 연결합니다. 앞 단계의 오류가 뒤 단계 입력이 되기 때문에 작은 오해도 누적됩니다. 마지막 영상이 실패해도 어느 프롬프트가 원인이었는지 찾기 어렵습니다.

실패 유형화면에서 보이는 증상구조적 원인
정체성 드리프트얼굴·의상·체형이 숏마다 달라짐매 숏이 인물을 새로 해석
공간 드리프트문·창문·동선 위치가 바뀜장소의 지속 상태가 없음
소품 상태 오류들고 있던 물건이 사라지거나 복제됨사건 전후 상태를 추적하지 않음
서사 붕괴영상은 움직이지만 이야기가 진전되지 않음국소 장면만 최적화
연쇄 실패초기 키프레임 오류가 뒤 클립에 반복중간 검수·되돌림 지점 부족

이것은 프롬프트를 더 길게 쓰는 것만으로 해결하기 어렵습니다. 숏마다 모든 정보를 반복하면 서로 충돌하는 조건이 늘고, 중요한 고정값이 배경 설명 속에 묻힙니다. 필요한 것은 무엇을 고정하고 무엇을 변화시킬지 명시적으로 관리하는 제작 상태입니다.

네 연구는 서로 다른 병목을 맡는다

Google이 소개한 구조는 네 개의 연구를 한 제작 체계처럼 연결합니다. Co-Director와 CANVAS는 각각 COLM 2026, EMNLP 2026 게재 예정으로 소개됐고, A²RD와 VQQA는 arXiv 연구입니다. 따라서 아래 수치는 제품 보증이나 독립 재현 결과가 아니라 저자 보고값으로 봐야 합니다.

구성맡는 문제핵심 장치제작자가 얻는 교훈
Co-Director작품 전체 방향전략·서사·미학을 전역 탐색숏보다 먼저 작품 계약을 고정
CANVAS인물·장소·소품 연속성지속 시각 기억과 세계 상태캐릭터·공간·소품 장부를 분리
A²RD긴 시간의 진행과 복귀검색→생성→수정→갱신 반복새 전개와 기존 앵커 복귀를 구분
VQQA오류 발견과 재생성장면별 시각 질문과 전역 선택마지막 버전이 아닌 최선 버전을 선택

Co-Director는 작품의 의도, 이야기 방식과 시각 톤을 상위에서 선택하고 하위 제작 에이전트가 같은 방향을 따르게 합니다. 완성본을 멀티모달 심사 모델이 평가해 다음 생성 방향에 피드백합니다. 논문은 400개 가상 광고 시나리오의 GenAD-Bench에서 이 구조를 시험했습니다.

시각 기억은 레퍼런스 폴더보다 더 구체적이다

CANVAS는 등장인물, 장소와 물체를 구조화하고, 장면이 바뀌었다가 돌아와도 필요한 시각 앵커를 검색합니다. 논문은 자체 평가에서 최상 기준선 대비 배경 연속성 21.6%, 캐릭터 9.6%, 소품 7.6% 개선을 보고했습니다. 중요한 아이디어는 수치보다 상태가 시간에 따라 변한다는 점을 기록하는 방식입니다.

예를 들어 주인공의 재킷 색은 고정 속성이고, 손에 든 열쇠는 숏마다 달라질 수 있는 상태입니다. 기차역의 기둥 간격은 공간 앵커이며, 카메라 방향은 화면 축입니다. 이들을 한 장의 캐릭터 시트에 모두 섞지 않고 별도 장부로 관리해야 어느 오류를 고쳐야 하는지 알 수 있습니다.

캐릭터·장소·소품 앵커를 분리해 다음 숏으로 전달하는 시각 기억

길게 만드는 기술은 ‘계속 생성’이 아니라 ‘검색하고 갱신’하는 것

A²RD는 영상을 구간별로 만들면서 멀티모달 기억을 조회하고, 생성 결과를 검수한 뒤 다시 상태를 갱신합니다. 이야기를 앞으로 보내야 할 때는 외삽에 가까운 생성 모드를, 이미 등장한 인물과 장소에 다시 닻을 내려야 할 때는 보간에 가까운 모드를 고릅니다.

저자들은 1~10분 평가에서 기존 기준선보다 일관성 최대 30%, 서사 응집성 최대 20% 향상을 보고했습니다. 다만 이는 특정 벤치마크와 연구 설정의 결과입니다. 실제 제작에서는 모델 호출 횟수, 재생성 비용, 편집 시간과 사람이 수정한 비율까지 함께 측정해야 합니다.

기획·스토리보드·키프레임·모션·오디오가 역할별 에이전트로 연결되는 제작 구조

검수는 점수 하나가 아니라 답할 수 있는 질문이어야 한다

VQQA는 영상마다 구체적인 시각 질문을 만듭니다. “풍선이 상자 모양이면서 부풀린 재질인가?”, “컷이 바뀐 뒤에도 같은 연주자가 같은 악기를 연주하는가?”처럼 사람이 확인할 수 있는 질문으로 오류를 찾고, 답변을 프롬프트 수정 방향으로 사용합니다.

또 마지막 반복 결과를 자동 채택하지 않습니다. 국소 오류를 고치다가 원래 의도나 다른 속성을 망칠 수 있기 때문에, 전체 생성 후보를 최초 요청과 다시 비교해 가장 좋은 버전을 선택합니다. VQQA 논문은 기본 생성 대비 T2V-CompBench에서 11.57%포인트, VBench2에서 8.43%포인트의 절대 향상을 보고했습니다.

여러 생성 후보를 질문으로 검사하고 전체 의도에 가장 맞는 시퀀스를 선택하는 과정

지금 제작자가 적용할 수 있는 최소 구조

연구 시스템을 그대로 사용할 수 없어도 제작 방식은 옮길 수 있습니다.

  1. 작품 계약을 한 장으로 고정합니다. 주제, 관객, 서사 방식, 시각 톤과 금지 요소를 씁니다.
  2. 세 장부를 분리합니다. 캐릭터 정체성, 장소의 공간 구조, 소품의 현재 상태를 별도로 관리합니다.
  3. 승인된 키프레임만 앵커로 씁니다. 처음 생성된 이미지가 아니라 사람이 통과시킨 이미지만 다음 숏에 전달합니다.
  4. 숏 프롬프트는 전체 설정의 복사가 아닌 변화량으로 씁니다. 이번 숏에서 달라지는 행동·카메라·상태만 명시합니다.
  5. 숏마다 질문형 검수표를 만듭니다. 얼굴, 의상, 손, 소품, 화면 축, 공간, 행동 결과와 음향을 검사합니다.
  6. 마지막 결과 대신 후보 전체에서 선택합니다. 수정 때문에 새 오류가 생겼는지 최초 의도와 다시 대조합니다.
제작 산출물반드시 포함할 것통과 기준
작품 계약의도·서사·미학·금지 요소모든 숏이 같은 작품으로 보임
세계 상태 장부인물·장소·소품의 고정값과 변화컷 전후 상태를 설명 가능
승인 키프레임기준 얼굴·의상·공간·광원다음 생성의 신뢰 앵커
숏 변경 명세시작 상태·행동·끝 상태·카메라한 숏에 한 핵심 변화
질문형 QA장면별 예/아니오 질문과 근거 프레임실패 위치와 수정 지시가 구체적

아직 해결되지 않은 것

이 연구 묶음은 장편 영상 생성이 단일 프롬프트에서 제작 시스템으로 이동한다는 강한 신호입니다. 그러나 공개 발표만으로 실제 서비스의 비용, 처리 시간, 실패율과 편집 가능성을 판단할 수는 없습니다. 벤치마크가 인물의 미묘한 감정 연기나 문화적 맥락, 상업 제작의 법적 승인까지 대신하지도 않습니다.

등장인물의 초상권·음성권과 학습 자료의 권리를 확인하고, 생성 영상의 출처 표시와 플랫폼 정책을 지켜야 합니다. Google의 프레임워크는 Gemini와 Veo 위에서 동작하며 SynthID를 상속한다고 설명하지만, 워터마크는 권리 확인이나 사실 검증을 대신하지 않습니다. 작품의 방향, 승인 키프레임과 최종 편집은 여전히 사람이 통제해야 합니다.

결론: 다음 경쟁은 더 긴 클립이 아니라 더 좋은 제작 기억이다

장편 AI 영상의 병목은 몇 초를 더 생성하는 데 있지 않습니다. 이야기 전체의 약속을 유지하고, 등장인물과 세계의 상태를 기억하며, 오류가 생긴 지점으로 돌아가 부분적으로 고치는 능력에 있습니다.

앞으로의 영상 도구는 단일 생성 버튼보다 감독, 기억, 검수와 버전 선택을 연결하는 제작 운영체제에 가까워질 가능성이 큽니다. 지금 당장 할 수 있는 가장 현실적인 준비는 프롬프트를 길게 만드는 것이 아니라 작품 계약·상태 장부·승인 앵커·질문형 QA를 만드는 것입니다.

주요 자료

연구 결과와 제품 기능은 변경될 수 있습니다. 실제 제작에 적용하기 전 최신 논문 버전, 서비스 이용 조건, 생성물 표시와 권리 정책을 다시 확인하세요.