새 연구의 핵심
Wan 연구진은 2026년 7월 16일 Wan-Streamer v0.3 논문을 공개했습니다. 영상의 비교적 안정적인 환경·주체·음향·목소리를 ‘월드’로, 시간에 따라 바뀌는 말·행동·소리를 ‘이벤트 스트림’으로 나눠 다음 변화를 실시간 예측하는 방식입니다.
공개된 작동 지표
논문은 전이중 오디오·영상 상호작용에서 640×368 해상도, 초당 25프레임, 160ms 스트리밍 단위를 유지한다고 보고합니다. 모델 측 응답 지연은 약 200ms이며, 왕복 네트워크에 350ms를 가정하면 전체 상호작용 지연은 약 550ms입니다.
왜 중요한가
기존 영상 생성은 요청 뒤 완성된 클립을 내놓는 방식이 일반적입니다. 이 연구는 사용자의 음성·표정·행동을 계속 받아 가상 인물이 말과 동작으로 즉시 반응하는 인터랙티브 캐릭터, 교육, 게임과 원격 경험을 겨냥합니다.
확인할 한계
현재 근거는 arXiv 사전 공개 논문이며 독립 동료평가나 상용 서비스의 대규모 지연 측정이 아닙니다. 550ms 수치는 특정 네트워크 예산을 가정한 결과이고, 실제 품질은 장면 복잡도·하드웨어·동시 사용자·안전 필터에 따라 달라질 수 있습니다.