Wan-Streamer v0.3、ライブ映像対話を「世界+イベント」で再設計

Wan研究チームは、持続する環境・主体を世界、発話・行動・音の変化をイベントとして扱うネイティブストリーミングモデルを公開した。

研究の中心

Wan研究チームは2026年7月16日、Wan-Streamer v0.3 論文を公開しました。比較的安定した環境、主体、音響、声を「世界」、時間とともに変わる発話、行動、場面、音を「イベントストリーム」として次の変化をリアルタイム予測します。

公開された動作指標

全二重の音声・映像対話で、640×368、25 FPS、160msのストリーミング単位を報告しています。モデル側の応答遅延は約200ms、双方向ネットワークを350msと仮定した総遅延は約550msです。

注目点

従来の動画生成が完成クリップを返すのに対し、この研究は音声、表情、行動を継続的に受け取り、発話と動作で即応するキャラクターや環境を目指します。対話型キャラクター、教育、ゲーム、遠隔体験への応用が考えられます。

限界

根拠はarXivのプレプリントであり、独立した査読や商用環境での大規模測定ではありません。550msは特定のネットワーク条件を仮定し、実際の品質と遅延は場面、ハードウェア、同時利用、安全処理で変わります。

公式情報