研究の中心
Wan研究チームは2026年7月16日、Wan-Streamer v0.3 論文を公開しました。比較的安定した環境、主体、音響、声を「世界」、時間とともに変わる発話、行動、場面、音を「イベントストリーム」として次の変化をリアルタイム予測します。
公開された動作指標
全二重の音声・映像対話で、640×368、25 FPS、160msのストリーミング単位を報告しています。モデル側の応答遅延は約200ms、双方向ネットワークを350msと仮定した総遅延は約550msです。
注目点
従来の動画生成が完成クリップを返すのに対し、この研究は音声、表情、行動を継続的に受け取り、発話と動作で即応するキャラクターや環境を目指します。対話型キャラクター、教育、ゲーム、遠隔体験への応用が考えられます。
限界
根拠はarXivのプレプリントであり、独立した査読や商用環境での大規模測定ではありません。550msは特定のネットワーク条件を仮定し、実際の品質と遅延は場面、ハードウェア、同時利用、安全処理で変わります。