対話モデルに映像と非同期ツールを統合
Googleは9月24日、Gemini 3.8 Live with Live Avatarを公開しました。映像と音声を同時処理し、発話に同期した表情と口の動きをストリーミング生成します。会話を止めずに背景でツールを呼び出し、受付や案内などの企業用途を想定します。
一つの会話で97言語を切り替え、口形と表情を適応すると説明しています。参照画像からのブランド用アバター作成は現在、許可された企業だけです。生成音声・映像にはSynthIDが入ります。
デモは運用保証ではない
遅延分布、同時接続費用、言語別精度、障害率は未公開です。97言語が全方言で同品質とは限らず、SynthIDは権利や発言の正確性を証明しません。顔・声の同意、人への引継ぎ、重要ツール実行の承認、録画通知、保存期間を設計し、市場別に失敗率を測る必要があります。