대화 모델에 실시간 얼굴과 도구 실행을 결합
Google은 9월 24일 Gemini 3.8 Live with Live Avatar를 공개했습니다. 사용자의 영상과 음성을 함께 처리하고, 음성 답변에 맞춘 표정·입 모양의 스트리밍 영상을 생성합니다. 대화를 끊지 않은 채 백그라운드에서 도구를 호출할 수 있어 호텔 체크인이나 안내 같은 기업용 시나리오를 겨냥합니다.
Google은 한 대화 안에서 97개 언어를 바꿔도 입 모양과 표현이 적응한다고 설명합니다. 준비된 아바타 외에 참조 이미지 한 장으로 브랜드 캐릭터를 만드는 기능도 있지만, 맞춤형 아바타 생성은 현재 기업 허용 목록에 한정됩니다. 모든 생성 오디오와 영상에는 SynthID 워터마크가 들어갑니다.
실시간 데모와 운영 서비스 사이에는 검증 항목이 많다
Google의 공개 글은 지연 분포, 동시 접속 비용, 언어별 입 모양 정확도와 장애율을 제시하지 않습니다. 97개 언어 지원은 모든 억양·방언에서 같은 품질을 보장하지 않습니다. SynthID도 합성물 식별을 돕는 신호이지, 아바타 사용 권리나 답변의 사실성을 증명하지 않습니다.
기업은 동의받은 얼굴·음성만 사용하고, 사람 상담원 전환, 도구 실행 승인, 녹화 고지와 보존 기간을 설계해야 합니다. 언어별 지연·오인식·도구 실패를 실제 트래픽에서 따로 측정해야 합니다.