谷歌 Gemini 3.8 Live 虚拟人上线:实时唇形同步 + 自然表情,无缝切换 97 种语言
谷歌在推出Gemini 3.8 Live一周后,于9月25日宣布正式上线集成Live Avatar功能的版本,为原生实时对话模型带来接近即时响应的视觉展示能力。
这一功能将近乎实时的视频生成与语音技术相结合,打造出能够倾听、观察并以动态视觉形象进行交流的交互体验。凭借精准的唇形同步、自然的表情以及流畅的对话轮次切换,它帮助企业拓展更具互动性的虚拟服务。相关演示视频附于下文。
对话本身天然具有多模态特性,人们通过倾听、观察、说话和面部表情进行沟通。Live Avatar将这些能力赋予企业智能代理,通过同时处理视觉和音频输入,生成更丰富的对话内容,从而带来更全面的交互体验。
除了视觉呈现,该功能还依赖Gemini的高级推理能力。通过异步工具调用,Live Avatar能在后台触发工具调用并获取数据,同时保持对话正常进行,从而在处理复杂任务时不中断对话流程。
Live Avatar支持原生多语言语音同步,能够动态调整唇形同步和表情,可在97种语言之间无缝切换,且不会降低视频保真度或导致视觉偏移。
除了预设的多样化形象库,企业还可以自定义Live Avatar。开发者可利用高质量参考图像生成完整的动画、响应灵敏的虚拟形象,同时保留参考形象的相似度、品牌风格与角色特征。目前,自定义虚拟形象仅对企业白名单用户开放。
谷歌为Live Avatar构建了严格的安全保障机制,所有AI生成内容都通过SynthID添加了隐形水印,直接嵌入音频与视频输出,以帮助识别AI生成内容,减少错误信息和归属错误问题。
目前,带有Live Avatar的Gemini 3.8 Live已在Gemini Enterprise上线,用户可通过官方文档探索API并开始使用。