谷歌 Gemini 3.8 Live 虚拟人上线:实时唇形同步 + 自然表情,无缝切换 97 种语言
谷歌于9月25日公布,继上周推出Gemini 3.8 Live后,现已发布具备Live Avatar功能的Gemini 3.8 Live,为原生实时对话模型增添接近实时的视觉呈现能力。
该功能将近乎实时的视频生成与语音融合,能够创造倾听、观察并以动态视觉形象互动的交流体验,通过精准的唇形同步、自然的表情和流畅的对话轮次切换,助力企业拓展更具互动性的虚拟服务。IT之家附上相关视频如下:
对话本质上是多模态的,人们通过倾听、观察、说话和面部表情进行交流。Live Avatar将这些能力赋予企业智能代理,同时处理视觉和音频输入,生成更丰富的对话,带来更全面的交互体验。
除了视觉表现,该功能依托Gemini的高级推理能力。通过异步工具调用,Live Avatar可在后台触发工具调用并获取数据,同时保持对话正常进行,在处理复杂任务时保障对话流程不中断。
Live Avatar支持原生多语言语音同步,能动态调整唇形同步与表情,可在97种语言间无缝切换,不降低视频保真度或出现视觉偏移。
除了预设的多样化形象库,企业还可自定义Live Avatar。开发者可通过高质量参考图像生成完整动画、响应灵敏的虚拟形象,同时保留参考形象的相似度、品牌风格与角色特征,目前自定义虚拟形象仅对企业白名单用户开放。
谷歌为Live Avatar构建了严格的安全保障机制,所有AI生成内容均通过SynthID添加隐形水印,直接嵌入音频与视频输出,帮助识别AI生成内容,减少错误信息和错误归属问题。
目前,带Live Avatar的Gemini 3.8 Live已在Gemini Enterprise上线,用户可通过官方文档探索API开始使用。