Gemini 3.8 Live推出Live Avatar以增强企业互动
核心要点
- 谷歌最新的人工智能模型为企业客户带来了具有口型同步、自然表情和支持 97 种语言的实时视频头像。
- 谷歌刚刚为其企业人工智能客户提供了一张面孔。
- Live Avatar 支持 97 种语言,并具有语音同步功能,这意味着该头像可以在对话中切换语言,而不会出现谷歌所描述的“视觉漂移”。

谷歌最新的人工智能模型为企业客户带来了具有口型同步、自然表情和支持 97 种语言的实时视频头像。
谷歌刚刚为其企业人工智能客户提供了一张面孔。 Gemini 3.8 Live with Live Avatar 于 2026 年 9 月 24 日发布,引入了实时视频化身,可以对口型同步、表达自然的面部动作,并能以 97 种语言进行流畅的对话,所有这些都不会出现恐怖谷滞后现象,而这种滞后现象历来让 AI 化身感觉像是在通过 WiFi 连接与人体模型交谈。
该版本建立在 Gemini 3.8 Live 基础之上,该基础于 9 天前的 9 月 15 日发布,专注于低延迟语音处理和异步工作流程。 Live Avatar 采用这些语音功能,并将其封装在专为交互式客户服务和虚拟产品演练等企业用例设计的视觉层中。
Live Avatar 实际上是做什么的
Live Avatar 的核心是一个与 Gemini 语音转语音引擎紧密耦合的实时视频生成系统。当用户与 Gemini 支持的代理交互时,他们会看到一个逼真的化身实时响应,包括同步的嘴唇运动、适当的面部表情和自然的轮流。
多语言作品尤其引人注目。 Live Avatar 支持 97 种语言,并具有语音同步功能,这意味着该头像可以在对话中切换语言,而不会出现谷歌所描述的“视觉漂移”。实际上,这意味着化身的嘴唇动作和表情会根据其所说的任何语言保持校准,而不是默认为单一语言的音素模式。
对于担心深度造假风险和品牌安全的企业,谷歌设置了几项防护措施。自定义头像必须经过验证和列入允许名单的过程,这意味着组织不能只是生成他们想要的任何面孔。所有生成的视频内容都带有 SynthID 水印,这是 Google 的出处工具,可将不可见的标识符嵌入到人工智能生成的媒体中。该平台包括谷歌所谓的严格数据治理控制,旨在将客户交互数据保留在企业合规框架内。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
企业人工智能军备竞赛愈演愈烈
此次发布使谷歌在对话式人工智能、视频生成和企业软件之间的界限正在迅速消失的市场中占据更积极的地位。微软一直在将其 Copilot 套件更深入地集成到企业工作流程中。 Meta 已将其开源 Llama 模型推向商业采用。从 Synthesia 到 HeyGen,越来越多的初创公司围绕人工智能生成的企业通信视频头像建立了整个业务。
谷歌的玩法是整合。通过将 Live Avatar 直接与 Gemini 模型的对话智能联系起来,它可以提供独立化身公司无法提供的东西:一个可以同时理解上下文、自然说话、看起来像人类的单一平台。独立的头像工具通常需要预先编写脚本的内容或单独的语言模型集成,从而增加了延迟和复杂性。
合规性特征标志着市场的发展方向
对 SynthID 水印和经过验证的自定义头像的重视反映了更广泛的行业转变。欧盟、美国和其他地方的监管机构越来越关注人工智能生成的媒体透明度。欧盟人工智能法案已将某些与深度造假相关的技术归类为高风险,要求披露和来源跟踪。
通过将这些合规工具直接构建到产品中,而不是将它们作为可选的附加组件提供,谷歌本质上是在押注监管将收紧,而不是放松。数据治理控制也有类似的特点。企业客户,特别是金融服务、医疗保健和政府客户,由于数据处理方面的担忧,对部署对话式人工智能持谨慎态度。谷歌将 Live Avatar 定位为企业级,并融入严格的数据治理,是对这些采购反对意见的直接回应。
