技术

Gemini 3.8 Live 用同步唇形取代AI客服的空白脸

Adrian Kessler
在 Google 中添加我们

这套系统名为 Gemini 3.8 Live with Live Avatar。它将 Google 的语音到语音模型与实时视频层结合起来,在处理后台工具调用、不中断对话的同时,生成唇部动作和面部表情。系统会自动检测语言——通话过程中,虚拟形象可以切换所说的语言,无须转接、重新加载系统,也不会出现明显停顿。

它与视频叠加技术的区别在于,音频和视频生成是在同一条实时推理链路中运行,而非依次完成。这种协同让延迟足够低,能够维持自然的对话节奏。Google 会将 SynthID 水印以不易察觉的方式嵌入音频和视频输出中——每一秒内容都带有机器可读标记,表明其由 AI 生成,即使数据流之后被录制并回放也不例外。即便经过重新编码,水印仍会保留,因此导出片段仍可进行来源验证。

在印度负责企业部署的 Equal AI,最清楚地展现了这项技术在实际运营规模下能实现什么:97 种支持语言的范围内,有 9 种印度语言同时启用,每天处理超过 100 万通实时电话。若要让真人客服达到同等的可用性和排班覆盖水平,这样的通话量在经济上并不现实。这项部署背后的设计前提并非验证概念是否可行,而是如何实现高吞吐量。

此次发布没有公布的是价格。Google 尚未披露费用,并将相关咨询转交企业销售团队。定制虚拟形象——也就是由机构根据自有参考图像打造一张面孔——必须通过单独的验证流程,申请加入企业许可名单,无法自行创建。Live 模型的 Extended Thinking 功能仍处于封闭预览阶段,其推理深度因此受到限制,不及 Google 其他 Gemini 产品。并发会话数量上限也尚未披露。这种受限的发布方式符合 Google 分阶段推出企业产品的惯例:价格和容量通过协商确定,而非对外公布。

Gemini 3.8 Live with Live Avatar 现已在 Gemini Enterprise 控制台和 Live API 上提供,服务端点位于美国和欧盟。至于 Live 模型的 Extended Thinking 功能何时向当前封闭预览用户群以外的用户开放,目前没有公布时间表。

部署这项技术的企业将要回答一个技术本身无法解答的问题:移除自动化交互中能让人一眼识别的视觉信号,究竟会改善用户体验,还是会抹去用户得知自己正在与自动化系统互动的最后一个诚实提示。

标签: , , , , ,

在 Google 中添加我们

讨论

有 0 条评论。