谷歌Gemini3.8Live推出Live Avatar,97种语言实时唇形同步

来源:互联网 时间:2026-09-28

A5站长网9月28日消息,谷歌在近日宣布,Gemini3.8Live的Live Avatar功能正式面向Gemini Enterprise客户开放。简单说,就是给对话式AI配上一个近实时生成的虚拟人脸:它听你说话、回你话,唇形和表情跟着语音同步变化。此前9月15日,谷歌先发布了Gemini3.8Live和Extended Thinking两个语音对话模型,这次补上了视觉这一层。

能力上有几个实打实的点。Live Avatar支持97种语言的语音到语音同步,语言切换时唇形跟着变,不会出现画面漂移;系统同时处理视觉与音频输入,用户可以对着摄像头展示实物;推理引擎在后台执行异步工具调用,比如边聊边查订单,对话不会被打断。

企业可以选用预设头像库,也可以提供一张高清参考图生成品牌专属形象,不过自定义目前只对白名单企业开放,要走验证流程,防止滥用。谷歌强调,所有生成的音视频都嵌入SynthID水印,机器可以识别内容是不是AI生成,这在换脸和欺诈风险上升的当下是必要设计。

目标场景集中在企业客服、导览和培训:一个不知疲倦、会说97种语言、带人脸的服务代理,对企业是降本工具,对用户则意味着接线的不知是人还是机器。外界评价并不一边倒,有媒体担心近真人形象带来的恐怖谷效应,也有人提醒这类能力同样可能被拿去做深伪造假。

从产品节奏看,谷歌把虚拟形象先放在企业端而非消费端,用白名单和水印做缓冲,算是稳妥的一步。真正的考验在后面:当实时合成人脸成为人人可订阅的服务,披露规范和检测手段能不能跟上,会决定这项技术是被信任还是被警惕。

相关文章

标签:

A5创业网 版权所有