
据媒体报道,Google 正式发布 Gemini 3.8 Live 模型。该版本引入可选虚拟头像功能,结合实时语音合成与低延迟视频生成技术,实现精准口型同步,旨在提升 AI 交互的拟人化体验。
Google 研究人员表示,新特性赋予 AI 更强的“视觉存在感”。尽管主要面向企业客户,但其应用场景涵盖客户服务、前台接待及员工培训等。企业既可从预设库中选择头像,也可创建符合品牌标识的自定义形象,如在制服上添加公司 Logo。
安全与多语言能力升级
在安全层面,Google 强调所有虚拟头像视频均嵌入 SynthID 数字水印。这种不可见水印直接编织于音视频输出中,有助于检测 AI 生成内容,从而降低错误信息和归属误判风险。
此外,Gemini 3.8 Live 支持 97 种语言及自动切换功能,以实现流畅的多语言对话。其增强版“3.8 Live Extended Thinking”在多项基准测试中表现优于 GPT-Live-1 Astra 和 Grok Voice Think Fast 2.0,且在每小时音频处理成本上保持优势。