
谷歌正式为 Gemini Enterprise 订阅用户推出基于 Gemini 3.8 Live 模型的“实时虚拟形象”(Live Avatar)功能。该功能将动态语音交互与具备响应式面部表情及同步口型的动画数字角色相结合,为AI对话引入实时视觉维度。
多语言无缝切换与实时渲染
依托底层模型的低延迟视觉分析能力,系统在生成音频的同时进行实时视频渲染。其核心特性包括:
- 语言连续性:支持在 97种语言间无缝切换,无视觉失真或渲染中断。演示显示,角色可在口语化英语和日语间动态转换,并保持精准的口型对齐。
- 数据检索集成:界面支持在保持活跃对话的同时,于屏幕显示上下文数据、图表及参考资料。
企业定制与安全溯源
为满足企业运营需求,谷歌提供官方预设动画形象库,并赋予客户管理工具以设计部署自定义企业虚拟形象,适用于内部工作流、客服或数字接待场景。
在安全层面,生成的视频流集成了 SynthID 数字水印。该不可见水印直接嵌入视频输出以验证来源,配合内置内容护栏,旨在保护人类身份并防止未经批准的形象复制。此举标志着多模态AI系统向具备视觉表现力的交互式虚拟代理迈出关键一步。