2026年9月24日,谷歌在对话式人工智能领域迈出重要一步,正式推出Gemini 3.8 Live及“Live Avatar”功能。该功能基于上周发布的语音交互基础,能够生成与模型语音响应同步的动画角色近实时视频,使AI智能体在互动中展现自然的口型、面部表情和流畅反应。

多模态交互与技术细节

据谷歌Gemini音频团队介绍,Live Avatar将近实时视频生成与语音结合,创造出由动态视觉人格进行倾听、观看和对话的体验。系统以每秒24帧输出视频,伴随24千赫兹音频,并能同时处理音频、实时摄像头画面和屏幕共享内容。

在多任务处理方面,模型可在后台执行工具调用和数据查询,而不会中断前台对话。例如,酒店住客在与虚拟形象讨论晚餐计划时,系统可静默通过后端API完成入住手续。此外,系统支持97种语言,并能在单场对话中无缝切换。随着语言转换,口型和表情会相应调整,且保持视频质量稳定,无视觉漂移。

企业定制与安全合规

为满足企业需求,谷歌提供了预设虚拟形象库,涵盖不同外貌、声音和表达风格。企业也可基于单张高质量参考图像创建自定义版本,保留品牌色彩或特定人物特征。但为防止滥用,自定义选项受到严格管控,需进入企业白名单并通过验证流程。

安全方面,所有生成的音频和视频均嵌入SynthID不可见水印,以便识别AI生成内容,应对深度伪造风险。Gemini Live群产品经理Fabien Blanc-paques表示,企业语音AI的竞争焦点已从速度和成本转向互动质量。目前,该功能已在Gemini Enterprise中全面可用,通过美国和欧盟端点运行,提供预置吞吐量及合规控制。

市场反应与应用挑战

行业对此次更新反应不一。有媒体评测指出,类人口型和表情的引入虽提升了技术支持和销售场景的实用性,但也引发了部分用户的“恐怖谷”不适感。另有观察认为,视觉引导与对话的结合在处理复杂任务时具有显著优势。

尽管技术展示了在银行、零售自助终端和培训模块中的应用潜力,但大规模部署仍面临挑战。高质量视频生成消耗大量计算资源,企业需为预置吞吐量付费。此外,延迟控制、面部表情的文化差异以及用户接受度,仍是影响其在全球范围推广的关键因素。目前,该功能仅面向企业客户,消费者版本尚未公布。