Google已在Pixel设备上扩展Gemini人工智能功能,新增一项允许系统代表用户接听和处理电话的新特性。目前,Pixel 11用户可指示Gemini通过语音对话联系企业、预订服务或收集信息,即使用户暂时离开设备也能完成操作。

这一举措标志着移动AI助手与物理世界交互方式的重要进阶。Gemini不再仅提供建议或脚本,而是能独立进行完整对话。用户可通过点击应用内专用按钮或发出特定语音指令激活该功能,让助手接管通话。运行期间,界面会实时显示双方对话的文字转录,确保交互过程透明。该系统基于大量真实电话互动数据训练,能够应对语速变化、背景噪音、口音差异及对话中的意外变动。

场景与安全护栏

早期测试显示,Gemini在处理预订餐厅、确认营业时间或查询库存等常规任务时表现优异。当细节不明确时,助手会主动澄清并根据新信息调整回复;若对方将通话置于等待状态,Gemini会耐心等待直至人工返回。

隐私与安全是该功能的核心考量。Google仅在获得明确许可时记录音频,并结合设备硬件与安全云服务器进行处理。用户可随时查看转录文本并删除数据,或在任何时候中断自动通话以重新接管控制权。为防止欺骗,Gemini会在通话开始时明确告知对方其为AI助手。此外,系统设有严格的安全护栏,拒绝拨打涉及金融交易、医疗预约或可能引发法律责任的电话。

技术架构与集成体验

此次升级建立在Google早期Duplex技术实验基础之上,得益于Gemini模型家族在跨多轮对话上下文保持能力的显著提升。先进的语音合成技术确保了自然的音色,避免了机械感;实时语音识别则在复杂音频环境中保持高精度。底层架构将推理引擎与语音界面分离,允许Google在不影响语音质量的前提下更新对话策略。

该功能与Pixel生态系统深度集成。用户可直接从通讯录或搜索结果中提取联系信息,通话成功后,Gemini可自动添加日历条目、创建提醒或将详情保存至相关应用,形成行动闭环。在多语言场景中,Gemini可使用非用户母语进行沟通并提供翻译摘要,为旅行者或移民群体提供便利。

订阅要求与未来展望

目前,该功能主要面向Pixel 11系列用户,且需要订阅Gemini Advanced服务,以支撑复杂的云端推理计算。未订阅用户仍可使用基本Gemini功能,但无法启动自主呼叫。Google表示,将在未来几个月内把兼容性扩展至其他近期发布的Pixel机型。系统虽依赖稳定的互联网连接,但已通过本地处理优化简单任务,以最小化数据用量。

业界对自动呼叫系统的反应不一。部分企业赞赏其处理常规咨询的效率,另一些则担忧人际互动的缺失。Google正通过与无障碍专家、隐私倡导者及企业合作,持续优化模型。未来,公司计划扩展Gemini的任务范围,涵盖更复杂的谈判场景,并提升助手在必要时平滑移交控制权给人类的能力。

对于残障人士而言,这项技术提供了显著帮助,使患有言语或听力障碍的用户能独立完成此前需协助的任务。随着技术成熟,AI代理有望在第三方应用中普及,从根本上改变个人生产力工具的定义,使用户从繁琐的电话等待中解放出来。