OpenAI正加速切入个人AI代理赛道,此次更新聚焦语音交互能力。据悉,该公司将于周三在ChatGPT网页端及移动App中集成其最先进的语音系统,允许用户通过语音指令处理涉及多步骤操作、浏览器访问及跨应用协作的复杂任务。

此次发布是OpenAI在下周开发者大会(DevDay)前密集迭代新功能的一环。ChatGPT语音产品负责人Atty Eleti演示显示,用户仅需语音指令,即可完成分析DoorDash支出、支付场地预订费及重组日历日程等操作。Eleti表示,将语音确立为人与AI交互的主要方式,是团队的核心目标。

抢占AI助手风口,铺垫硬件野心

随着Instinct、Meta Muse等专注于处理繁琐网络任务的AI助手在硅谷兴起,OpenAI此举意在抢占细分赛道风口。尽管ChatGPT已具备部分能力,但此次推出的垂直化语音工具显著增强了其在移动场景下的实用性。

从长远战略看,这一布局服务于OpenAI的硬件计划。据媒体报道,该公司正开发一款预计于2027年发布的智能音箱。技术层面,此次更新将具备实时监听与响应能力的GPT-Live模型,与能在计算机或浏览器中执行任务的代理模型打通,延续了公司在个人AI代理领域的技术积累。

超1.5亿用户使用,探索混合输出模式

Eleti指出,语音交互具备自然高效、解放双手及辅助语言学习等优势,目前已有超过1.5亿用户使用ChatGPT的听写和语音功能。然而,团队也面临办公环境仍以桌面电脑为核心的挑战,且阅读效率通常高于收听。

针对这一动态,OpenAI并未采取纯粹的“语音输入、语音输出”模式。Eleti强调,系统会根据情境决定最合适的反馈形式,包括文本、语音或两者混合,以平衡交互效率与用户体验。