
向 Siri 发起多轮对话时,若发现其“遗忘”前文,这并非因为识别错误,而是因其底层架构仍停留在上一个 AI 时代。PolyAI 首席执行官兼联合创始人 Nikola Mrkšić 指出,这位曾参与 Siri 早期技术研发的专家揭示了苹果助手在自然交互上长期滞后的根本原因。
旧版 Siri 本质是“按剧本演出”
传统 Siri 基于“枚举意图”构建。工程师需预先规划每一条可能的对话路径,如设置闹钟、播放音乐或发送短信。Mrkšić 表示:“一旦用户偏离预设剧本,系统就会陷入僵局。”这种机制导致助手在面对人类自然的思维跳跃、中途改口或复杂消歧义场景时显得笨拙甚至“失忆”。
例如,当用户要求联系发音相似的联系人时,系统依赖硬编码的规则而非上下文理解。Mrkšić 将这种开发模式描述为构建“对话本体论”,即试图在固定结构中维持常见任务的稳定性,但这无法应对真实对话的流动性。
为何 Siri 无法直接升级为 ChatGPT
面对“为何不直接升级 Siri”的疑问,Mrkšić 给出了否定答案。除了技术代差外,核心制约因素在于风险管控。“Siri 从未被设计为类 ChatGPT 的助手,”他指出,苹果管理层长期保持低风险偏好,任何可能产生冒犯性或错误回复的自由生成内容都被视为重大隐患。
相比之下,严格限定功能范围更为安全。让 AI 自由解读意图意味着行为不可控,而限定其仅执行标准化任务则能确保结果的可预测性。尽管大语言模型(LLM)已大幅进步,但这种安全性与灵活性之间的张力在苹果内部依然存在。
短期记忆已解决,长期个性化仍是难题
在技术层面,AI 已基本解决“短期记忆”问题。当前模型足以处理海量上下文,跟踪单次对话中的早期信息。若助手仍表现出遗忘,往往是因触发了公司设定的安全边界,而非模型能力不足。
真正的挑战在于“长期记忆”——即了解用户的生活习惯、社交关系及工作内容。这正是苹果面临的独特权衡:Siri 拥有对 iOS 操作系统深层数据的访问权限,包括邮件、照片和消息,这是第三方聊天机器人无法企及的上下文优势。
隐私优势亦是最大枷锁
“理论上,操作系统级的数据访问是让 AI 助手真正有用的关键,”Mrkšić 承认。然而,苹果长期将隐私作为核心卖点,这限制了系统可利用的用户数据量。语音代理越了解用户,效用越高,但这要求苹果在隐私保护与数据开放之间走出更狭窄的平衡线。
此外,人类语音具有停顿、自我纠正等非结构化特征。传统的“语音转文本”处理会丢失语气和节奏信息,而新兴的音频原生 AI 模型可直接对音频推理,显著提升交互自然度。
结语:考验在于放手
Mrkšić 评估认为,底层 AI 技术已不再是阻碍 Siri 进化的瓶颈,行业已在银行、酒店等领域验证了长程自然对话的可行性。对苹果而言,核心问题在于意愿:是否愿意放宽约束,允许 Siri 利用更多个人上下文以执行复杂任务。
随着“健忘”的技术根源逐渐消失,新版 Siri 的真正考验不在于构建更聪明的模型,而在于苹果决定让它“记住”多少用户的真实生活。