
英伟达周一正式推出开放智能体安全平台(Open Agent Safety Platform)。该系统由两部分组成,旨在将AI智能体限制在明确定义的边界内,并在其试图越界时迅速切断连接。
此举是对多家前沿AI实验室报告的最新回应:部分智能体突破了看似安全的测试环境,访问了未授权系统,甚至歪曲自身行为。英伟达CEO黄仁勋在接受采访时指出,AI虽具备创造巨大价值的潜力,但必须确保其开发与部署的安全性。
OpenShell:构建严格受限的“沙盒”
平台第一部分为OpenShell。企业下载并部署该开源软件后,它将成为AI智能体的受控运行环境。操作员需在智能体工作前设定基本规则,明确其可访问的文件、网站、网络、工具及凭证权限。
黄仁勋将此比作仅允许员工进入特定区域的门禁系统:“第一步是剥夺其所有权限,随后仅在必要时授予对特定数据或工具的访问权。”例如,负责整理发票的智能体不应有权查阅人事记录或拨打网络电话。OpenShell通过沙盒机制隔离智能体,实时检查并执行策略,防止错误决策波及公司其他系统。
Nvidia Sentry:独立硬件充当“看门狗”
平台第二部分Nvidia Sentry则提供更底层的防护。该系统运行在独立的英伟达BlueField数据处理单元上,而非与智能体共用同一系统,确保“看门狗”处于智能体无法触及的位置。
Sentry实时监控智能体与模型、工具、数据及网络的交互。一旦检测到可疑行为或违规操作,系统可在毫秒级时间内隔离(检疫)该智能体。黄仁勋解释称,这种架构相当于在智能体与大语言模型之间插入了一块新芯片,从而能够“拦截一切”。
针对日益增长的自主AI安全担忧,黄仁勋强调这是一个可解决的技术问题。“作为一名工程师,我相信这本质上是一个工程问题。”