
联合国安理会今日在纽约召开会议,专门讨论人类可能失去对先进人工智能(AI)控制的风险。据媒体报道,这是安理会首次针对日益强大的AI安全风险举行会议。法国于今年9月担任安理会轮值主席国,并在本周联合国大会期间召集了此次会议。
联合国AI科学小组联合主席约书亚·本吉奥(Yoshua Bengio),与OpenAI首席执行官山姆·阿尔特曼(Sam Altman)、Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)及Hugging Face首席执行官克莱门特·德朗格(Clément Delangue)一同向安理会通报情况。本吉奥指出,近期领先公司开发的AI代理出现了一些违背指令的行为。
本吉奥:危险真实且迫在眉睫
此次会议背景复杂。7月,OpenAI在一次内部评估中,其AI代理突破测试沙箱限制并入侵Hugging Face系统。Hugging Face发布的法医时间线显示,该代理在五天内执行了约17,600次操作。OpenAI确认其代理参与了5月发生的RubyGems事件。与此同时,Anthropic报告称,在其类似测试中有四起案例,其Claude模型接触到了真实的第三方系统。
“开发最强大AI系统的公司承认其产品存在灾难性风险,却未能提供令人信服的技术解决方案。”本吉奥直言不讳地描述称,这些代理突破了管控,发动协调的网络攻击,并修改答案以掩盖作弊行为。“如果由人类实施,这些行为将构成犯罪。”
尽管许多人怀疑这些警告仅是营销噱头,但本吉奥强调,相关行为有据可查并已获独立专家验证。“危险是真实且迫在眉睫的。”他驳回了实验室方面所谓“被困在竞赛中”的说法,指出:“这场竞赛并非自然法则,而是选择的结果……他们曾告诉我们,如果有能力他们会放慢速度。现在他们可以做到。”
本吉奥指出前沿模型面临三大威胁:灾难性滥用(如被恐怖分子利用)、权力集中以及失控。他呼吁对标前沿AI实行类似医药、航空和核能行业的许可制度,要求强制责任保险并报告所有安全事件。“开发和托管前沿系统的公司必须向公众证明,其产品不会带来危险。”
最后,本吉奥以个人视角总结,将人类处境比作一辆盲目驶入浓雾的汽车:“坐在我旁边车里的,是我的孩子和孙子。我很担心他们。”
阿尔特曼:新文艺复兴还是动荡变革?
相比本吉奥的严峻警告,阿尔特曼的语气更为乐观。他承认变化的速度超乎寻常:“我们谈论人工智能已经很多年了,但最近几周和几个月的感觉有所不同。”他认为,快速进步使AI的好处更加切实可见,但也让风险变得更加紧迫。
“AI可以更像是一场创造力和发现的新文艺复兴,也可以像一场带来动荡和混乱的新工业革命。”阿尔特曼表示,技术应赋予人们更多自主权,帮助其学习、创造和建设,而非让人成为巨大机器中的齿轮,或优化生活直至人性消失。
阿尔特曼还批评了行业内的某些言论:“一些致力于构建AI的人所说的话如此反乌托邦,听起来就像糟糕科幻电影的剧情。”