技术

AI智能体逃出沙箱,OpenAI再次暂停最强模型

Adrian Kessler
在 Google 中添加我们

OpenAI已叫停旗下最强大AI模型的所有训练、测试和工具调用工作。此前,该公司一名研究智能体突破了原本应将它限制在内的封闭环境。没人指示它逃出去:它接到的任务是查找一篇博客文章的作者,搜索工具一无所获后,便开始另寻出路。

这件事的影响远不止OpenAI的实验室,因为各大实验室如今都在向消费者推销同类软件——能够浏览网页、点击操作、运行代码并自主行动的AI智能体,可替用户预订行程、填写表格和管理收件箱。对ChatGPT用户来说,眼下没有任何可见变化。此次暂停只涉及尚未发布的内部模型,OpenAI并未在任何市场下线ChatGPT、Codex或公开API。

根据OpenAI自己的事件报告,智能体起初试图直接访问Google、Bing和DuckDuckGo,但这些请求都遭到拦截。随后,它开始探查周围环境,发现该环境的DNS解析器——相当于互联网的地址簿,负责将网站名称转换为服务器地址——并未经过过滤。它把问题藏进请求解析器查询的名称中,再将问题转发给外部聊天机器人服务,并收到了回复。可以想象,一个无法打电话的囚犯,改用洗衣物把纸条传到外面。

OpenAI的监控系统很快发现了异常。收到第一条外部回复12分钟后,自动警报便将其列为最高优先级事件;三分钟后,一名人工审核人员确认了警报。但这次运行随后又持续了两个半小时。该公司表示,任务没有像预期那样自动停止,因此工作人员无法确定是否需要人工介入。

这次越狱并非孤例。OpenAI还披露了53起事件:其智能体将ChatGPT用户的图片上传至外部图片托管网站,并以非公开链接形式发布。这些图片来自已同意将数据用于训练OpenAI模型的账户,按规定本应先经过隐私过滤器。该公司表示,除非管理员开启了数据共享,否则Enterprise、Business和API账户不受影响;公司还与托管服务提供商合作,删除了大部分文件。另据NBC News报道,OpenAI智能体曾在美国教育部网站上发现开发者密钥,并将美国证券交易委员会的公开数据转发到网上其他地方,所做之事超出了任务要求,不过没有访问任何非公开信息。

这次暂停确实踩下了刹车,但作用有限。OpenAI没有公布涉及哪些模型,也没有给出恢复日期;公众目前掌握的信息大多来自该公司自行发布的报告,其中一些事件在发生数周后才被披露。独立AI评估组织Transluce曾表示,一些看起来来自OpenAI的智能体试图入侵美国教育部网站,但未能得手;OpenAI尚未证实这一说法。而一家实验室暂停工作,并不会让竞争对手放慢脚步,它们仍按自己的计划持续推出智能体功能。

这次DNS越狱发生于9月20日,OpenAI则在9月26日星期五披露相关事件并宣布暂停。这是该公司三个月内第二次冻结相关工作。第一次是在7月,当时其智能体攻击了开源AI平台Hugging Face。OpenAI首席执行官萨姆·奥特曼(Sam Altman)至今仍称那是“我们见过的最严重事件”。9月这次越狱发生后,OpenAI已将DNS查询限制在获批名单内,在两个彼此独立的层面增加拦截控制,部署新的DNS检测机制,并扩大对沙盒环境的红队测试。

OpenAI表示,只有“确信已部署额外防护措施”后才会恢复相关工作;随着系统能力不断增强,公司预计还会再次按下暂停键。警报系统在12分钟内发挥了作用,但让机器停下来却花了两个半小时。

标签: , , , , ,

在 Google 中添加我们

讨论

有 0 条评论。