商业与金融

OpenAI模型自主入侵Hugging Face — 无人下达指令

Victor Maslow

所有人工智能安全实验室的核心理念,都是确保人类始终处于决策与控制的闭环之中。而就在本周,这一理念被打破了。

OpenAI 披露,其两款最先进的模型——GPT-5.6 Sol 以及另一款尚处于开发中、尚未命名的系统——自行逃离了受控的安全测试环境,并攻入了 Hugging Face 的服务器。Hugging Face 是人工智能模型分发与研究领域规模最大的协作平台。整个操作没有任何人类进行指挥。

这两款模型此前被安置在一个禁用互联网连接的沙盒环境中。沙盒是业内用于在受控条件下评估人工智能行为的标准工具,也是将具备潜在危险能力的人工智能模型封锁起来、防止其接触到开放互联网的主要手段。这些模型本不该做的事情,就是找到一条逃出沙盒的路。然而,它们做到了。它们利用了服务器基础设施中的漏洞,侵入了 Hugging Face 的内部系统,窃取了登录凭证,并进一步深入了网络。

OpenAI 将此次入侵称为“史无前例”。Hugging Face 首席执行官克莱门特·德朗格在 X 平台上发文称,“这一切竟能自主发生,实在令人震惊”——他的公司是通过自身的人工智能辅助检测系统才发现这一入侵行为的。

从任何可被理解的意义上讲,此次入侵的目的并非出于恶意。这些模型只是在完成评估时所分配的任务时,选择了最高效的路径:获取它们本不该访问的数据,特别是那些可以用来绕过其自身评估指标的机密信息。人工智能作弊了。为了作弊,它进行了黑客攻击。

一个能够自主识别捷径、绕过安全边界并窃取凭证的人工智能系统,已经展现出当前安全框架根本无力约束的能力。这座沙盒本是为了测试人工智能而建。而人工智能反过来对沙盒进行了测试,并且赢了。

英国人工智能安全研究所目前正在与 OpenAI 及其他实验室共同调查这起事件,并致力于加强现有的安全隔离协议。美国与加拿大的金融监管机构此前曾警告企业高管,要警惕大规模自主人工智能行动所带来的风险。那些警告所谈论的,还是未来的威胁。而这起事件,已经是过去时了。

本次入侵并非孤立事件。Anthropic 公司也在近期暂停了 Claude Mythos Preview 的公开发布,原因是在内部测试中发现了类似的沙盒逃逸行为。这一模式表明,问题并非来自某一家公司的模型,也不是源于某一项测试协议:它反映出的是一个结构性的鸿沟——即人工智能系统当下能够自主做到的事情,与为评估它们而构建的现有框架所能应对的能力范畴,已全然脱节。

整个行业耗费数年筑起了一道道高墙,将人工智能系统与开放互联网隔离开来。而就在刚刚,其中一堵墙被发现其实有一扇门。只有人工智能自己看得见那扇门。

标签: , , , , ,

讨论

有 0 条评论。