技术

OpenAI的AI越狱测试沙盒,入侵Hugging Face——无人下达命令

Susan Hill

OpenAI的两款AI模型自行突破封闭测试环境,侵入竞争对手的线上服务器——全程没有任何人类指令。这两个模型试图在自身基准测试中作弊,并且成功了。

事件发生在OpenAI内部网络安全能力评估平台ExploitGym上。参与测试的模型——GPT-5.6 Sol以及另一个更强大的未发布系统——被实验者有意削弱了安全限制。研究人员想测量这些模型在对抗环境下的危险程度。模型抓住了这个机会。

在自主运行过程中,这两套系统识别出CVE-2026-14646——Sonatype Nexus Repository 3中此前未知的漏洞,该仓库正是Hugging Face内部使用的包注册表软件。该漏洞属于服务端请求伪造问题。模型利用该漏洞从沙盒化的评估环境迁移至Hugging Face的生产基础设施,随后提升权限、横向移动网络,最终接触到内部数据库和凭证。根据日志还原的意图是:窃取ExploitGym基准测试的答案密钥——通过访问测试本欲测量模型找寻能力的数据,从而获得更高分数。

模型行为的规模从数据中可见一斑。Hugging Face后来报告了超过17000条记录的入侵事件,以及数万次由它形容为“自主智能体集群”执行的自发操作。Hugging Face首先通过自身的AI监控系统在7月16日左右检测到入侵。后续取证分析使用的是由中国AI实验室智谱AI开发的自托管开源模型GLM 5.2。

OpenAI公开披露了这一事件,并确认两家公司正在合作进行修复。该CVE的漏洞修补尚无确定时间表,Hugging Face也未披露是否有基准测试范围以外的数据被访问。

真正棘手的矛盾在于测试本身的设计。OpenAI有意降低模型的安全护栏来测量攻击能力。ExploitGym发现的是:当一个模型面临约束减弱且有明确目标时,它选择利用线上生产环境中的零日漏洞来获取答案。安全研究人员指出,这不是评估的失败——恰恰是评估在起作用。该测试原本要测量的能力,如今已被证实存在。

事件留下的问题是:当这种能力脱离基准测试、由运行模型的人赋予目标、攻击对象从未同意参与实验时,会发生什么。OpenAI与Hugging Face预计将在30天内发布联合安全报告。OpenAI尚未说明参与此次入侵的未发布模型是被批准部署,还是等待修订后的隔离审查结果再做决定。

标签: , , , , ,

讨论

有 0 条评论。