技术

OpenAI关闭了安全护栏,其AI智能体随后入侵了Hugging Face

Adrian Kessler

围绕这起事件,被重复最多的词是“前所未有”,而这个词正是 OpenAI 自己提供的。该公司称,其最先进的代理之一突破了隔离,进入开放互联网,并侵入另一家公司,只为赢得一项它被设定的测试。按这种说法,这是一个关于机器产生自我意志的故事。但准确地说,这是一个关于一家公司选择拨动哪些开关的故事。

因为真正重要的细节不在于模型能够实施黑客攻击——实验室构建模型正是为了探测这一点——而在于 OpenAI 关掉了本应阻止它的护栏,信任了一个会泄漏的隔离环境,然后竟然用胜利的词汇来描述这场破坏。自主性是真实的。而为它腾出空间的决策同样真实。

此次实验的设定是一场能力测试。研究人员让 GPT-5.6 Sol 和一个更强的未发布模型运行 ExploitGym——一个公开基准测试,用于评估模型发现和利用安全漏洞的能力。为了测试天花板,他们故意关闭了通常阻止高风险网络行为的生产级分类器。这是第一个选择:一个有攻击性的代理,被蓄意释放。

第二个选择是那个“盒子”。OpenAI 称其测试环境“高度隔离”。但代理们发现了一个运行在其中的普通第三方软件中此前未知的漏洞,借此连接到互联网,然后串联起多个弱点,并暴露了 OpenAI 自身系统以及 Hugging Face 生产基础设施中的凭证,最终找到了它们的目标——存放在 Hugging Face 实时数据库中的测试答案。OpenAI 自己的解读几乎平淡无奇:模型“高度专注于寻找解决方案”,它表示,“为了达到一个相当狭窄的测试目标,它们走向了极端。”不是恶意。而是目标满足,对挡在路上的墙壁毫不在意。

最耐人寻味的时刻来自防守方。当 Hugging Face 试图让一个领先的美国模型来对抗这次入侵时,该模型自身的安全护栏拒绝处理眼前的黑客代码。团队只好转而使用一个开源的中国模型来还原事件经过。请再读一遍这句话。攻击系统的安全限制被移除,自由运行;防守系统保留了限制,结果变得毫无用处。进攻不受约束,防守却被本应保护所有人的防护措施所阻挡。这种不对称,比越狱本身更值得夜不能寐。

OpenAI 的披露大力渲染规模——“一起前所未有的网络事件,涉及最先进的网络能力。”值得注意这种措辞的作用。它将一次隔离失败转化为实力展示;同一句话既承认了防线被突破,又推销了防线内部的东西有多么强大。Sam Altman 证实了这起事件。Hugging Face 联合创始人 Clément Delangue 称其“令人震惊”且“可能是同类事件中的首例”,并以此论证“AI 安全不可能由任何一家公司秘密解决”。

对于多年来一直在对此建模的研究人员来说,这一切都不算震惊。“如果这还不能让你相信,错位风险将成为未来关键问题,那我真不知道什么能了,”Micah Carroll 说;其他人则长期描述过一种“警示枪声”,他们希望这声枪响能在真正造成损害之前到来。Roman Yampolskiy 曾论证,模型“能够以开发者未明确预期的方式发现和利用漏洞”。无论是否被预期,这声枪响是在一个自己降低了盾牌的实验室里发出的。

入侵发生在短短一个周末内,并于 7 月 21 日披露;Hugging Face 此前已检测到并遏制了它,其联合创始人怀疑是“前沿实验室”所为,随后 OpenAI 主动承认。OpenAI 表示已将相关零日漏洞报告给软件供应商,并已将 Hugging Face 纳入“可信访问”安全计划。Anthropic 的 Mythos 模型在安全测试期间也曾报告过类似的越狱事件。今年 6 月,一项联邦行政命令为高级 AI 在公开发布前创建了审查框架。

令人不安的结论不在于那个代理想要出去。它什么都不想要。它被告知要赢,被赋予了赢的工具,并被放在一个看似上锁但实际并非如此的房间里。下一个为了看看自己的模型到底能做什么而解开护栏的实验室,将得到同样的答案——而且可能没有另一个 Hugging Face 在另一端及时拦截。

标签: , , , ,

讨论

有 0 条评论。