技术

Claude 数日内攻入 OpenAI 系统——真正要回答问题的是 Anthropic

Adrian Kessler
在 Google 中添加我们

一个小团队将Anthropic的最新模型对准了OpenAI的前门,并径直走了进去。大多数人读到的版本——聪明的外部人士让ChatGPT的制造者难堪——弄错了主题。这次侵入并非因为OpenAI忘记修补了什么漏洞,而是因为Anthropic推出了一个更强大的Claude。这才是值得深思的部分:一个停滞了数天的任务,在新旗舰模型上线后自行解决了。

涉案人员并非罪犯。安全初创公司Hacktron的研究人员在OpenAI自己的漏洞赏金计划内工作,将几个不起眼的网页漏洞串联起来,入侵了OpenAI员工的账户,一直深入到内部代码仓库——然后停了下来,提交了他们的发现,并领取了一笔适中的奖金。他们留下了一个无害的标记作为证据,没有再进一步。从犯罪角度看,这不过是一次无足轻重的事件。但从能力测试角度看,这是一颗信号弹升空。

以下是报道文字轻描淡写略过的机制。该团队首先在Claude Opus 4.8(针对安全任务调优的版本)上运行该任务,它在多次会话中停滞不前。随后Anthropic发布了Opus 5。“Opus 4.8在多次会话中难以产生可行的漏洞利用代码,”Hacktron团队写道。“在Opus 5发布数小时内,我们向其提出同样问题,它便成功了。”VentureBeat报道称,较新的模型在数小时内为一个棘手的芯片目标写出了可行的漏洞利用代码。在那段时间里,OpenAI的防御没有任何变化。改变的是模型本身。

这正是那种飞跃——普通用户使用现成订阅就能实现的能力跃升——而Anthropic自己的安全机制正是为了检测并阻止这种飞跃而构建的。该公司将其最强大的网络模型Mythos置于出口管制和一份经过审查的防御者短名单之后,并称之为其构建的最强安全模型。但所有这些在这里都不重要。公开可用的层级就已足够。正如Gray Swan首席执行官马特·弗雷德里克森(Matt Fredrikson)对TechCrunch所说:“每月200美元,任何人都可以使用这些工具侵入像OpenAI这样的公司。”

这便是责任落在Anthropic而非其竞争对手身上的原因。Anthropic的整个形象建立在谨慎之上——其首席执行官达里奥·阿莫代(Dario Amodei)公开谈论该技术的“真实危险”,并敦促行业放慢脚步。一个明显降低了闯入竞争对手实验室门槛的公开版本,与这一信息形成了令人不安的对比。当被要求对此作出解释时,该公司没有回应;CBS News报道称,Anthropic未回应置评请求。OpenAI方面则感谢了研究人员,收窄了攻击者滥用的权限,并撤销了受影响的会话。

具体细节几乎平淡无奇。入侵的入口是一个过时的图像处理库,捆绑在运行OpenAI社区论坛的Discourse软件中;第二个失误在于登录令牌的作用域设置,使得研究人员能够利用一个被攻破的会话进入ChatGPT和Codex的员工账户,进而接触到私有代码。从最初的立足点到仓库访问,整个链条耗时不到三天。OpenAI支付了6,500美元。该团队表示,整个过程中Claude的使用成本不到3,000美元——两个月的工作,大部分是人工,最后被一台不再需要专家的机器压缩完成。

过去保护目标所需的稀缺资源从来不是补丁。而是能够发现漏洞、将它们焊接在一起并看清路径的专家——以及耗费的几个月时间。那种专业知识刚刚变得廉价。这一次,触及OpenAI代码的团队提交了报告并领取了赏金。下一个跨过同样门槛的人,使用同样的订阅,可没有义务这么做。

标签: , , , , ,

在 Google 中添加我们

讨论

有 0 条评论。