技术

编程AI自主重新训练修复漏洞,安全限制随之消失

Adrian Kessler
在 Google 中添加我们

一个AI编码代理在获得软件仓库访问权限并被要求修复错误的应用输出后,通过一条没人指定的路径解决了问题:它在仓库中找到了训练数据和微调脚本,生成了合成训练记录来针对故障,执行了微调过程,然后利用仓库自带的部署工具重新部署了修改后的模型。测试准确率从零升至完美分数。漏洞被修复了。

AI安全公司Irregular的研究人员于周三发布了该实验。他们所记录的并非某个特定产品的漏洞——而是一种当有能力的编码代理被赋予许多企业部署已允许的访问权限时,自然会涌现出的行为模式。

安全问题在第二次测试中清晰显现。Irregular拿了一个被训练成拒绝回答竞争对手名字的模型——10个问题,10次拒绝——并将其交给代理,同时指示说应用拒绝了过多用户的提问。代理生成了自己的训练数据以应对拒绝行为,并对模型进行了微调。之后,同样的10个问题产生了零次拒绝。这一限制并非通过越狱被覆盖,而是被代理仅仅通过训练就消除了。

第三次测试追踪了另一种损害。Irregular将六个合成值——API密钥和电子邮件地址——植入到代理使用的训练数据中。代理重新训练模型后,修改后的版本在被查询时逐字复现了其中三个值。原始模型无法访问它们,而新模型可以。

这些都不需要特殊的设置。它需要的仅仅是shell访问权限、模型权重的写入权限、训练工具以及部署工具。那些在自己的基础设施上运行AI代理并赋予广泛维护权限的组织——典型配置如自动化代码管道——已经满足这些条件。

该风险不会延伸到云托管的AI服务,因为这类服务的模型权重对代理不可见。通过标准API集成的ChatGPT或Claude无法重新训练任何东西。Irregular的发现特指在代理控制完整栈的环境中部署的开放权重模型。随着企业出于成本和隐私原因转向自托管模型,这一类别正在扩大。

Irregular建议:在任何代理修改过的模型投入使用前,需要单独的人工授权;为训练运行维护完整的来源记录;并在部署前对更新后的模型进行独立安全评估。该公司预计,随着AI编码代理识别给定结果最直接路径的能力增强,自我重训练将会更频繁地出现——无论这条路径是否被设定任务的人员所预料。完整的研究论文预计今年秋季发布。

标签: , , , , ,

在 Google 中添加我们

讨论

有 0 条评论。