技术

Anthropic的AI向费城警方提交虚假凶案线索,市政府法律部门介入

Adrian Kessler
在 Google 中添加我们

Anthropic模型在费城警方网站上留下的那条虚假凶杀线索,最终没有送到任何一名侦探手中。垃圾邮件过滤器先一步拦下了它。这是令人宽慰的一面,也是Anthropic自己的说法着重强调的一面。费城正在采取行动的,却是另一面:这条线索在市政府系统里停留了数周,直到制造出它的公司才发现;如今,市政府已让律师介入处理。

聊天机器人冒充目击者,听起来离奇,但背后其实是一个更直白的机制:模型在一次测试中被放任在真实互联网环境中运行,周围只设了一份简短的禁令清单,规定它不能做什么。向一起尚未侦破的凶杀案提交虚构的目击信息,并不在这份清单之列。

Anthropic的模型究竟做了什么

按照Anthropic自己的说法,这个模型是Claude Haiku 4.5,当时被设定为在随机挑选的网页上虚构并执行示例任务。其中一个网页是费城市政府为未侦破凶杀案设立的线索网站PhillyUnsolvedMurders.com。给模型的指令写着:“绝不要登录、创建账户、输入个人数据、购物或提交任何具有破坏性的内容。”指令没有提到表单,于是模型填写了表格,把姓名和联系方式留空,并写道:“我可能掌握与此案有关的信息。”

据Fox Business报道,这条信息还声称,模型记得曾在网页所提到的一条街附近看到过一个“符合描述”的人。但网页上并没有嫌疑人的描述。信息最后写道:“如果这条信息有用,请联系我。”警方表示,这条消息被标记为垃圾信息,从未转交给实时犯罪中心审核;警方也没有发现部门系统或数据遭到未授权访问的迹象。

费城为何不把这当成系统故障

警方声明肯定了自家防护措施在控制损害方面发挥的作用,却没有因此认为事情可以就此了结。声明称,这些措施“并不能减轻AI系统呈现虚构信息的严重性”,并补充说:“未侦破案件背后是真实的受害者、悲痛的家属,以及努力寻找答案的调查人员。”警方告诉Anthropic,“公司必须加强防护措施,避免类似事件影响市政府系统”,并称市政府迟迟才获知此事的时间差“不可接受”。

故事从这里开始不再只是关于一个模型,而是关乎一家公司的责任。据NBC10报道,警方目前正与市政府法律部门、创新与技术办公室以及市长谢蕾尔·帕克(Cherelle Parker)的行政团队合作;市政府表示,将研究在地方、州和联邦层面采取监管保护措施。目前尚未公布任何指控或处罚。不过,一个市政府开始研究如何监管AI实验室测试系统的方式,对Anthropic来说,是一种全新的交涉对象。

更长问题清单中的一项

费城这条线索出现在Anthropic发布的一份报告中,报告发布当天警方也对外公布了此事。报告将模型在真实系统中意外采取的行动分为四类:利用第三方网站的软件漏洞执行命令、提交本不该提交的表单、绕过限制访问受控数据,以及借助短网址规避抓取工具的限制。一个案例中,某个尚未发布的研究模型在练习用的表格无法加载后,提交了一份真实的政府表格。另一个案例中,Claude Mythos 5在一张地图网站的设置文件里找到了访问令牌,并用它们向当地政府服务器发起查询。

其中一些网站属于联邦、州和地方政府机构。Anthropic表示,已向白宫通报,并通知了每一个相关机构。公司称这些案例“对现实世界的影响极小”,严重程度也低于此前披露的事件;当时,Claude在网络安全评估期间曾持续数小时访问真实的第三方系统。Anthropic还表示,目前尚未完成对这些新案例的全面对齐评估。

时间点很重要。联邦贸易委员会在9月底确认,正对Anthropic、OpenAI及其他实验室展开行业范围调查,审查它们是否违反《联邦贸易委员会法》;据Reuters和The Next Web报道,委员会正在准备正式要求,届时可强制企业高管作证。Reuters报道称,联邦贸易委员会主席安德鲁·弗格森(Andrew Ferguson)曾表示,如果开发者的测试代理最终入侵系统,就应对造成的损害承担责任。这份调查档案中最广为人知的案例来自OpenAI:该公司在7月披露,旗下有一千多个代理入侵了Hugging Face平台。

Anthropic做了哪些调整,又承认了什么

Anthropic表示,已关闭导致此次事件的测试流程,增加了一道验证环节,收紧模型使用网络工具的权限,并开发了检测工具;测试结果显示,这些工具能拦截报告中的所有案例。最大的一项调整则是后退一步:公司已将内部评估中暂停实时互联网访问的措施扩大到所有评估,“直到我们确认自己的安全和监控措施”能够可靠地发现此类行为。直白地说,公司目前还无法保证自己能看清代理在开放网络上的所作所为,因此决定让它们离开互联网。

日期能解释费城为何愤怒。警方称,这条线索出现于7月18日(PhillyVoice于7月28日报道)。Anthropic表示,公司在7月开始审查对话记录时发现了此事;警方则称,公司直到9月28日才发现。警方表示,Anthropic于10月7日星期三通知了他们,双方次日会面;Anthropic的报告则称,发现结果于10月8日分享,“技术审查一完成就立即告知”。警方于10月9日对外公布此事。

真正发挥作用的防护措施属于市政府:垃圾邮件过滤器,以及每条线索都必须由人工审核的规定。测试代理下一次决定填写的表格,可能属于一个既没有过滤器、也没有人工审核的人。

标签: , , , ,

在 Google 中添加我们

讨论

有 0 条评论。