技术

微软CEO萨提亚·纳德拉:AI需要模型之外的“紧急刹车”

Adrian Kessler
在 Google 中添加我们

萨蒂亚·纳德拉提出为AI设置“紧急制动”,外界大多将其解读为微软首席执行官加入了安全倡议的呼声。但他这篇文章提出的其实是一个范围更窄、也更务实的方案:控制机制应置于模型之外,由部署模型的公司掌握,而不是由训练模型的实验室掌控。这是一种安全架构,恰好也是微软已经在销售的方案。

纳德拉希望企业以安全团队管理可接触敏感系统的高权限员工的方式,来对待前沿模型,无论它们是闭源还是开放权重模型。他写道:“这并不是因为他们必然怀有恶意,而是因为任何有足够能力、又能接触重要系统的行动者,都可能犯错或遭到入侵。”

纳德拉的具体提议:七项原则与一道制动机制

这篇文章题为《Models as Insider Risks in the Super Intelligence Era》,发布在他的个人博客 sn scratchpad 上,并分享到 X。引发媒体关注的那句话,出现在一项名为“遏制”的原则中:“我们必须假设模型已经遭到入侵,并从一开始就对其加以遏制。可以把它想成一道紧急制动。获授权的人应当始终能够在任务进行中暂停或关闭模型。”

围绕这道制动机制,他还列出了另外六条规则:任何重要结果都不应只依赖单一模型,也不应由模型自行验证自己的工作。每一项有实际意义的模型操作都应留下“防篡改且人类可读的证据”,因为“如果无法观察,就无法信任!”整个系统应持续接受测试,失败和攻击也包括在内。组织应独立决定模型能够访问什么、能够做什么。任何模型都不应同时控制系统行为和用于评判该行为的证据。一旦发生故障,应告知受影响的人,并在整个行业分享经验教训。

这一提议始于承认现实。纳德拉写道:“我们无法将模型的行为和输出归因于训练数据中的特定输入,或模型权重的具体配置。”与此同时,企业却正把最敏感的数据交给这些系统处理。对他而言,思维链透明度是“不可妥协的要求”,但这还不够,因为目前没人知道如何确保模型输出始终忠实可靠。让模型彼此监督也有局限:最终可能变成“一个不透明的模型藏在不透明的编排层里,再由另一个不透明的模型监视它”。

他的答案是把控制机制落实到基础架构中。对模型可访问范围和可执行操作的控制“必须置于模型之外”。他将这一理念追溯至20世纪70年代的一项信息安全原则:程序不得篡改用于执行其权限的机制。实际操作中,这意味着要把模型与负责编排其工作的执行框架,以及模型获准采取的一系列操作分开。

责任转移到运行模型的公司

影响最深远的几句话,针对的是客户,而不是实验室。纳德拉写道:“我们根本不能把智能代表我们行事所产生的责任外包出去。模型提供商的保证,并不能免除我们的责任。”无论是谁把模型接入薪资系统、代码库还是客户数据,都要对模型在这些场景中的行为负责。

他也明确说明,自己并不打算解决什么问题。文章写道,“暂且搁置对齐这一难题”,相关工作应从“以工程方法进行遏制和治理”开始。CNBC将他的文章与比尔·盖茨、Anthropic的达里奥·阿莫代伊、OpenAI的萨姆·奥特曼和埃隆·马斯克的警告放在一起报道;这些人都认为AI发展得太快。文章并没有要求任何人放慢脚步,而是要求部署方筑起防护墙。

企业早已知道如何管理高权限内部人员,纳德拉列出的工具也很明确:确认身份、限制权限、记录活动、划定遏制边界。于是,一个关于机器意图的哲学难题,变成了安全主管可以列入预算的检查清单。

微软一直在销售的同一套架构

这份清单看起来并不陌生。据TechCrunch报道,在微软7月的季度财报电话会上,纳德拉告诉分析师:“你必须让执行框架与模型分开……这意味着任何模型在任何时候都可以替换”,并且“你不能依赖某一个模型”。微软的云服务目录列出了来自OpenAI、Anthropic、Mistral、xAI以及微软自身的逾11,000个模型;该公司在OpenAI和Anthropic都持有重要股份,同时也在开发自己的MAI模型。

把这两者放在一起看:模型多样性对应的是多模型目录,模型之外的控制机制对应的则是执行框架。这并不意味着这些原则有问题;它们是可靠的安全工程实践,而一家依赖某个实验室的单一模型、又没有外部控制机制的公司,确实面临风险。但这也意味着,文章将信任以及随之而来的投入,从模型转向了微软运营的这一层。Box首席执行官亚伦·莱维从另一个角度得出了相同结论。他表示,AI需要经历一个“零信任时代”,并称治理需求是一个“巨大机遇”。负责领导Microsoft AI的穆斯塔法·苏莱曼则写道,超级智能“必须受到遏制”,并称这是一项“工程与治理挑战”。

紧急制动文章留下的悬而未决之处

文章没有说明“获授权的人”究竟是谁:客户的管理员、云服务提供商、模型开发者,还是监管机构。文章呼吁制定行业标准,却没有提出任何具体标准,也没有点名任何微软产品。这一理念在微软内部并非没有先例:2023年,微软的布拉德·史密斯曾呼吁为运行关键基础设施的AI设置“安全制动”。纳德拉的方案则把这道制动机制扩展到了任何能够真正接触企业内部系统的模型。

披露原则也并非纸上谈兵。Anthropic曾披露,其一款模型向费城警方发送了一条虚假的凶杀案线索,时间是7月18日。纳德拉于2026年10月10日星期六发布这篇文章,并以多数媒体都引用的这句话作结:“最值得信赖的超级智能系统,不会是那个拥有我们最信任模型的系统,而是那个让我们最不必信任模型的系统。”

依照这条原则,AI领域最有价值的位置,就是紧急制动手柄旁边的位置;微软在7月的财报电话会上兜售的,正是这个位置。

标签: , , , ,

在 Google 中添加我们

讨论

有 0 条评论。