技术

OpenAI发布Astra:称其为最安全的AI,却隐藏推理过程

Adrian Kessler

Astra在代码编写、安全分析、计算机操作以及多步骤专业任务中展现出极高的速度和准确性,在标准软件工程基准测试上超越了OpenAI之前的模型Sol以及Anthropic的Fable。该公司称,这是其打造的首款跨越网络安全能力“关键”等级的模型:它能够以前所未有的规模和速度,发现并利用此前未知的安全漏洞,这是任何人类团队都无法企及的。

其背后的机制是一种名为“不透明递归”的技术。标准语言模型会以可读文本的形式输出其推理过程——即研究者用来审计决策、捕捉错误并验证模型是否按预期运行的思维链。而Astra在运行时不产生这类文本。它能够解决难题,却不留下任何可读的过程痕迹。OpenAI首席科学家雅库布·帕霍茨基(Jakub Pachocki)承认了这一转变:他表示,能力更强的模型可以“用更少的语言标记完成更困难的任务”。相应地,监控难度也随之增加。

这造成了一个结构性问题,而OpenAI自身的声明恰恰将其暴露出来。该公司将Astra描述为其迄今为止“最对齐的模型”。对齐——这门旨在让AI系统按照设计者意图行事的工程学科——历来依赖于逐行读取模型正在做什么。一个以不可见方式推理的模型,使得其自身的对齐性无法通过该方法得到验证。OpenAI尚未公开说明,在部署前它使用了何种替代方法来验证Astra的行为。

OpenAI总裁格雷格·布罗克曼(Greg Brockman)将Astra描述为“代际飞跃”,并直接被问及它是否代表了通用人工智能(AGI)。他的回答是:此前约束OpenAI与微软合作关系的合同性AGI定义已不再适用。他表示,AGI现在是一个“精神概念”。这一表述至关重要。OpenAI与微软的协议中包含与AGI挂钩的条款——这些条款规定了在何种条件下双方关系将发生变化。将AGI描述为未定义状态,使得这些条款继续保持休眠,无论Astra的实际能力究竟如何。

该模型的访问权限首先向Daybreak开放,这是OpenAI经过审查的网络安全项目——该公司将其框架定位为防御优先的部署方式。其逻辑是,让那些在自己系统中寻找漏洞的组织,先于那些在他人系统中寻找漏洞的组织获得能力。这一逻辑只有在访问控制有效的前提下才成立。Astra的零日漏洞识别能力,从设计上讲,恰恰是资源充足的攻击者所渴望的。一个推理过程不产生可读思维链的模型,在出现问题时也更难进行事后约束或审计。

更广泛的访问权限将在接下来一周内向付费用户开放——包括Pro、Plus、Enterprise、Business等级别,以及通过API提供。

标签: , , , , ,

讨论

有 0 条评论。