技术

Anthropic公布:Claude已主导自身26%的AI研究工作,9个月前几乎为零

Adrian Kessler
在 Google 中添加我们

Anthropic,每四个AI研究任务中就有一个现在由Claude主导。不是让Claude当助手,也不是事后让Claude审查——而是从高层提示开始,端到端完成,完成后由人工检查结果。九个月前,这一数字还不到百分之一。

Anthropic在两类情况之间划了一条界线。当Claude主导一项任务时,它独立处理大部分工作;监督者检查输出,而不是指导每一步。这与Anthropic总研发中Claude作为协作者——人类主导、Claude处理具体部分——的百分之九十是不同类别。主导是更难的分类。按研究人员原本会花在这些任务上的时间加权计算,它现在占公司全部AI研究的26%。

规模是具体的。大约有3万个Claude代理在Anthropic的内部平台上同时运行,执行着涵盖模型训练、评估、可解释性研究和安全分析的工作。8月份,这些代理总共做出了超过10亿个决策。Anthropic的实时监控系统在执行前拦截了其中0.002%——大约每4.7万个动作中有一个。随后,一个离线层每周标记约10万份记录供审查,其中约50份升级给人工处理。

安全在该系统内有可衡量的预算。在7月的某一周,专门用于保证代理安全的工作消耗了全部AI研发算力的6%,以及AI驱动研发自身使用算力的12%。Anthropic表示其分类是保守的,排除了专门的安全分类器,这表明真实比例可能更高。

一个认识论问题处于这一切的中心。Claude对Anthropic研究的贡献部分由Claude自己评估。一个Claude模型评估Claude的工作;监督数据只覆盖一个内部平台;算力分类依赖于Claude模型对自己的运行进行采样和标记。没有独立的第三方审计过这种方法。Anthropic发布的三个数字是精确的,但它们是自我报告的精确——这与经过验证的精确是两回事。

Anthropic表示将开始在流程中嵌入外部评估者。目前还没有名字、没有开始日期,其他AI实验室也没有发布过类似的披露。26%这个数字,按照它的发展速度来看,是一个快照,而不是上限。

标签: , , , , ,

在 Google 中添加我们

讨论

有 0 条评论。