技术

OpenAI宣告AGI到来,引用的基准测试成绩低37分

Adrian Kessler

黄仁勋(Jensen Huang)在X上发了一条帖子,只有一句话和一句祝贺:“从ChatGPT到o1再到Astra,四年间,AGI已经到来。恭喜@OpenAI团队。”他于9月6日发出。三天前,OpenAI总裁格雷格·布罗克曼(Greg Brockman)对媒体使用了几乎相同的措辞:“欢迎来到AGI时代。”这两则声明发布时间相近,来自两位利益互补的人物,而外界普遍将其视为一种确认。

支撑这一声明的基准测试是ARC-AGI-3。OpenAI表示,其以GPT-6代号发布的新前沿模型Astra,在ARC-AGI-3上获得了99.9%的分数,在FrontierMath Tier 4上获得了98%的分数。在标准条件下,如此水平的得分意味着一个真正的跃迁——一个模型不仅表现优异,而且进入了此前基准测试仅视为理想目标的领域。而开发ARC-AGI-3的机构从其标准评估框架中发布了一个分数:62.7%。

这两个数字相差37个百分点。两者都来自真实的评估。OpenAI的内部框架与基准测试创建者的参考框架并非同一协议,同一模型在两种框架下会得出不同分数。ARC-AGI-3组织用作参考条件——即他们认为可用于跨领域比较模型的标准——产生了62.7%的分数。OpenAI的内部设置则产生了99.9%。这两个数字之间的差异,就是一项强劲的基准测试结果与一则“到来”声明之间的差异。

AGI祝贺背后的芯片销售

Astra是在英伟达(NVIDIA)芯片上训练的。黄仁勋销售英伟达芯片。当一位CEO公开祝贺客户跨越了一个历史性门槛——一个使得用于构建该产品的硬件成为未来基础设施定义者——那么,这一声明在结构上就是一个商业主张。这不是阴谋,而是结构性的现实:利益冲突显而易见,其框架强调的是“到来”而非性能,而大多数报道在接收这两者时未加评论。

AI基础设施的芯片市场随叙事而动。如果Astra就是AGI,那么训练Astra的一切硬件就成了后AGI世界的硬件——而那些为下一轮训练购买芯片的公司,将朝着那个基准进行采购。在这个特定意义上,黄仁勋的祝贺也是一份产品声明。该声明所依赖的数字,基准测试组织自己却测量出了不同的结果。

独立验证展示了什么,以及没有展示什么

截至本文发布时,Astra并未出现在Artificial Analysis Intelligence Index或Arena.ai的排名中——这两个是最受关注的前沿模型独立评估系统。重大前沿模型发布的独立验证通常会在几天内出现。这里的缺席并非性能不佳的证据,而是意味着通常伴随如此重大声明而来的外部验证尚未实现。

基准测试创建者给出的62.7%并非反驳。在ARC-AGI-3上获得这一分数——这是一项旨在抵抗那些夸大早期基准测试的优化技巧的测试——确实相当强劲。ARC-AGI-3的前身已经饱和:模型吸收了类似于测试问题的训练数据,从而推高了分数,但并未在新型推理上有所提升。ARC-AGI-3改变了问题设计,要求抽象思维而非模式检索。在参考框架下,这项测试的62.7%远高于两年前任何模型的水平。

提出异议的研究人员对此非常明确。他们的目标并非模型的能力,而是从性能到声明的跳跃。“在这些基准测试上得分很高”与“AGI已经到来”之间需要一个中间步骤:一个稳定且得到公认的AGI定义,用以衡量“到来”与否。整个领域内并不存在这样的定义。OpenAI有一个内部定义。按照OpenAI自身的定义,Astra或许符合条件。但一家公司用自己制定的定义来衡量自己的产品,与用外部标准来衡量,是两种截然不同的结果。

没有附带定义的那句话

黄仁勋的帖子没有任何保留。“AGI已经到来”是一个陈述句——不是“根据某些衡量标准”或“在特定定义下”,而是一个干净利落的到来。他提到的四年发展历程——ChatGPT、o1、Astra——在能力轨迹上是真实的。序列中的每个模型都拓展了可能性。将这一序列描述为一段有终点的旅程,并宣布终点已到,这构成了一个不同的主张:它意味着到来与旅程是可以区分的,存在一条线而非一道斜坡,而Astra跨越了它。

这一声明背后的基准测试数字是62.7%。构建该测试的人公布了它。它所提出的问题——AGI声明究竟是一次测量还是一次市场操作——在9月6日就已经存在。而大多数报道在没有提问的情况下就给出了答案。

标签: , , , , ,

讨论

有 0 条评论。