技术

OpenAI Jalapeño芯片的推理效率比Nvidia Blackwell高1.9倍(每瓦特)

Adrian Kessler

OpenAI造出了自己的芯片。该公司于8月25日在Hot Chips会议上展出了Jalapeño——这款与博通(Broadcom)合作开发的硅芯片设计,处理推理请求的能效达到每秒每千瓦85,448个令牌(tokens)。当前市场标杆——英伟达(Nvidia)的Blackwell架构,在同一指标上的成绩为44,960。两者的比值是1.9倍。

这一指标之所以关键,是因为推理是AI系统投入实际生产时的运行方式。训练只进行一次,而推理则每时每刻都在发生:每一次有人向ChatGPT发送提问、调用API、或使用任何运行语言模型的应用,背后都是推理。大规模推理的成本是决定AI服务经济性的核心因素。一款能将推理能耗大致减半的芯片,如果实现广泛部署,就将改变运行模型时单次查询的成本。

在交互式工作负载中——也就是响应延迟成为限制因素的情况下——Jalapeño的优势更为突出。SemiAnalysis在关于Hot Chips展示的报告里指出,在这些基准测试上,Jalapeño的表现比Blackwell好2.1到4.1倍。这一范围反映了不同任务类型之间的差异;下限代表更保守的对比结果。

这款芯片仅处理推理任务。它不运行那些训练出Jalapeño所运行模型的工作负载——那些仍需英伟达的硬件。博通根据与OpenAI的定制设计协议制造了这款芯片,而非将其作为商用产品出售。这一安排让OpenAI拥有了一条量身定制的推理层,同时又无需去商用芯片市场上参与竞争。

OpenAI的部署时间表有限。小规模上线计划在2026年底前完成;更广泛的部署则是一个2027年的目标。该芯片目前仍处于工程样品阶段,意味着量产版本尚未大规模出货。Hot Chips上公布的基准数据代表的是设计目标,而非经过验证的量产表现。从会议公告到定制芯片的实际运营部署,这一周期通常以年为单位计算。

这一公告契合了大型AI公司向定制芯片转移的宏观趋势。谷歌(Google)已在生产中运营自有张量处理单元(TPU)长达十年。亚马逊(Amazon)在AWS中运行着Trainium和Inferentia。Meta也在内部运营着自己的推理芯片。OpenAI的入局证实了一点:当用户规模达到数亿的级别,完全依赖外部GPU供应商的经济压力已经大到足以让定制芯片设计项目变得值得投入。

标签: , , , , ,

讨论

有 0 条评论。