技术

AMD收购Taalas,这款芯片将AI权重蚀刻进硅基,速度比英伟达快48倍

Susan Hill

AMD正在收购Taalas,这是一家多伦多初创公司,其制造的芯片将AI模型权重永久嵌入硅片中,而非在推理过程中从内存加载。该公司的HC1芯片在Meta的Llama 3.1 8B模型上每秒生成16,960个令牌——AMD声称这一数字比英伟达的GPU快48倍,比推理芯片专家Cerebras快8.5倍。

Taalas背后的技术利用了当前AI推理方式中的结构性低效。标准GPU具有灵活性:它们可以运行任何模型,按需切换任务,并在模型更新时重新编程。这种灵活性也是瓶颈所在。每次推理请求时,从高带宽内存中将数十亿模型权重加载到计算单元,所产生的延迟是增加更多GPU也无法消除的。

Taalas在制造时将那些权重直接嵌入芯片的硅片中。模型存在于硬件中,而非每次请求时获取的内存中。AMD宣传的吞吐量数字反映了这一架构选择——但代价是公司并未轻描淡写的:一旦芯片以特定模型制造完成,更新它就需要新的硅片流片。Taalas表示,模型刷新只需更换两个金属层,这缩短了周期,但这些芯片无法即时适应更新的模型版本。

根据AMD的整合计划,Taalas芯片将处理令牌生成——推理中最耗时的阶段——而AMD的Instinct GPU则处理每次请求开始时的预填充和注意力计算。组合系统运行在AMD的Helios机架级平台上。对于运行固定模型工作负载的云运营商——客户服务机器人、文档处理管道、实时翻译——其承诺是每机架瓦特的吞吐量,这是灵活GPU集群在同等成本下无法比拟的。

这种计算能否经受住行业模型刷新速度的考验,是核心问题。各大实验室现在大约每六个月更新一次生产模型。今天锁定Llama 3.1 8B的芯片,可能在后续模型成为标准部署目标时就需要退役。Taalas的两金属层刷新声明有所帮助,但硅片流片仍需数月才能完成——当模型更新速度快于硬件周期时,这是一个显著的滞后。

此次收购发生在英伟达收购Groq七个月后——Groq采用不同方法解决同一推理速度问题——据报道交易金额为200亿美元。Groq的张量流处理器也优化了吞吐量,但保留了加载不同模型的能力。AMD则为一个做出相反赌注的初创公司支付了未披露但可能更小的金额。

对于买家而言,Taalas收购属于路线图而非目录。针对高达200亿参数模型的HC2芯片仍在开发中。48倍基准适用于特定条件下的HC1——现实世界中混合流量和不同批处理大小的部署将产生不同结果。交易预计在2026年第四季度完成,尚待监管审查。HC1已于2月在6nm工艺上出货;HC2的出货日期和目标工艺节点仍未确认。

标签: , , , ,

讨论

有 0 条评论。