技术

Anthropic发布Fable 5.1:缓存成本降低75%,智能体基准成绩翻倍

Susan Hill

Anthropic 于9月1日更新了 Claude,推出 Fable 5.1,将缓存输入令牌的成本从每百万个1.00美元降至0.25美元——降幅达75%,而这一降价恰逢大多数生产级AI开发者发现,基础设施预算的真正消耗点并非原始计算能力,而是上下文积累。在实时的智能体会话中,单次 Claude 对话随着轮次推进,缓存中可容纳数十万令牌的上下文。以每百万0.25美元计算,这种积累成为设计上的有意选择,而非开发者需要绕开的成本上限。

伴随价格变动的基准测试结果显示,性能提升进一步强化了经济层面的优势。在衡量需要实验设计和迭代分析的多步骤科学推理的 Terminal-Bench-Science 0.1 上,Fable 5.1 得分52.6%,而 Fable 5 为24.7%——较此前结果翻倍有余。AutomationBench 从17.1%提升至31.4%,Terminal-Bench 4.0(一项更广泛的智能体能力评估)从42.0%升至55.8%。CursorBench 3.2.0 得分为73.4%。四项评估的结果模式一致:Fable 5.1 并非在边际上略有改进,而是在定义智能体价值的任务类别上显著更加可靠。

综合效应重新定义了使用 Claude 构建的成本算法。一个智能体应用由于模型更可靠,能在更少的轮次内完成任务,从而在达成成功结果的过程中消耗更少的总令牌周期。将75%的缓存降价应用于其实际使用的令牌,在高复用智能体工作流中,每任务的有效成本降幅可达45%或更多。Anthropic 并未公布一个单一的复合节省数字,但自行建模令牌经济学的开发者会发现,对于上下文密集型工作负载,数字落在这个范围内。

Fable 5.1 现已通过 Anthropic 的直接 API(模型标识符为 claude-fable-5-1)以及 Amazon Web Services Bedrock、Google Cloud Platform 和 Microsoft Azure 提供。Anthropic 同时宣布了 Enterprise Frontier Safeguards 功能:客户控制的数据保留、客户管理的加密密钥,以及在每个客户现有云基础设施租户内部署,除底层云成本外不另收费。

在通用发布的同时,Anthropic 还推出了 Mythos 5.1,这是同一基础模型的变体,该公司称其针对经过审查的组织采用了更宽松的安全措施。访问权限仅限于经过验证的网络安全研究机构和生命科学公司。该公司列举了已展示的应用,包括蛋白质结合剂设计和生物模型优化,其推理吞吐量可达标准版本的2.5倍。Mythos 5.1 的访问并非自助服务:Anthropic 会逐一审核申请,且未公布已注册群体的规模。

Fable 5.1 的智能体数据,尤其是在 Terminal-Bench-Science 上的表现,使 Anthropic 公布的结果超过了 OpenAI 在可比评估中最近披露的数据。跨公司的基准比较需要方法上的谨慎——供应商会选择有利于自家模型的评估,而 Anthropic 强调的特定测试很可能是因其有利结果而被选中。但更难以解释的是其内部翻倍模式:Fable 5.1 并非同一个模型加上降价标签。性能变化足够大,以至于定价故事和性能故事无法分割。

对于目前未使用 Claude 的开发者而言,缓存定价举措是一个值得转化为自身令牌经济学的数字。任何未能将每百万缓存令牌成本降至接近0.25美元的AI供应商,现在都将在企业销售对话中面临直接的成本比较问题。Anthropic 的缓存价格在此次降价前已低于多个竞争对手;差距进一步拉大。性能提升更难跨用例泛化,但在智能体和科学推理领域,Fable 5.1 设定了一个基准水平,任何供应商的下一个主要版本都将以此作为衡量标准。

标签: , , , ,

讨论

有 0 条评论。