技术

Gemini 4 Argon:谷歌的翻身之作,却几乎还没人能用上

Google DeepMind新模型最多可输出100万个token,并在谷歌自家榜单上登顶,但首批只开放给经过审核的网络安全防御者
Adrian Kessler
在 Google 中添加我们

过去一年的大部分时间里,谷歌的人工智能故事都围绕着它还没有发布的东西。Gemini 4 Argon就是它的回应,而这款模型最能说明问题的并不是哪项基准分数,而是谁能用上它的那份名单。Google DeepMind的这款新前沿模型将通过公司的Fairwind Program,首先交给一小批经过审核的网络安全防御者,除此之外不对任何人开放。

Argon专为长周期任务打造:软件工程、法律与金融研究,以及网络防御。最关键的机制变化在于输出长度:模型现在可以在单次运行中推理并写出数十万个token,足以把一次大型代码迁移从头做到尾,而不必再用零散片段拼接起来。

谷歌表示,已有数千名内部工程师在使用这款模型。公司在发布中介绍,Argon智能体已在其各个数据中心释放了超过300 TiB的内存,并正在把C和C++代码迁移到内存安全语言Rust,规模一直延伸到80多万行的Fuchsia Zircon内核。在谷歌的开源视频解码器libgav1上,Argon把32,000行手工调优的SIMD代码重写为安全的Rust代码,运行速度比此前的Rust移植版本快2.7倍。

Bar chart comparing Gemini 4 Argon and Gemini 3.8 Flash Cyber on vulnerability discovery and the Wiz penetration test benchmark
Image: Google

输出上限从64,000个token提高到100万个token。基准数据均来自谷歌自己:DeepSWE v1.1得分77.9%,在按经济价值加权的知识工作榜单Vals Index上排名第一,在长视频理解测试LVBench上得分91.7%。据VentureBeat统计,在已公布的18项基准中,Argon在12项上独占鳌头,但在FrontierSWE v2上,OpenAI的GPT-6 Astra仍领先它超过10个百分点。在外部测试者能够亲自运行这款模型之前,这些都只是说法,而非定论。

网络安全这一定位解释了这道门槛。谷歌训练Argon自主发现、验证并修补漏洞,并将向受信任的防御者提供一个移除了网络安全护栏的版本。通过Wiz的Scan for Good计划,该模型在医院软件中发现了一个会泄露个人数据的严重漏洞,而此前的模型都没能发现。令人不安的机制在于:一个如此擅长修补漏洞的模型,按定义也同样擅长发现漏洞。

因此,安全措施才是真正的看点。谷歌称,Argon会拒绝为网络攻击以及化学、生物、放射性或核攻击提供帮助,是其迄今对提示注入抵抗力最强的模型,并在一个监控系统下运行,该系统会监视其思维链,一旦超出用户意图就会中止执行。谷歌还参与了美国政府自愿性质的模型发布前访问流程。

那么,今天谁能用上Gemini 4 Argon?只有Fairwind的参与者和谷歌内部团队。面向开发者、企业和普通消费者的开放时间尚未公布;开放将从付费API客户和Google AI Ultra订阅用户开始。首发价格为每百万输入token 2美元、每百万输出token 10美元,之后将分别上调至4美元和20美元。

这款模型由科雷·卡武克丘奥卢于9月30日发布。在戴密斯·哈萨比斯于8月卸任首席执行官后,他接掌了Google DeepMind。这是谷歌自2025年11月推出Gemini 3以来的首款全新旗舰模型,而它真正的考验不在排行榜上,而在于一款去掉护栏发布的模型,能否始终留在原本托付的人手中。

标签: , , , , , ,

在 Google 中添加我们

讨论

有 0 条评论。