Google 发布了新一代前沿模型 Gemini 4 Argon,将单次输出上限从 64K token 提升至 100 万 token。推广期价格为每百万 token 输入 2 美元、输出 10 美元,结束后调整为输入 4 美元、输出 20 美元。

Argon 目前未全面开放,先通过 Fairwind 计划交给网络防御者,并进入美国政府发布前评估流程,之后从付费 API 用户和 Google AI Ultra 订阅者开始陆续开放。

基准测试成绩
Argon 与 GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5 对比 18 项测试、19 个分项,拿下 14 项第一(CWE-bench v1 与 GPT-6 Astra 并列)。编程方面,DeepSWE v1.1 拿到 77.9%,刷新最好成绩。

Vals Index 综合测评(按美国 GDP 加权)上,Argon 得分 68.9%,首次超过 Claude Opus 5.5(67.0%)排第一。

分行业看,金融研究 Argon 拿到 65.4%,比第二名高 6.5 个百分点;法律方向(Harvey Legal Agent Benchmark)Argon 拿到 19.6%,其他三家都没超过 7%。


AutomationBench(企业工作流自动化)Argon 以 51.3% 排名第一,Claude Opus 5.5 是 42.5%。

长视频理解 LVBench 拿到 91.7%,图表理解 Chartography 71.6%。长上下文测试 GraphWalks(256K 到 100 万 token)Argon 84.2%,大幅领先。
100 万 token 输出
输出余量大幅提升,模型可以在一条执行轨迹里思考、生成几十万 token,把难题一次做完,推理更深一层。

Google 内部应用
数千名 Google 员工已在日常工作中使用 Argon:
- 量子算法优化:帮研究员优化量子子程序的时空资源,几分钟将基线成绩提升 40%
- 内存效率:分析整个服务器集群性能,释放超过 300 TiB 内存,预计节省 500 TiB 到 1 PiB
- 大规模代码迁移:将 C/C++ 代码库迁移到 Rust,从 re2、libgav1 到 Fuchsia Zircon 内核 80 万行以上
其中 libgav1 的 Rust 移植版经 Argon 优化后,速度是原版的 2.7 倍,解码输出完全一致。
网络安全能力
Argon 在 CWE-bench v1 漏洞修复测试中以 68% 并列第一。真实漏洞发现测试(覆盖 20 种编程语言)Argon 85.8%,比 Gemini 3.8 Flash Cyber 的 71.0% 有明显进步。Wiz 渗透测试基准(无源代码,分析线上网站)Argon 70.9% 对 3.8 的 58.2%。


Wiz 在 Scan for Good 项目中用 Argon 发现了多家医院医疗软件的严重漏洞。面向受信任的防御者,Argon 会以不带网络安全护栏的版本提供。
安全防护
- 防滥用:拒绝网络攻击和 CBRN 攻击请求,保留正当两用科学研究
- 防提示注入:Gray Swan 间接提示注入测试排名第一,15 次尝试攻击成功率仅 0.7%
- 监测失准:监控思维链和行动,发现越界时中止执行
- 加固系统:高风险训练前隔离沙箱环境

价格与上线
推广价:输入 2 美元/百万 token,输出 10 美元。缓存输入便宜 95%。正式价:输入 4 美元,输出 20 美元。


Google DeepMind CEO Demis Hassabis 表示 Argon 在关键能力上是巨大进步。

