先看证据

单次输出上限由64K升至1M关键事实
首发价为$2输入/$10输出每百万关键事实
缓存输入$0.10/百万,优惠95%关键事实
后续价格为$4输入/$20输出关键事实
竞品单次输出上限均为128K关键事实
18项基准领先12项,另1项并列关键事实

从64K到100万,变化的是任务形态

Google DeepMind发布了Gemini 4 Argon,这是Gemini 4系列的首个前沿模型,面向长周期软件工程、法律与金融等企业知识工作,以及网络安全防御。它最醒目的规格不是常规的参数规模或上下文宣传,而是单次响应最高可生成100万Token。此前的Gemini模型单次输出上限为64K,Claude Opus 5.5、Claude Fable 5.1和GPT-6 Astra则为128K。

这个差异改变的不是文案长度,而是任务能否沿着一条连续轨迹推进。一次大型代码重构、长篇法律报告或多步骤执行任务,理论上可以减少中间结果被截断、重新整理和跨轮次拼接的次数。模型不再只是回答一个局部问题,而是有机会在同一条轨迹里持续分析、生成、修正并完成交付。但100万Token只是输出上限,不等于模型能够读取100万Token输入,Google尚未披露Argon的输入上下文窗口,因此不能把这个规格直接理解成“无限长记忆”。

基准结果说明:长程能力强,但不是全面领先

Google公布的18项对比基准中,Argon有12项单独领先,另有1项并列第一。最能支撑其产品定位的是DeepSWE v1.1长程软件工程基准:Argon得分77.9%,高于Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%。它在Vals Index上以68.9%排名第一,在AutomationBench端到端业务执行上达到51.3%,明显高于Opus 5.5的42.5%。Harvey Legal Agent Benchmark上,Argon为19.6%,GPT-6 Astra为5.4%,LVBench则以91.7%刷新结果。

但这些数字不能被压缩成“Argon全面超过竞争对手”。在FrontierSWE v2上,Argon为55.0%,落后GPT-6 Astra的65.5%;Terminal-Bench 4.0上,Argon为57.4%,低于Claude Opus 5.5的66.4%;OSWorld-2.0电脑操作基准上,Argon的69.2%也低于GPT-6 Astra的72.6%。这组结果更接近一个任务分工判断:Argon尤其适合需要长时间保持目标、产出大量中间工作并完成业务闭环的任务,却不代表它在所有终端操作和软件工程环境中都更可靠。

价格把超长轨迹变成一笔可计算的赌注

Argon的定价也在强化这种定位。首发价格为每百万输入Token 2美元、每百万输出Token 10美元,缓存输入Token享受95%的折扣,即每百万0.10美元。引入期结束后,价格将升至输入4美元、输出20美元。按当前优惠价格计算,一次完整生成100万输出Token的响应就要10美元,未来则是20美元。这个价格并不意味着每次调用都便宜,而是试图让一次较长的任务轨迹比多个模型、多个回合和人工接力更容易核算。

Artificial Analysis报告称,Argon在其Intelligence Index上与GPT-6 Astra相当,但按折扣价格计算,每项任务成本约为后者的60%。这类比较仍然依赖任务定义、输出长度和智能体框架,不能直接转化为企业总拥有成本。对技术负责人而言,更重要的问题是:长输出是否真的减少了重试、状态同步、代码审查和人工接管。如果100万Token只是生成更多未经验证的内容,低单位价格也会变成更大规模的废料生产能力。

安全能力的价值,在于它能停下来

Argon被训练用于自主发现、验证和修补关键软件漏洞。在CWE-bench v1上,它以68%并列第一,不过竞争模型是在各自的智能体框架中运行,分数不能脱离执行环境解读。一个更具体的案例来自Wiz的Scan for Good:Argon发现了一个存在于全球医院使用的医疗软件中的关键漏洞,Google称此前的前沿模型未能发现它。这个案例说明,超长轨迹的价值可能不在于一次输出更多文字,而在于模型能够持续完成“寻找—验证—修复”的闭环。

但网络安全也是最不能只看能力上限的场景。Google表示,在扩大开放前,它会加强网络与化学、生物、放射和核风险的滥用防护,监控间接提示注入,监测思维链与行动中的错配,并保留停止执行的能力,同时使用封闭隔离沙箱进行高风险训练和评估。当前Argon采取分阶段访问,参与美国政府的预发布模型访问流程,并向受信任防御者和Google内部团队提供不带网络安全护栏的能力。普通开发者不能把这一受限部署误读成默认可用的“无护栏安全代理”。