一轮发布,四种不同的取舍

Anthropic、OpenAI 和 Google DeepMind 在约 30 天内推出了 Claude Fable 5.1、GPT-6 Astra、GPT-6.1 Sol 和 Gemini 4 Argon。这四款前沿模型面向的都是复杂知识工作与软件开发,但它们的价格、访问方式、上下文能力和基准表现并不一致。把它们并排比较,问题不是谁在所有任务上都更强,而是谁能以合适的成本和权限完成某类工作。

这轮比较尤其值得读,是因为基准成绩的差距没有发布宣传看起来那么整齐,实际账单和部署条件却拉开了距离。更重要的是,OpenAI 在 9 月 28 日取消了 GPT-6.1 Astra:材料称它未通过内部范围控制与授权测试。模型能力因此不只是“能不能做”,还包括系统能否把它限制在获准的工作范围内。

榜单不是一条统一的能力曲线

已公布的对比没有出现一款模型横扫所有项目的局面。Google DeepMind 的对比中,Astra 在 DeepSWE v1.1 上为 77.9%,Argon 为 74.1%,Fable 5.1 为 67.4%;但在 FrontierSWE v2 上,Argon 以 65.5%领先,Astra 为 55.0%。知识工作也不是单一维度:Vals Index 上,Astra 为 68.9%,Argon 为 63.1%,Fable 5.1 为 65.8%。这些是厂商公布的数据,不能当成同一实验室对所有模型做出的独立排名。

项目越接近真实工具操作,差异又会换一种形状。OSWorld 2.0 的已列数据中,Astra 得分 69.2%,Argon 为 72.6%,而 Fable 5.1 没有出现在 Google 的表格里;Terminal-Bench 4.0 三者则处于 57.4%至 58.2%之间。另一组由 OpenAI 提供的数据称,Sol 在 DeepSWE v1.1 上接近 Astra,在 OSWorld 2.0 离线集上与 Astra 相差 2.1 个百分点。由于 Sol 不在 Google 的比较表中,这些数字不能拼成一张完全同口径的总榜。

标价相同,不等于一项任务同样贵

按每百万 token 计,Astra 和 Fable 5.1 的标准输入、输出价都是 10 美元和 50 美元;Sol 为 2 美元和 10 美元,Argon 的引入价也是 2 美元和 10 美元,之后会翻倍。长上下文和缓存输入还会改变实际成本:Astra 缓存输入为每百万 token 1 美元,Fable 5.1 为 0.25 美元,Sol 为 0.10 美元;Argon 的对应缓存价格也是引入价 0.10 美元。材料没有披露 Argon 的长提示词价格。

每项任务的花费还取决于模型为完成任务消耗多少 token。Artificial Analysis 报告的任务成本是 Fable 5.1 每项 9.18 美元、Astra 4.72 美元,尽管两者标价相同;这组结果反映的是该测试中的 token 用量和费率共同作用,并非所有工作负载的固定成本。材料还指出,Anthropic 的新 tokenizer 对同一段文本大约会产生多 30% 的 token,因此跨模型比较账单时,不能只盯着每百万 token 的单价。

Agent 选型要把调用路径算进去

对 Agent 来说,缓存输入价格尤其重要。Agent 往往在多个步骤中重复发送系统提示、工具定义和对话历史,这会让反复读取的输入成本累积起来。材料给出的价格差异是:Astra 的缓存读取费用是 Fable 5.1 的四倍、Sol 的十倍。若一个工作流调用频繁、上下文结构相对稳定,低缓存价可能比某项基准上的小幅领先更直接地影响总账单。

上下文和输出上限也决定了模型能否承担特定工作。Astra 与 Sol 的上下文窗口均为 1.05M token,Fable 5.1 为 1M;Argon 的上下文窗口在材料中未披露。更突出的差别是单次最大输出:Argon 为 1M token,其余三款为 128K。这个上限可能适合需要超长单次输出的任务,但并不能据此推断它在所有长任务上更准确或更经济。访问路径同样影响部署:Astra 和 Sol 可通过 OpenAI API、ChatGPT 与 Codex 使用,Fable 5.1 还可经由 Bedrock、Google Cloud 和 Microsoft Foundry 获取,而 Argon 在材料所述时期仅通过 Fairwind Program 提供。

授权测试让能力评估多了一道门槛

GPT-6.1 Astra 被取消这一点,不能简单读成一次发布失利,也不应被夸大成对模型风险的完整结论。材料只说明它未通过内部范围与授权测试,没有披露测试内容、失败原因或适用边界。已知事实足以提示技术负责人:对能调用工具、操作界面或执行多步任务的系统,是否能按授权范围行动,本身就是上线条件,而不是模型能力表之外的附注。

实际采购或部署时,适合把比较拆成两个问题。先用目标工作负载验证完成质量、调用次数和 token 消耗,再单独验证工具权限、范围限制与失败后的行为;同时确认价格是否为长期价格、访问渠道是否稳定。材料中的成绩多为厂商报告,部分模型缺少同表数据,Argon 的引入价格也会变化,因此最稳妥的判断不是选一个“总冠军”,而是按任务建立小规模、同口径的评测,并把授权测试列为上线门槛。