同一天,两家厂商把中高端价格锚点往下拉

Anthropic 发布了 Claude Opus 5.5,OpenAI 随后发布 GPT-6 Sol 和 GPT-6 Luna。它们面对的是相似的问题:如何让能力足够强的模型进入更多实际应用,同时不让每一次调用的成本阻止开发者把模型接入产品、代理流程和批量任务。Simon Willison 对这几款模型的初步观察显示,变化最激烈的部分并不是型号数量,而是价格层级正在重新排列。

GPT-6 Luna 的输入和输出价格分别为每百万 token 0.10 美元和 0.50 美元,GPT-6 Sol 也相较 GPT-5.6 的对应版本降至约一半。GPT-5.6 原本已经被认为是性能和成本平衡较好的选择,而 GPT-6 进一步把这个基准压低。更值得注意的是,GPT-5.6 计划在 11 月涨价 25%,所以 GPT-6 的实际优势相对于当前促销价格还要更明显。对于技术负责人来说,这意味着过去需要依赖“小模型承担大部分工作”的成本假设,正在变得不稳定。

降价改变的不是账单,而是系统架构

当高性能模型变便宜,模型路由的收益结构就会变化。过去,一个应用可能把简单分类、格式转换和短回答交给低价模型,再把复杂任务升级给高端模型。GPT-6 Luna 以 0.10/0.50 美元的价格进入市场后,至少在一部分场景中,继续维护复杂的多级路由系统,未必还能带来足够的成本回报。材料将它与 GPT-4.1 Nano 和 GPT-5 Nano 相比,指出它已经接近 OpenAI 历史上最便宜的模型区间,但能力定位明显不同。

这并不意味着所有请求都应该切换到 Luna,也不意味着路由层会消失。真正变化的是路由的决策门槛:团队需要重新计算一次错误、重试、人工审核或上下文拼接的成本,而不能只比较单个 token 的价格。OpenAI 把 GPT-5.6 Terra 定在与 GPT-6 Sol 相同的价格后,Willison 判断继续使用 Terra 的剩余理由已经大幅减少,这正说明价格差异会直接影响存量系统的迁移优先级。

Opus 5.5 的关键降价,在缓存而不只在输出

Claude Opus 5.5 的价格从此前 Opus 系列每百万 token 输入 5 美元、输出 25 美元,降至输入 4 美元、输出 20 美元,降幅约为 20%。但对长时间运行的 agent 来说,更关键的是缓存读取价格下降了 60%。材料指出,在这类较长的代理对话中,超过 90% 的输入 token 可能按缓存价格处理,因此缓存机制会比标价本身更直接地决定总成本。

这带来一个容易被忽略的架构判断:上下文复用做得好不好,可能比模型从哪一档降价更重要。固定的系统提示、工具说明、项目上下文和历史状态,如果能够稳定命中缓存,长流程的边际成本就会显著下降。相反,一个不断重写提示、随意改变上下文顺序或无法保持缓存命中的系统,即使选择了更便宜的模型,也可能把节省空间消耗在重复输入和重试上。

便宜并不等于更适合:推理预算也会失控

价格下降同时暴露了另一类问题:模型可能把更多推理预算花在不必要的细节上。Willison 用“生成一只骑自行车的鹈鹕 SVG”测试 Claude Opus 5.5,在最高思考级别下,模型第一次没有返回结果。它从构图、解剖结构和腿部路径一路规划,甚至检查小腿长度、脚部轮廓和鱼的位置,最终陷入持续思考而没有完成任务。

这不是严谨的基准测试,也不能据此判定 Opus 5.5 的整体能力。但它提供了一个很具体的工程警告:更高的 reasoning effort 并不自动等于更高的任务成功率。对代理系统而言,最大推理档位会同时放大延迟、输出 token、超时和“想得太久却没有交付”的风险。技术负责人需要把思考级别当成可配置的资源上限,而不是质量开关,并为简单任务设置停止条件、超时和降级路径。

真正的决策,不是追逐最低单价

这轮竞争暂时集中在下一档模型,而不是最顶级模型。GPT-6 Astra 与 Claude Fable 5.1 仍以每百万 token 输入 10 美元、输出 50 美元计价,Opus 5.5 的新价格则与此前的 GPT-5.6 Sol 相同,只是在 OpenAI 再次下调 Sol 价格后失去了原先的价格优势。Anthropic 还预告 Sonnet 5.5 和 Haiku 5.5,低端价格格局是否会继续变化,材料并没有给出答案。

因此,部署判断不应建立在一次价格公告或一次视觉小测试上。更稳妥的做法是按实际工作流重新核算:哪些任务可以由 Luna 或 Sol 直接承担,哪些任务需要 Opus 5.5 的能力,哪些长流程能够命中缓存,以及最大思考档位是否真的提高了交付率。价格战会继续压低调用成本,但稳定性、上下文管理、失败恢复和任务完成时间,仍然决定一个模型是否适合进入生产系统。