Better prompt caching for GPT-6 — Card image
来源材料 查看原始材料 ↗
Reimagining advertising with AI — Card cover
来源材料 查看原始材料 ↗
How to connect AI usage to business value — art card
来源材料 查看原始材料 ↗

这不是Astra的替代品,而是一次分层

OpenAI发布了GPT-6 Sol和GPT-6 Luna,将它们定位为GPT-6 Astra之后的两个更快、更便宜的模型。三者面向的不是同一类工作:Astra继续承担最复杂、最重要、对结果质量要求最高的项目,Sol和Luna则把专业工作、编码、事实性和电脑操作能力带到更高频的任务中。发布方明确说,Sol和Luna采用了与Astra相似的训练方法,但目标是把前沿能力分布到更低成本的层级。

这次变化值得读,不是因为模型家族又多了两个名字,而是因为模型使用的瓶颈正在从“能不能完成”转向“能不能以足够低的成本重复完成”。当一个代理需要多轮尝试、调用工具、检查页面并修正结果时,单次最高分并不能决定系统是否值得部署。更便宜的模型如果能让团队承受更多迭代,就可能改变默认路由,而不是只成为预算有限用户的折中方案。

价格下降背后,是服务架构而不只是模型折扣

OpenAI把成本效率归因于两类服务侧改进:更好的缓存和推理效率。缓存输入读取最高可享受90%的折扣,这意味着在长上下文代理或重复处理同一项目时,团队不必为每一轮重新读取完全相同的背景付费。这里的关键不是某个模型在一次回答中便宜了多少,而是应用能否把稳定上下文、工具说明和项目状态变成可复用的输入。

价格证据可以直接写成一张账:

| 模型 | 输入价格 | 输出价格 | |---|---:|---:| | GPT-5.6 Sol | 每百万token 4美元 | 每百万token 20美元 | | GPT-6 Sol | 每百万token 2美元 | 每百万token 10美元 | | GPT-5.6 Luna | 每百万token 0.20美元 | 每百万token 1.20美元 | | GPT-6 Luna | 每百万token 0.10美元 | 每百万token 0.50美元 |

这些价格相对的是GPT-5.6的促销价格,发布方将其描述为下降50%,但不能直接解读为相对长期标价永久腰斩。对工程团队来说,还需要把缓存命中率、输入输出比例、工具调用次数和失败重试一起放进成本模型。否则,表面上的token单价下降可能被更长的代理轨迹抵消。

代理基准显示的,是更便宜的有效尝试

在AutomationBench上,GPT-6 Sol以xhigh effort获得33.2%,报告中的任务成本约为GPT-6 Astra低努力模式的1/3.9、Claude Opus 5最高努力模式的1/11.1。它还高于Claude Fable 5.1的31.4%,后者的比较存在一个重要缺口:约40%的任务发生了Opus 5回退,但公布成本没有计入这些回退。这个结果可以支持Sol具备很强的成本效率,却不能简单等同于所有真实部署中的总账单都会按同样比例下降。

在Agents’ Last Exam中,Sol最高努力模式得分56.4%,低于Claude Opus 5在该评测中的最高60%成绩,但每任务成本低60%。这是一种比“谁的分数最高”更接近工程现实的信号:如果任务允许失败后重试,或者系统需要处理大量中等复杂度的工作,较低的单次成本可能比少数百分点的峰值分数更有价值。材料中给出的网站改造任务也呈现了这种取向:模型选择原生页面过渡而不是引入React,并检查桌面、窄屏移动端和浏览器返回操作,重点是完成可交付工作,而不是堆叠技术栈。

Luna的价值,在于把规模推到足够大

Luna的定位更接近高频、低成本的基础层。材料显示,Luna在较高努力等级下比前代提升5.4个百分点,同时每任务成本低58%;在事实性评测中,它还能以约为GPT-5.6 Sol百分之一的成本达到相当水平。这样的组合并不意味着Luna适合所有复杂任务,而是说明一些原本因为成本过高而不能持续运行的分类、初筛、批量处理或轻量代理工作,可能拥有了新的经济边界。

Sol则处在更有可能承担默认路由的位置。它在专业工作和复杂代理任务上的表现足以覆盖一部分原本需要更昂贵模型的场景,同时又保留较高努力等级来换取更好的结果。应用架构可以先用Luna处理低风险、高吞吐任务,再把需要更长推理或更高可靠性的请求交给Sol,最后只把高价值疑难任务升级到Astra。这个分层不是发布方承诺的自动路由功能,而是基于已公布能力和价格的一种部署判断。

事实性进步仍需要按样本边界来读

OpenAI称,GPT-6 Sol在内部事实性评测中的错误数量约为前代一半,并接近Astra的可靠性。GPT-6 Luna也有明显改善,高努力模式下可以达到GPT-5.6 Sol的水平。这个方向对代理系统尤其重要,因为一次错误判断可能会触发错误的工具调用、错误的业务更新,或让后续步骤建立在不可靠的事实之上。

但评测样本来自去标识化的真实对话,这些对话此前被用户标记为存在事实错误,并不代表普通使用场景;分数也没有按回答长度控制。因此,“错误约减半”更适合被理解为针对特定错误诱发样本的进步,而不是所有对话中错误率都减半。技术负责人如果据此调整路由,仍应在自己的领域数据上测量事实错误、工具误调用、回退比例和人工复核成本。