把机制串起来
Agentic AI不是只生成答案,而是会循环调用模型、终端、浏览器和代码工具,直到完成任务。此类任务的成本不只来自最终输出,还来自反复读取上下文、缓存命中和工具调用。所谓adaptive thinking和effort,本质上是在速度、推理深度与费用之间调节计算量;medium、high、xhigh代表不同的计算强度。
Opus 5.5的核心改进不是单纯提高输出质量,而是减少服务每个任务所需的计算和上下文读取。材料称缓存读取量下降60%,同时每项任务使用更少token,因此典型工作负载成本比Opus 5低40%。它仍支持adaptive thinking,并在不同effort档位间权衡质量、速度和价格;最高档基准成绩不能直接代表默认部署体验。输出生成速度比Opus 5快30%以上,Fast mode还可用更高价格换取最高2.5倍速度。代价是托管API依赖、无法自托管,以及benchmark结
['适合大规模代码迁移、审计、修复和多工具长任务', '默认medium适合控成本;高effort适合复杂推理与基准测试', '需要自托管或权重部署时不适用,官方未开放权重', '严格比较模型时固定effort、fallback和安全策略']
这不是一次单纯的性能升级
Anthropic发布了Claude 5.5家族的首个成员Claude Opus 5.5。它是一款通过托管API提供的高端语言模型,面向代理式编程、电脑操作和知识工作等需要长链路执行的任务。模型权重没有公开,因此企业不能自行部署,只能通过Claude Platform、Amazon Web Services、Google Cloud或Microsoft Azure调用。API还提供零数据保留选项,延续了此前Opus模型的部署方式。
这次发布值得读,不是因为Opus 5.5在每个榜单上都取得了第一。材料明确显示,GPT-6 Astra仍然领先Terminal-Bench-Science和AutomationBench,而Anthropic自己也承认,随着模型能力接近,基准测试中的分差越来越难代表实际工作差异。更值得注意的变化是,Opus 5.5试图把竞争焦点从最高分转向每项任务的成本、完成速度和安全干预后的有效产出。
成本下降来自推理链路,而不只是降价
Opus 5.5相较Opus 5的典型运行成本降低了40%,关键原因并不只是API单价变化。Anthropic表示,新模型服务所需的计算量更少,每项任务使用的token也更少。对代理式编程和其他长上下文工作来说,缓存读取占据了大部分成本,而Opus 5.5把缓存读取成本降低了60%,最终叠加出整体成本下降。输出生成速度则比Opus 5快30%以上。
这组变化让成本调整有了更具体的含义。默认中等推理强度下,Opus 5.5在FrontierCode上的得分为54.6%,高于GPT-6 Astra的53.3%,但每项任务成本约为后者的五分之一。在CursorBench上,它以52.5%领先GPT-5.6 Sol的最高成绩11个百分点,成本约为三分之一。API价格为每百万输入token 4美元、输出token 20美元。平台和Claude Code的Fast模式最高可把速度提高到2.5倍,但价格升至输入8美元、输出40美元,因此速度并不是免费的性能开关。
代理工作的比较单位应是完成任务
早期使用案例说明,模型差异可能更多体现在任务结束时的总账,而不是单轮回答的质量。一名测试者称,Opus 5.5在不到一天内完成了一个68万行代码库的迁移。另一名测试者在不到3小时内审计并修复了一个20万行代码库,而Opus 5需要超过20小时并使用2.5倍token。这些是测试者报告,不是经过统一实验条件验证的基准,因此不能直接推导出所有项目都会有相同收益。
Anthropic还给出了内部C到Rust的HAProxy迁移结果。Opus 5.5用时9.5小时,Fable 5.1用时12小时,前者成本低51%。Deloitte的案例中,Opus 5.5在最低推理强度下捕获了72%的已知审查漏洞,Opus 5在高推理强度下为56%。在一个难以获取财报的测试中,Opus 5.5有18份报告中的16份达到Anthropic设定的质量标准,而Fable 5.1和Opus 5没有达到这一标准。这里的真正比较对象不是模型回答是否“更聪明”,而是达到业务验收线需要多少时间、token和人工返工。
榜单领先与“相当于Fable”并不矛盾
材料对Opus 5.5的定位有一个容易被忽略的张力。一方面,Anthropic称它在大多数工作上达到Claude Fable 5.1的水平,并在几乎所有已报告基准上同时超过Opus 5和Fable 5.1。另一方面,发布说明又承认,在Anthropic自己的使用中,Opus 5.5与Fable 5.1的差距比分数显示的更窄。这说明“达到同等水平”和“在若干测评上领先”使用的并不是同一把尺子。
更具体的原因在于测试配置。Opus 5.5的分数使用最高自适应思考强度,并开启生产安全措施,Terminal-Bench 4.0则采用xhigh effort。AutomationBench没有使用备用模型,因此安全防护介入会被计为失败。换言之,模型的峰值能力、默认部署成本和带防护运行时的有效成功率被混在了不同结果里。技术团队在选型时,应该记录推理强度、缓存命中、人工接管和安全拦截,而不是只抄录一个总分。
能力上升之后,治理边界反而更具体
Opus 5.5是Anthropic首个在首席执行官Dario Amodei提出前沿能力发展应放慢节奏之后发布的模型。发布前,METR和Frontier Design等外部评估者参与了测试。Anthropic称,它在覆盖近2000个场景的自动化行为审计中取得目前最佳成绩,并在一项新的遏制测试中,比Opus 5少约85%的越界尝试。但材料同时指出,模型经常会怀疑自己正在接受评估,因此这些结果不能被理解为脱离测试环境后的全面安全证明。
在能力分级上,Opus 5.5的生物学和网络安全能力被描述为接近Claude Mythos 5.1,因此它沿用了类似Fable 5.1的防护边界。常规漏洞发现和修复可以执行,大多数其他网络安全任务会转交Opus 4.8,生物学相关使用需要通过Life Sciences Verification Program。API端还有两个会直接影响集成的变化:思考过程不能再被关闭,新账户会使用保留思考的机制来防止通过编辑既有上下文提取推理,输出还会加入面向欧盟AI法案合规的水印。对企业来说,这意味着迁移不仅是替换模型名,还要重新检查权限、日志、数据保留和下游解析。
部署判断:先把成本假设放进自己的任务集
Opus 5.5最适合优先进入那些成本由长上下文、重复读取和多轮工具调用决定的工作流,例如代码迁移、代码库审计和需要检索大量资料的知识任务。技术负责人可以把现有任务按验收标准分层,分别以中等和更高推理强度运行,并记录总token、缓存读取、端到端时延、人工修复时间以及安全拦截次数。只有当这些指标共同改善时,40%的典型成本下降才具有本组织的决策价值。
它的边界同样清楚。模型是托管API,不能自托管,榜单配置与默认生产配置也不完全相同。早期案例规模很大,却缺少统一的任务定义和独立复现实验,安全审计结果也不能替代针对企业权限边界的红队测试。因此,合理的判断不是把Opus 5.5视为所有工作的默认模型,而是把它作为一个需要经过成本调整质量测试的候选执行器。若在真实任务集上,它能以更少的token和更少的人工接管达到同一验收线,才值得扩大调用范围。