先看证据

2026年10月7日发布。关键事实
上下文窗口1M tokens,最大输出128K tokens。关键事实
批处理API最大输出300K tokens,标注为beta。关键事实
输入每百万$0.10。提示词≤10万tokens
输入每百万$0.50。提示词>10万tokens
输出每百万$0.50。提示词≤10万tokens

百万上下文首先是能力上限

Anthropic 于 2026 年 10 月 7 日发布 Claude Haiku 5.5,将它定位为服务高调用量、成本敏感任务的小模型。摘要、分类、信息提取和客户支持是发布说明列出的用途,它也可以作为更大模型系统中的子代理。模型接受文本和图像输入,生成文本,并可通过 Claude API 及多家云平台调用。

这次发布把两个容易被混为一谈的数字放在一起:1M tokens 的上下文窗口,以及每百万输入 token 0.10 美元的起始价格。前者描述模型能处理多长的上下文,后者却不是对所有长度都适用的统一费率。对技术负责人来说,真正要厘清的不是“能不能塞进一百万 token”,而是不同长度的请求分别会落在哪个计价档。

价格门槛改变了低价的含义

Haiku 5.5 的输入价格按提示词长度分档:不超过 100K tokens 时,每百万输入 token 为 0.10 美元,超过 100K 后为 0.50 美元。输出也有对应档位,短提示词对应每百万输出 token 0.50 美元,长提示词则为 2.50 美元。因此,1M 上下文意味着模型可以处理更长输入,却不意味着一百万 token 的输入仍按最低档报价。上下文能力和低价范围是两项不同的产品条件。

对照上一代 Haiku 4.5,变化确实显著,但要读清楚比较口径。Haiku 4.5 的标准输入、输出价格分别是每百万 token 1 美元和 5 美元。按标价比较,Haiku 5.5 在不超过 100K 的提示词档低 90%,超过 100K 的档位低 50%。这组差异提供了成本下降的可能性,却不能单独说明同一业务任务的账单会下降多少,因为请求长度和输出量仍会改变总费用。

迁移时要把 tokenizer 一并算进去

官方迁移指南提醒,同一段文本在 Haiku 5.5 上大约会比在 Haiku 4.5 上多计 30% tokens。这会让单价比较变得不够直观:即便每百万 token 的标价下降,同样的业务文本也可能在新模型上形成更多计费 token。若流量中有大量请求接近 100K 的分档线,token 数变化还可能影响请求落入哪个价格区间,因而不能只拿模型单价乘以旧系统的 token 用量来估算。

Anthropic 据此估算,Haiku 5.5 的平均运行成本比 Haiku 4.5 低约 75%。这个数字是厂商的平均估算,不是对每个工作负载都成立的折扣承诺。更可靠的迁移核算应取实际请求样本,分别观察输入文本在新旧模型上的 token 数、提示词长度所在档位以及生成的输出量。批处理 API 的最大输出为 300K tokens,但该能力标注为 beta,不能与常规能力不加区分地纳入稳定生产假设。

可调思考深度适合放进路由设计

Haiku 5.5 支持自适应思考,也提供 effort 参数供开发者调整思考深度,默认值为 medium。公开资料能确认的是这项调用层面的控制能力,并没有披露模型参数规模、网络架构或训练方法。因此,“小模型”在这里首先是产品定位,不能被扩写成对内部结构的判断。它给工程团队的直接接口,是可以围绕任务调整推理投入,而不是预设所有请求都应该以同一强度处理。

这让 Haiku 5.5 更像任务路由中的一层,而非包办所有复杂工作的替代品。摘要、分类和提取往往可以作为边界相对明确的步骤交给它,高难度步骤则可以增加 effort,或升级给 Sonnet、Opus。Anthropic 也明确把复杂的代理式编程任务留给更大的模型。实际收益取决于路由是否能把简单请求留在低成本路径上,也取决于升级和检查结果的额外成本是否吃掉了节省。

基准成绩能说明进步,不能代替验证

Anthropic 报告 Haiku 5.5 在 OSWorld 2.1 离线子集上取得 72.4%,Haiku 4.5 为 15.7%。在 Terminal-Bench 4.0 上,Haiku 5.5 为 39.2%,Haiku 4.5 为 0.0%,Sonnet 5.5 为 70.6%。这些数字支持一个有限判断:在发布方报告的测试中,新 Haiku 相比上一代有明显提升,同时在 Terminal-Bench 上仍与更大的 Sonnet 存在差距。

基准成绩不能直接换算成团队真实任务的成功率。OSWorld 的 72.4% 限定于离线子集,不能代表所有电脑操作场景;Terminal-Bench 的结果也不意味着复杂代理编程已适合普遍下放。部署前应从高频、边界清楚的请求开始,用自己的流量测量 token 分布、输出规模、升级比例和任务质量,再比较整条工作流的成本。若请求常越过 100K,或失败代价使升级和复核成为常态,低价就不是充分的选型理由。