先看证据
新价格把竞争焦点从模型大小移到请求长度
Anthropic 于 2026 年 10 月 7 日发布 Claude Haiku 5.5,将它定位为处理高频、低延迟或范围明确任务的快速、低成本模型。它不是用来取代更大的 Sonnet 或 Opus,而是希望接手摘要、分类、路由、浏览器操作和编码子任务等工作。对技术负责人来说,关键变化不只是新模型上线,而是 Haiku 的价格终于进入可以和同档候选模型直接比较的区间。
Haiku 4.5 的 API 价格是每百万输入 token 1 美元、输出 token 5 美元;Haiku 5.5 在提示词不超过 10 万 token 时降至 0.10 美元和 0.50 美元,与 OpenAI 的 GPT-6 Luna 持平。超过 10 万 token 后,Haiku 5.5 的单价升为 0.50 美元和 2.50 美元。Luna 要到 27.2 万 token 才涨价,而且涨至 0.20 美元和 0.75 美元,因此长输入时,两者的成本曲线很快分开。
标价之外,还有 tokenizer 这笔账
每百万 token 的单价并不能直接代表每项任务的成本,因为同一段文本可能被切成不同数量的 token。Simon Willison 用自己的 token 计数工具比较一段长提示词,发现 Haiku 5.5 比 Haiku 4.5 多计约 25%。Anthropic 文档则称相同文本通常会多计约 30%。两种数字来自不同描述和样本,不宜混成一个精确系数;中文提示词的实际增幅,公开资料没有给出。
这意味着长任务可能同时承受两层涨价:tokenizer 让请求变长,跨过 10 万 token 后又进入五倍单价档。Anthropic 估算,按请求长度分布计算,Haiku 5.5 的平均运行成本比 Haiku 4.5 低约 75%,并指出 Haiku 4.5 约九成请求低于 10 万 token;这是基于其请求分布的总体估算,不是每个团队都能得到的折扣。Haiku 5.5 虽有 100 万 token 上下文窗口和 12.8 万 token 最大输出,但容量上限并不等于经济使用范围。能装进上下文,不代表适合整段塞进去。
推理深度可调,但不能假装没有成本
Haiku 5.5 默认开启自适应思考,默认 effort 为 medium,用户可以调整推理努力级别,但不能关闭 reasoning。这个设置把能力与成本的取舍显露出来:它不只是一个固定速度的廉价模型,实际用时还取决于任务和选择的 effort。公开材料没有披露其内部架构或训练方式,因此不能仅凭产品参数推断它怎样实现更快推理。
Willison 用生成“骑自行车的鹈鹕”SVG 做了一个直观对照:low effort 花费 0.0936 美分、耗时 7 秒;max effort 花费 3.3826 美分、耗时 5 分 9 秒。medium 及更高档位都生成了不错的自行车车架,而 low 档没有同样表现。这个小测试不能代表普遍任务表现,却揭示了工程上更有用的事实:在单次调用价格很低时,等待时间仍可能相差数十倍。对分类或简单格式转换,较低 effort 可能够用;对需要规划和多步执行的任务,省下的推理成本也可能转化为返工。
基准进步很大,部署结论仍要自己验证
Anthropic 公布的评测显示,Haiku 5.5 相对 Haiku 4.5 的成绩明显上升:GDPval-AA v2.1 从 735 升至 1620,OSWorld 2.1 离线子集从 15.7% 升至 72.4%,Terminal-Bench 4.0 从 0.0% 升至 39.2%。这些数字支持一个有限判断:新模型在知识工作、计算机操作和代理式编程的厂商评测中,相比上一代有显著进步。
但它们不能直接回答模型在某家公司的真实任务上是否更可靠,也不等于统一的延迟或成本保证。公开公告没有提供足以独立复现全部结果的信息,也没有给出中文专项成绩或真实部署延迟分布。上线前应使用自己的请求样本,分别记录提示词 token 数、输入与输出费用、响应时间和任务成功率,并把不同 effort 档位放进同一套评估中。尤其要检查长尾输入,因为平均成本看起来漂亮,并不能抵消少数请求跨档造成的账单跳升。
把它放进任务路由,而不是押注一个总价
Haiku 5.5 更适合被视为任务路由中的一个成本档位,而不是“所有请求都换成它”的理由。短输入、高频、边界清楚的工作,可以先测低 effort 或 medium;长材料则应先评估压缩、拆分或转给其他模型是否更划算。若生产流量常接近 10 万 token,路由器至少要能依据请求长度选择模型,否则一个看似便宜的默认项可能在最贵的输入上失去优势。
Anthropic 还为订阅计划加入与订阅费等额的月度 API 额度,并允许关闭自动充值;额度月底清零、不结转。这降低了试用 API 的门槛,也让团队可以在余额耗尽时停止请求,避免意外账单,但不适合用量波动大、很难在月内稳定消耗额度的场景。可执行的判断不是“Haiku 5.5 很便宜”,而是先按自己的 tokenizer 结果和请求分布算账,再给长请求设置预算与路由规则。其价格优势真实存在,但边界同样写在价格表里。