先看证据
便宜模型的任务,不只是回答得更快
Anthropic 于 2026 年 10 月推出 Claude Haiku 5.5,这是 Haiku 4.5 发布近一年后的更新。Anthropic 把它定位为面向高吞吐、对成本敏感任务的小模型,已在 Claude Platform 和 Claude Code 提供;推荐用法不是让它独自接管所有工作,而是与 Opus 5.5 或 Sonnet 5.5 配合,处理摘要、上下文压缩和数据库查询等子任务。
这个定位改变了比较问题。与 GPT-6 Luna 的同价对打当然醒目,但对技术负责人更实际的问题是:一个主模型能否把足够多的工作安全地交给便宜模型,减少昂贵推理调用,又不让验证、重试和错误恢复吃掉节省。Devin 的发布日接入提供了一个具体例子:Cognition 报告 Haiku 5.5 在 FrontierCode 1.1 得分 58.4%,单任务成本约为 Sonnet 5 的八分之一,并建议在 Fusion 中作为 Opus 5.5 主代理的 sidekick。这是厂商报告的特定评测结果,不是所有代码任务的通用成本保证。
把“同价”拆成两种账本
在输入不超过 100K token 时,Haiku 5.5 的输入/输出标价是每百万 token 0.10/0.50 美元,与 GPT-6 Luna 相同。但 Haiku 的提示长度超过 100K 后,价格升至每百万输入/输出 token 0.50/2.50 美元,也就是低档的五倍;Luna 的长输入加价门槛则是 272K。因此,“同价”只描述常规档位,不能替代对具体请求长度的核算。
第二本账是完成任务所需的 token。Artificial Analysis 的 Intelligence Index 中,Haiku 5.5 在最高 effort 下得 43 分,Luna 得 38 分;但 Haiku 每项任务平均用了约 162K 输出 token,Luna 约 50K。若把 effort 调低,Haiku 在约 55K token 时得 38 分,Luna 在约 50K token 时也得 38 分。评测还未完整计入 Haiku 超过 100K 输入后的五倍价格档,因此现阶段不能把这些分数直接换算成可靠的每任务成本结论。
effort让委派变成可调度的问题
Haiku 5.5 首次支持 Anthropic 的 effort 设置和 adaptive thinking。调用方可以调整模型投入的推理深度,这让“让小模型做多少”不再只是模型选型,而成为工作流里的预算配置:简单、可验证的任务可以限制投入;风险更高或步骤更多的任务,则可以提高 effort,或交回更强的主模型。公开材料说明了这些控制项,但没有披露模型架构或训练方法,不能据此推断性能提升来自某种特定技术。
这种设计与代理分工相互咬合。主模型负责拆解目标、判断结果是否合格,Haiku 承担大量窄范围执行;如果结果不满足条件,再升级给主模型处理。它把成本控制从“选最便宜的模型”变成“决定每类任务用多深的推理、何时升级”。不过,材料并未给出这种升级策略在真实业务中的成功率或延迟数据,工程团队仍要自行测量端到端结果,而不能只看模型单次调用的价格。
基准分数不是一张总排名
现有评测支持的是“有些任务领先”,而不是“全面胜过 Luna”。除 Intelligence Index 外,Haiku 5.5 在 Terminal-Bench 4.0 得分 33%,Luna 为 13%;但 AutomationBench-AA 中 Haiku 得分 35%,同场其他模型为 53%—60%。Artificial Analysis 指出,Haiku 在该测试中受到过度拒答影响,计划修复后重测,因此这一结果既暴露部署风险,也带有待复核的评测限制。
知识与幻觉指标也不能只挑对自己有利的一半。AA-Omniscience 中,Haiku 的准确率为 36%、幻觉率为 40%;Luna 分别为 44% 和 77%。Haiku 的幻觉率较低,但准确率也较低,这更像是谨慎程度与答题覆盖面的取舍,不能直接推导出它在高风险任务上更可靠。Terminal-Bench 的独立评测结果也与发布宣传值不一致,说明基准数字应连同测试条件、拒答处理和复测状态一起读。
先把它放在可回退的流水线上
Haiku 5.5 还支持 1M token 上下文和最高 128K token 输出,但长窗口不等于低成本:超过 100K 输入就进入更贵的价格档。它采用的新 tokenizer 对同一段文本比 Haiku 4.5 约多计 30% token,也提醒团队不能只拿旧模型的 token 预算直接套用。对于长文档摘要、检索结果归并或持续运行的智能体,这些差异都应进入调用和预算设计。
适合的落地方式,是先让 Haiku 承担可验证、可重试、出错后能升级的子任务,并记录每类任务的输入长度、输出 token、拒答率、重试次数和升级比例。再用自家工作负载比较 Haiku 与 Luna,而不是把 Intelligence Index 的分数当成总账。若任务经常跨过 100K 输入、需要大量输出,或错误难以被主模型发现,标价相同就不足以成为换模型的理由;若工作确实是大量短小、边界清楚的执行任务,Haiku 才更接近它被设计来占据的位置。