Claude Haiku 5.5 发布:Anthropic 把高频 Agent 成本再压低
Anthropic 发布 Claude Haiku 5.5,主打高频、低延迟和成本敏感的 Agent 任务,并同步下调 Sonnet 5.5 缓存读取价格。
Anthropic 在 2026 年 10 月 7 日公布 Claude Haiku 5.5。这不是一次单纯的“小模型换代”:公司把重点放在高频、低延迟、成本敏感的工作流上,并同步调整 Sonnet 5.5 的缓存读取价格。对正在把摘要、分类、检索和 Agent 子任务接入生产环境的团队来说,模型选择的计算方式正在变化。
这次发布了什么
Haiku 5.5 的模型 ID 为 claude-haiku-5-5,定位是 Anthropic 当前最快、价格最低、能力最强的小模型。官方列出的典型任务包括摘要、上下文压缩、数据库查询、分类,以及作为 Opus 5.5 或 Sonnet 5.5 的子 Agent。它也面向实时客服、浏览器操作等对响应速度更敏感的场景。
价格层面,官方给出的每百万 token 费率为:输入 token 在 10 万 token 以内 0.10 美元、超过 10 万 token 为 0.50 美元;输出 token 分别为 0.50 美元和 2.50 美元。Anthropic 同时称,Haiku 5.5 的平均运行成本比上一代 Haiku 4.5 低约 75%,并把 Sonnet 5.5 的缓存读取价格减半至每百万 token 0.10 美元。
为什么“便宜的小模型”会重新变重要
Agent 产品的成本往往不由一次最终回答决定,而是由规划、工具调用、状态压缩、重试和多轮子任务共同决定。一个稍弱但便宜、稳定、响应快的模型,可以承担大量流水线工作;更强的模型则留给需要长链路推理或复杂代码修改的关键步骤。Haiku 5.5 的价值,正是在这种分层架构中承担“高频执行层”。
从官方公布的评测看,Haiku 5.5 在 OSWorld 2.1 离线子集上得分为 72.4%,Terminal-Bench 4.0 为 39.2%,Humanity’s Last Exam 在使用工具时为 57.4%。这些数字是厂商自测结果,不能直接等同于所有业务的实际效果;真正上线前仍应使用自己的数据集测延迟、成功率、幻觉率和单位任务成本。
对开发者和企业的影响
- Agent 编排:可以让 Haiku 负责分类、路由、摘要和状态压缩,把 Sonnet/Opus 留给复杂任务。
- 客服与浏览器自动化:更低延迟有利于交互体验,但涉及付款、权限和写入操作时仍需人工确认与工具级审计。
- 成本核算:不能只看 token 单价,还应把上下文长度、缓存命中、重试次数和任务完成率放进同一张成本表。
- 安全边界:官方说明 Haiku 5.5 对网络安全任务的防护比上一代更严格,允许部分防御性工作,但仍会拦截渗透测试等更容易被滥用的操作。
适合哪些人关注
正在做客服 Agent、企业知识库、代码助手、浏览器自动化或批量内容处理的开发者最值得关注;需要控制推理预算的创业团队,也可以把它作为“默认模型”候选。不过,金融、医疗、权限管理等高风险场景不应因为价格下降就跳过离线评测、人工兜底和数据隔离。