你让 AI 同时处理几千条客服消息,难点不只在答得准。它还得回复快,账单不能失控。Claude Haiku 5.5 瞄准的正是这类工作:摘要、分类、数据库查询等频繁、重复、对成本和响应速度敏感的任务。Anthropic 称,它是自家迄今最便宜、最快、能力最强的小模型,并同步公开了系统卡——也就是说明模型能力、安全评测和限制的配套文件。不过,目前性能、价格效果与安全表现都只有 Anthropic 一个独立信源,尚无外部评测或客户实测可供交叉核验。
便宜,不只是降一个单价
Anthropic 用 Haiku、Sonnet、Opus 区分不同档位。Haiku 面向调用量大、强调响应速度的日常任务;这里的“小模型”,是相对同一家族旗舰而言,并不等于只能回答简单问题。
Haiku 5.5 采用分段计价。提示不超过 100,000 tokens 时,每百万 tokens 的 cache reads、cache writes、输入和输出价格分别是 0.01、0.125、0.10 和 0.50 美元。超过 100,000 tokens 后,四项价格分别升至 0.05、0.625、0.50 和 2.50 美元。token 可以粗略理解为模型读写文本时使用的计量单位;cache 则像保存已经读过的材料,后续调用不用重新处理。
Anthropic 称,短于或等于 100,000 tokens 的提示约占上一代 Haiku 请求的 90%,Haiku 5.5 的平均运行成本因此比 Haiku 4.5 低约 75%。但官方没有公开这一平均值对应的工作负载和计算方法,所以它不能直接等同于每个用户的账单都会下降四分之三。
它也是首个提供 adjustable effort setting 的 Haiku 级模型。这个设置允许用户在成本和智能水平之间调节:重复任务可以少花算力,较难的问题则允许模型投入更多推理资源。
能力提升,主要体现在哪?
官方基准显示,Haiku 5.5 的进步不只发生在摘要和分类。在模拟电脑操作的 OSWorld 2.1 offline subset 上,它得到 72.4%,上一代为 15.7%。在跨学科推理测试 Humanity’s Last Exam 上,它不使用工具时为 45.9%,使用工具时为 57.4%;Haiku 4.5 分别为 10.2%和 18.7%。在衡量代理式编程的 Terminal-Bench 4.0 上,新模型为 39.2%,上一代为 0.0%。
这些数字说明,Anthropic 正试图把 Haiku 从“处理轻活的便宜模型”推向能操作电脑、调用工具和承担部分编程工作的执行模型。它可以作为 subagent——由主 Agent 分派具体任务的辅助模型——处理重复、边界清楚的工作,把更昂贵的 Sonnet 或 Opus 留给规划和疑难环节。
不过,表格里的条件不能省略:OSWorld 使用的是 offline subset,Humanity’s Last Exam 分为有工具和无工具,部分其他成绩还采用特定 effort 设置。Anthropic 也明确表示,复杂的代理式编程仍更适合 Sonnet 5.5 或 Opus 5.5。换句话说,Haiku 5.5 的卖点不是全面取代大模型,而是让过去成本不划算的小任务也能批量交给模型。
“最快”还缺一把尺子
延迟,是从提交请求到模型开始或完成回答所需的时间。实时客服和浏览器操作尤其在意它。Anthropic 将 Haiku 5.5 称为自家最快模型,但没有给出吞吐量、首 token 延迟、硬件或并发条件。因此,现在只能确认它的产品定位强调速度,无法判断在具体部署中快多少,也不能与其他厂商作严格比较。
这次更新还包括两项配套调整:Sonnet 5.5 的 cache reads 价格从每百万 tokens 0.20 美元降至 0.10 美元;Anthropic 称,这会让多数 agentic work——由模型连续调用工具、分步骤完成目标的任务——成本下降约 20%。Claude Max 和 Team 订阅用户也将获得月度 API credit,用于调用 Claude Platform 上的模型。
安全结论还不能写满
Anthropic 声称,Haiku 5.5 在几乎所有对齐评测中较 Haiku 4.5 有明显改善,更少出现不符合预期的行为,也更少配合滥用。网络安全限制比 Haiku 4.5 更严格,但允许的防御性任务范围比 Sonnet 5.5 更宽;渗透测试等更可能被攻击者利用的技术仍会被拦截。生物安全限制则与 Sonnet 5、Sonnet 5.5 和 Opus 5 相同。
问题在于,供稿中的安全材料并不完整,系统卡也只有标题,缺少可核对的评测方法、样本和结果。现阶段不能据此断言模型已经“更安全”。同样,官方提到早期客户反馈与其性能和成本结论一致,却没有提供具体引文或独立数据。
局限与未知
- 所有实质性数据均由 Anthropic 自报,尚无第三方复测。
- “最快”与平均便宜约 75%缺少统一测试条件,实际体验会随任务而变。
- 安全评测细节不足,目前只能转述厂商结论,不能完成独立判断。