Anthropic 悄悄扔出 Claude Haiku 5.5。我本来没当回事。Haiku 嘛,Claude 家族里的小弟,轻量、便宜、快,但能力一直属于"够用就行"。结果看完官方数据,我坐直了。
OSWorld 2.1,电脑操作能力,从 Haiku 4.5 的 15.7% 直接干到 72.4%。不是涨了 5 个点,不是涨了 10 个点,是涨了 56.7 个百分点。这个幅度,已经不能叫迭代,更像是换了个物种。
更狠的是价格。100K token 以内,输入 $0.10/百万 token,输出 $0.50/百万 token,缓存读取 $0.01/百万 token。跟 GPT-6 Luna 完全同价,是 Haiku 4.5 的十分之一,是 Sonnet 5.5 的二十分之一。
Anthropic 这次不是来刷榜的。它是来掀桌子的。

小模型的能力边界,被重新画了一遍
Haiku 5.5 最炸裂的地方,不是它能不能写代码,而是它开始能"动手"了。OSWorld 2.1 测的是 AI 通过图形界面操作真实电脑,完成多步骤任务。Haiku 4.5 只有 15.7%,Haiku 5.5 直接冲到 72.4%,把 GPT-6 Luna 的 48.9% 甩在身后。这意味着 Haiku 5.5 可以当浏览器子智能体、桌面操作子智能体、重复性界面任务的执行者。
Terminal-Bench 4.0 更夸张。Haiku 4.5 是 0%,Haiku 5.5 是 39.2%,GPT-6 Luna 只有 16.4%。这是 Haiku 系列第一次在 Agent 编程任务上具备实际可用性。
知识工作方面,GDPval-AA v2.1 得分 1620,是 Haiku 4.5(735 分)的两倍多,也超过 GPT-6 Luna 的 1437 分。但别急着吹上天。Artificial Analysis 的独立智能指数给 Haiku 5.5(Max 模式)43 分,略高于 GLM-5.3 Flash 的 42 分和 Gemini 3.8 Flash 的 41 分,低于 Sonnet 5.5 的 56 分。
它很强,但没强到能替代 Sonnet 和 Opus。
价格表才是杀招:100K以内真香,100K以上翻脸
100K token 以内,输入 $0.10/M,输出 $0.50/M,缓存读取 $0.01/M。这个价格,跟 GPT-6 Luna 一模一样。但超过 100K token,价格直接跳 5 倍:输入 $0.50/M,输出 $2.50/M。对比 GPT-6 Luna,Luna 在 272K token 之前保持基础价格。也就是说,在 100K 到 272K 这个区间,Haiku 5.5 的输入和输出成本都是 Luna 的 5 倍。
Anthropic 在用价格告诉你:短任务给 Haiku,长任务别来沾边,去找 Sonnet 5.5 或者 Opus 5.5。
还有一个坑:tokenizer 变了。Haiku 5.5 相同文本的 token 数约为旧版的 1.25 倍。这意味着实际节省比例会低于标称的 90%,综合看更接近 75%。
Anthropic 在下什么棋?让 Agent 从演示品变生产线
Haiku 5.5 的商业意义,不是单项能力多强,而是让 Agent 架构在经济上跑得通。典型 Agent 工作流里,子智能体要干大量重复活:路由请求、检索数据、分类文档、验证中间结果。这些任务对智能要求不高,但对调用频次和延迟极其敏感。以前用大模型,成本扛不住;用小模型,能力又不够。Haiku 5.5 正好卡在这个空档。
Anthropic 明确把它定位成 Opus 5.5 和 Sonnet 5.5 执行编码任务时的子智能体模型。大模型当指挥官,Haiku 5.5 当跑腿的。跑腿的便宜、快、够聪明,整个系统才能从"演示级"走向"生产级"。
发布首日,Haiku 5.5 就上线 Amazon Bedrock、Google Cloud、Microsoft Foundry 和 Claude Platform on AWS。真实企业数据比跑分更有说服力。Box 在企业内容平台上做了 400 次查询测试,Haiku 5.5 得分 0.84,Haiku 4.5 是 0.76。Asana 报告称,在其 AI Teammates 产品测试中,Haiku 5.5 将任务完成延迟降低 30% 以上。
别急着吹:早期用户踩到的坑
部分从业者在现有 prompt 上,Haiku 5.5 效果反而不如 Haiku 4.5,出现 prompt 泄漏、准确率下降、速度变慢。这说明新模型需要重新调 prompt,不能直接换模型名就完事。
还有开发者的 Skill 对比测试显示,同一 Skill 在 Haiku 5.5 上三次运行结果波动极大。长上下文也是硬伤。多位开发者认为,100K 对 Agent 和长编码会话来说太低了。Max 模式下自适应思考会拉长响应时间,同一任务时间和成本可能差 35 倍。
总结:怎么选?
Haiku 5.5 不是来争"最强模型"的。它是来争"最可部署模型"的。如果你的任务是短提示、高频率、结构化、对延迟敏感,比如分类、路由、检索、简单界面操作、子智能体跑腿,Haiku 5.5 可能是目前性价比最高的小模型选择。
如果你的任务是长上下文、重创意、需要稳定事实知识,或者复杂 Agent 长链路,别硬上。该用 Sonnet 用 Sonnet,该用 Luna 用 Luna。Haiku 5.5 让 AI Agent 从"能跑"变成了"跑得起"。但跑得好不好,取决于你的任务是不是落在它擅长的区间。