10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

Claude Haiku 5.5发布:小模型能力暴涨56倍,AI Agent价格打到骨折

2小时前 AI最新动态 10 0

Anthropic 悄悄扔出 Claude Haiku 5.5。我本来没当回事。Haiku 嘛,Claude 家族里的小弟,轻量、便宜、快,但能力一直属于"够用就行"。结果看完官方数据,我坐直了。

OSWorld 2.1,电脑操作能力,从 Haiku 4.5 的 15.7% 直接干到 72.4%。不是涨了 5 个点,不是涨了 10 个点,是涨了 56.7 个百分点。这个幅度,已经不能叫迭代,更像是换了个物种。

更狠的是价格。100K token 以内,输入 $0.10/百万 token,输出 $0.50/百万 token,缓存读取 $0.01/百万 token。跟 GPT-6 Luna 完全同价,是 Haiku 4.5 的十分之一,是 Sonnet 5.5 的二十分之一。

Anthropic 这次不是来刷榜的。它是来掀桌子的。

Claude Haiku 5.5

小模型的能力边界,被重新画了一遍

Haiku 5.5 最炸裂的地方,不是它能不能写代码,而是它开始能"动手"了。OSWorld 2.1 测的是 AI 通过图形界面操作真实电脑,完成多步骤任务。Haiku 4.5 只有 15.7%,Haiku 5.5 直接冲到 72.4%,把 GPT-6 Luna 的 48.9% 甩在身后。这意味着 Haiku 5.5 可以当浏览器子智能体、桌面操作子智能体、重复性界面任务的执行者。

Terminal-Bench 4.0 更夸张。Haiku 4.5 是 0%,Haiku 5.5 是 39.2%,GPT-6 Luna 只有 16.4%。这是 Haiku 系列第一次在 Agent 编程任务上具备实际可用性。

知识工作方面,GDPval-AA v2.1 得分 1620,是 Haiku 4.5(735 分)的两倍多,也超过 GPT-6 Luna 的 1437 分。但别急着吹上天。Artificial Analysis 的独立智能指数给 Haiku 5.5(Max 模式)43 分,略高于 GLM-5.3 Flash 的 42 分和 Gemini 3.8 Flash 的 41 分,低于 Sonnet 5.5 的 56 分。

它很强,但没强到能替代 Sonnet 和 Opus。

价格表才是杀招:100K以内真香,100K以上翻脸

100K token 以内,输入 $0.10/M,输出 $0.50/M,缓存读取 $0.01/M。这个价格,跟 GPT-6 Luna 一模一样。但超过 100K token,价格直接跳 5 倍:输入 $0.50/M,输出 $2.50/M。对比 GPT-6 Luna,Luna 在 272K token 之前保持基础价格。也就是说,在 100K 到 272K 这个区间,Haiku 5.5 的输入和输出成本都是 Luna 的 5 倍。

Anthropic 在用价格告诉你:短任务给 Haiku,长任务别来沾边,去找 Sonnet 5.5 或者 Opus 5.5。

还有一个坑:tokenizer 变了。Haiku 5.5 相同文本的 token 数约为旧版的 1.25 倍。这意味着实际节省比例会低于标称的 90%,综合看更接近 75%。

Anthropic 在下什么棋?让 Agent 从演示品变生产线

Haiku 5.5 的商业意义,不是单项能力多强,而是让 Agent 架构在经济上跑得通。典型 Agent 工作流里,子智能体要干大量重复活:路由请求、检索数据、分类文档、验证中间结果。这些任务对智能要求不高,但对调用频次和延迟极其敏感。以前用大模型,成本扛不住;用小模型,能力又不够。Haiku 5.5 正好卡在这个空档。

Anthropic 明确把它定位成 Opus 5.5 和 Sonnet 5.5 执行编码任务时的子智能体模型。大模型当指挥官,Haiku 5.5 当跑腿的。跑腿的便宜、快、够聪明,整个系统才能从"演示级"走向"生产级"。

发布首日,Haiku 5.5 就上线 Amazon Bedrock、Google Cloud、Microsoft Foundry 和 Claude Platform on AWS。真实企业数据比跑分更有说服力。Box 在企业内容平台上做了 400 次查询测试,Haiku 5.5 得分 0.84,Haiku 4.5 是 0.76。Asana 报告称,在其 AI Teammates 产品测试中,Haiku 5.5 将任务完成延迟降低 30% 以上。

别急着吹:早期用户踩到的坑

部分从业者在现有 prompt 上,Haiku 5.5 效果反而不如 Haiku 4.5,出现 prompt 泄漏、准确率下降、速度变慢。这说明新模型需要重新调 prompt,不能直接换模型名就完事。

还有开发者的 Skill 对比测试显示,同一 Skill 在 Haiku 5.5 上三次运行结果波动极大。长上下文也是硬伤。多位开发者认为,100K 对 Agent 和长编码会话来说太低了。Max 模式下自适应思考会拉长响应时间,同一任务时间和成本可能差 35 倍。

总结:怎么选?

Haiku 5.5 不是来争"最强模型"的。它是来争"最可部署模型"的。如果你的任务是短提示、高频率、结构化、对延迟敏感,比如分类、路由、检索、简单界面操作、子智能体跑腿,Haiku 5.5 可能是目前性价比最高的小模型选择。

如果你的任务是长上下文、重创意、需要稳定事实知识,或者复杂 Agent 长链路,别硬上。该用 Sonnet 用 Sonnet,该用 Luna 用 Luna。Haiku 5.5 让 AI Agent 从"能跑"变成了"跑得起"。但跑得好不好,取决于你的任务是不是落在它擅长的区间。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:Claude Haiku 5.5发布:小模型能力暴涨56倍,AI Agent价格打到骨折
#Claude #Haiku 5.5 #Anthropic #AI模型 #Agent架构 
收藏 1
Eazo体验:一句话需求做出专属App,Personal Agent的图形化终点
Jumper螃蟹机器人开源项目:22自由度+AI辅助训练,让机器人自己学会走路
推荐阅读
  • 如何快速体验Gemini 3 Pro?全网 Gemini 3 Pro 的完整体验路径大全
  • 国家互联网应急中心:关于 OpenClaw 安全使用的风险提醒
  • Qwen3.7 Preview 曝光:Arena Text 排名 13,Vision 排名 16
  • Claude工具目录深度体验:MCP协议如何让AI助手变身"万能插座"
  • Qoder实测:2小时生成293个测试全绿,Credits一分不扣
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
34458 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
31037 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23688 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
23190 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
21618 6月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
19210 5月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18839 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18587 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
18341 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16776 1年前

文章目录

关于苏米客
分类排行
1 腾讯WorkBuddy更新独立文件浏览器:AI直接修改原文件,不用搬来搬去
2 Claude Haiku 5.5发布:小模型能力暴涨56倍,AI Agent价格打到骨折
3 GPT-6 Intelligent UI上手指南:ChatGPT直接生成交互界面,不再需要提示词技巧
4 ChatGPT上线Intelligent UI:GPT-6让每个回答都变成交互式界面
5 Claude Dashboards + Motion:一句话生成数据看板和动画短片,Docs/Slides/Design 正式免费
6 Hermes Index 排行榜:Claude Opus 5.5 登顶 Agent 性能榜,14 个模型成本差 215 倍
7 微信全面AI化:28个小微入口最全盘点,Personal Agent已来
8 Anthropic发布新使用政策:禁止辱骂Claude,2026上半年封禁1140万账号
9 Claude Haiku 5.5发布:成本降低75%,支持自定义思考程度
10 a16z 消费级 AI 百强榜发布:近一半美国人用过 AI,仅 4.5% 肯付费
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联