10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

Claude Sonnet 5.5 发布:性能超越 Fable 5.1 和 GPT-6 Astra,成本大幅降低

1小时前 AI最新动态 5 0

Anthropic 正式发布 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二个模型,定位为 Opus 5.5 的低成本、高速度搭档。速度比 Sonnet 5 快 30% 以上,大部分工作的成本最多降低 30%。

Sonnet 5.5 擅长边界清晰的日常任务、修 bug,以及制作文档、幻灯片和电子表格。在设计审美和品味上接近 Opus 5.5,相比 Sonnet 5 有巨大提升。第三方 Artificial Analysis 测试中,Max 档位直接超越 Fable 5.1 和 GPT-6 Astra。

图片 1

Claude Haiku 5.5 面向大批量、成本敏感的应用,将在未来几周加入该家族。

性能表现

Sonnet 5.5 在 Terminal-Bench 4.0(智能体编程评测)上得分 70.6%,远超 Sonnet 5 的 10.3%。它在长程任务和图像理解上表现也不错,是第一个只看截图就通关《宝可梦 红》的 Sonnet 模型。

在若干评测中,Max 强度下的 Sonnet 5.5 表现与 Opus 5.5 相当。不过官方指出,面对需要持续判断的复杂开放式工作,Opus 5.5 依然明显更强。

图片 2

官方用图表展示了每个模型在各个强度档位下的得分和单任务成本。强度调高,模型工作更久、成本更高、分数也更高。点越靠近左上角,每一美元换来的能力越多。

在多项基准上,Sonnet 5.5 在 Low 或 Medium 强度下就超过了 Sonnet 5 的最高分,单任务成本仅为后者的十分之一左右。它和 Opus 5.5 搭配最合适的是低强度档位(成本更低),在更高档位两者表现相当、成本相近。

图片 3

编程能力

Sonnet 5.5 在编程上的进步最为明显。在 FrontierCode 上,High 强度下比同档位 Sonnet 5 高 10 分,单任务成本约为后者的十五分之一。

图片 4

CursorBench 测试 Cursor 真实编程会话中的任务,Sonnet 5.5 的最佳成绩与 Opus 5.5 相差约两分。在正面对比中,它比 Sonnet 5 更常合并多个工具调用,步骤更少,成本更低。

图片 5

知识工作

GDPval-AA 测试模型在 9 个主要行业、44 种职业中的真实任务表现。Sonnet 5.5 在此项评测中展现出强大的通用能力。

图片 6

总体来看,Claude Sonnet 5.5 以 Opus 5.5 的低成本搭档定位,在大部分日常任务和编程场景中提供了接近旗舰的性能表现。对于需要大量调用的用户来说,Sonnet 5.5 的性价比极具吸引力。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:Claude Sonnet 5.5 发布:性能超越 Fable 5.1 和 GPT-6 Astra,成本大幅降低
#Claude #Sonnet #Anthropic #AI模型 #基准测试 
收藏 1
BrewReel 开源工具:用便宜大模型一键生成竖版宣传片
一套提示词搞定旅行照:AI 手绘卡片对景效果,4种风格实测
推荐阅读
  • MiniMax H3视频模型上线:开源路线、多模态输入、0.23元/秒对标Seedance
  • Codex 插件系统详解:将 Skills、应用集成与 MCP 打包成可复用工作流
  • CodeBuddy Code 2.0 全新升级,还得是腾讯,Claude Code的最强国产平替来了!
  • TRAE CN 国内版悄然上线对话限额:免费及 Pro 套餐均受影响
  • Cursor推出Ultra 计划!Cursor Pro 不限请求次数了!
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
34231 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
30847 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23541 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
22991 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
21332 6月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
19044 5月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18652 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18452 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
18219 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16640 1年前

文章目录

关于苏米客
分类排行
1 Google 发布 Gemini 4 Argon:百万 token 输出,18 项测试 14 项第一
2 Anthropic 长文评测 GLM-5.3:网络安全能力逼近 Claude Mythos 水平
3 Claude Sonnet 5.5 发布:性能超越 Fable 5.1 和 GPT-6 Astra,成本大幅降低
4 Claude Sonnet 5.5 发布:性能逼近 Opus 5.5,价格减半
5 Qoder实测:2小时生成293个测试全绿,Credits一分不扣
6 OpenAI DevDay前瞻:常驻型AI助手"O"曝光,关掉ChatGPT它还在替你干活
7 腾讯Hy Image 3.5 preview实测:生图效果媲美GPT Image 2.5,限时免费
8 Anthropic 两周提速 Claude 3 倍:可衡量就能优化,150 线程并行 + CI 棘轮护栏实战
9 腾讯QClaw宣布12月停运:AI办公内部赛马结束,WorkBuddy胜出
10 网易有道Confucius4双榜第一:R2T2语音识别与T3PO实时翻译模型开源
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联