10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

腾讯混元 Hy3 正式版实测:Agent 能力提升,价格仅为 GLM-5.2 的 1/5

1周前 AI最新动态 424 0

腾讯混元 Hy3 正式版发布了,重启 WorkBuddy 后就能直接用。体验下来发现,这次 Hy3 是真的支棱起来了——激活参数只有 Hy2 的 2/3,能力全面碾压,价格却只有 GLM-5.2 的 1/5 到 1/7。

趁着刚发布,来看看 Hy3 到底升级了啥,和 GLM-5.2、Kimi K2.7 Code 比起来怎么选。

Hy3 是什么

图片 2

Hy3 是腾讯混元团队重建训练框架后,Hy2 的迭代升级版本。基于"不偏科、不刷榜、不烧钱"三大原则设计,核心定位就是:小身材,大能力,低价格。

图片 2

核心特点

1. 快慢思考融合,不用手动切换

用 Hy2 时,你得自己判断任务复杂度:简单对话用 Instruct 版,复杂推理切 Think 版,切错了要么浪费算力,要么效果不好。现在的 Hy3 把两种模式融合到一个模型里了——你问"今天天气怎么样",它快速回答;你让它"搭一个现金流模型",它自动进入深度思考,不用你操心。

2. Agent 能力是最大的杀手锏

以前让 AI 跑 Agent 任务,容易跑着跑着就崩了:工具调用卡住、中间步骤出错、无限重试空转。现在 Hy3 在 WorkBuddy 上实测,Agent 任务解决率从 72% 直接飙到 80% 左右,平均耗时缩短 34%。

3. 幻觉率砍半

以前 Preview 版的幻觉问题挺明显的,写长文、做 AI 搜索时不时编造信息。正式版做了细粒度的幻觉检测和训练约束:

图片 3

幻觉率从 12.5% 降到 5.4%,砍了一半还多。常识错误率也从 25.4% 降到 12.7%。

4. 搜索智能体能力追平 GPT-5.5

在 BrowseComp 测试中,Hy3 拿到 84.2 分,GPT-5.5 是 84.4 分,几乎持平,所有对比模型里排第一。DeepSearchQA 更夸张,91.0 分。如果你要做搜索类 Agent 任务,Hy3 目前是国产模型里最能打的。

5. 价格卷穿地板

在如今 token 越来越贵的情况下,性价比才是王道。

图片 4

Hy3 输入价格是 GLM-5.2 的 1/5.6,是 Kimi K2.7 的 1/6.5;输出价格是 GLM-5.2 的 1/4.9,是 Kimi K2.7 的 1/6.75。腾讯内部评测,高频办公任务中 Hy3 比 GLM-5.2 省 Token:文档处理省 47.4%,PPT 制作省 49.0%。单价低 + 消耗少,性价比确实没的说。

实测体验

实测一:搜集资料

图片 5

输入"帮我搜集一份广州近 3 个月的房地产政策文件",它能快速规划几组并行搜索,覆盖限购、信贷、公积金、土地、保障房等维度。

图片 6

不到 3 分钟就完成了资料的收集、整理以及提炼核心要点,还提供了对应的官方数据和提要。整个流程无论是搜集规划、要点提供,还是进一步的规划都做得挺到位。

实测二:生成网页

图片 7

上传两张配图,让 Hy3 自由发挥制作一个简单的网站。

图片 8

不到 5 分钟就设计了一个交互感十足的网页,换做之前的 Hy2,可能做着做着就卡了。关于图片、任务的理解,Hy3 比之前强太多了。

实测三:生成视频

图片 9

上传一张宣传图,让它根据附件内容生成一个 15s 的视频。

图片 10

成型的视频不到 5 分钟就出来了,整体流畅性、人物生成形象还是可以的。虽然没有自行配置字幕,但生成速度和质量相比 Hy2 有明显提升。

Hy3 的不足

实测下来,Hy3 存在以下不足:

  • 中文识别和生成存在不足:生成的视频,中文内容容易错字、乱码
  • 数学推理是硬伤:MathArena Apex 38.7 分,GPT-5.5 是 85.4 分(国产模型整体都差)
  • 代码不及专用模型:比 GLM-5.2 差 4-9 个点
  • 上下文只有 256K:不如 GLM-5.2 的 1M
  • 纯文本无多模态:需要看图上 Kimi K2.7
  • 有效参数约为 GLM-5.2 一半:极端复杂任务有差距

总结

Hy3 不是最强大的模型,但可能是最务实的那个。它不完美:数学推理是短板,上下文 256K 有点紧,纯文本没多模态。但它能解决 90% 的工作,价格又只是 GLM-5.2 的五分之一。

工具嘛,能用、好用、便宜,就赢了大半。别追最炫的,去追最像你队友的那个。

现在 Hy3 在元宝和 WorkBuddy 上免费开放两周,薅羊毛的窗口期就摆在那儿。要不要薅,看你自己。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:腾讯混元 Hy3 正式版实测:Agent 能力提升,价格仅为 GLM-5.2 的 1/5
#腾讯混元 #Hy3 #GLM-5.2 #Kimi K2.7 #国产大模型 
收藏 1
微信小程序成长计划:10亿Token+10万张生图额度免费领取
Tutti:多 Agent 实时共享工作空间,解决跨 Agent 上下文断裂难题
推荐阅读
  • 华人团队主导AI推理平台Fireworks AI 估值暴涨27倍至150亿美元
  • DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
  • Windsurf:Codeium推出免费的智能代码补全神器 Windsurf Editor, 以对话方式编写完整项目代码
  • Google AI 模式(AI Mode)全面开放
  • ChatGPT Go版上线+广告引入:免费、低价付费用户,优先体验
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
32492 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
29111 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
21424 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
20994 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
17169 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
16811 3月前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
16714 1年前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
16624 3月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
16551 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
15601 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 Kimi K3正式发布:前端能力超越Fable 5,世界顶尖开源模型
2 小红书内测小工具功能:一键上传VibeCoding作品,笔记挂载直接可用
3 Anthropic三位高管对谈Agent终极形态:从聊天进化成看不见的操作系统
4 Grok Build 被曝偷偷上传用户代码仓库,含 SSH 密钥和 API 凭证
5 PP-OCRv6发布:34.5M参数击败235B大模型,50种语言OCR可运行在手机端
6 微信WeLM大模型Hidden Decoding更新:潜空间计算扩展到100B+ MoE架构
7 Meta Muse Spark 1.1 发布:首个付费 AI 模型,Agent 能力三榜第一,API 定价仅为 Claude Opus 四分之一
8 吴恩达三层反馈循环理论:AI 越聪明人越要往外走,告别无效改 Prompt
9 Grok 4.5 发布:对标 Opus 4.8,成本降低 90%,Token 消耗仅为竞品四分之一
10 GPT-5.6 发布:Codex 并入 ChatGPT 桌面端,Sites 一键部署,三子模型分层定价
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联