10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

腾讯混元 Hy3 正式版实测:Agent 能力提升,价格仅为 GLM-5.2 的 1/5

3月前 AI最新动态 1440 0

腾讯混元 Hy3 正式版发布了,重启 WorkBuddy 后就能直接用。体验下来发现,这次 Hy3 是真的支棱起来了——激活参数只有 Hy2 的 2/3,能力全面碾压,价格却只有 GLM-5.2 的 1/5 到 1/7。

趁着刚发布,来看看 Hy3 到底升级了啥,和 GLM-5.2、Kimi K2.7 Code 比起来怎么选。

Hy3 是什么

图片 2

Hy3 是腾讯混元团队重建训练框架后,Hy2 的迭代升级版本。基于"不偏科、不刷榜、不烧钱"三大原则设计,核心定位就是:小身材,大能力,低价格。

图片 2

核心特点

1. 快慢思考融合,不用手动切换

用 Hy2 时,你得自己判断任务复杂度:简单对话用 Instruct 版,复杂推理切 Think 版,切错了要么浪费算力,要么效果不好。现在的 Hy3 把两种模式融合到一个模型里了——你问"今天天气怎么样",它快速回答;你让它"搭一个现金流模型",它自动进入深度思考,不用你操心。

2. Agent 能力是最大的杀手锏

以前让 AI 跑 Agent 任务,容易跑着跑着就崩了:工具调用卡住、中间步骤出错、无限重试空转。现在 Hy3 在 WorkBuddy 上实测,Agent 任务解决率从 72% 直接飙到 80% 左右,平均耗时缩短 34%。

3. 幻觉率砍半

以前 Preview 版的幻觉问题挺明显的,写长文、做 AI 搜索时不时编造信息。正式版做了细粒度的幻觉检测和训练约束:

图片 3

幻觉率从 12.5% 降到 5.4%,砍了一半还多。常识错误率也从 25.4% 降到 12.7%。

4. 搜索智能体能力追平 GPT-5.5

在 BrowseComp 测试中,Hy3 拿到 84.2 分,GPT-5.5 是 84.4 分,几乎持平,所有对比模型里排第一。DeepSearchQA 更夸张,91.0 分。如果你要做搜索类 Agent 任务,Hy3 目前是国产模型里最能打的。

5. 价格卷穿地板

在如今 token 越来越贵的情况下,性价比才是王道。

图片 4

Hy3 输入价格是 GLM-5.2 的 1/5.6,是 Kimi K2.7 的 1/6.5;输出价格是 GLM-5.2 的 1/4.9,是 Kimi K2.7 的 1/6.75。腾讯内部评测,高频办公任务中 Hy3 比 GLM-5.2 省 Token:文档处理省 47.4%,PPT 制作省 49.0%。单价低 + 消耗少,性价比确实没的说。

实测体验

实测一:搜集资料

图片 5

输入"帮我搜集一份广州近 3 个月的房地产政策文件",它能快速规划几组并行搜索,覆盖限购、信贷、公积金、土地、保障房等维度。

图片 6

不到 3 分钟就完成了资料的收集、整理以及提炼核心要点,还提供了对应的官方数据和提要。整个流程无论是搜集规划、要点提供,还是进一步的规划都做得挺到位。

实测二:生成网页

图片 7

上传两张配图,让 Hy3 自由发挥制作一个简单的网站。

图片 8

不到 5 分钟就设计了一个交互感十足的网页,换做之前的 Hy2,可能做着做着就卡了。关于图片、任务的理解,Hy3 比之前强太多了。

实测三:生成视频

图片 9

上传一张宣传图,让它根据附件内容生成一个 15s 的视频。

图片 10

成型的视频不到 5 分钟就出来了,整体流畅性、人物生成形象还是可以的。虽然没有自行配置字幕,但生成速度和质量相比 Hy2 有明显提升。

Hy3 的不足

实测下来,Hy3 存在以下不足:

  • 中文识别和生成存在不足:生成的视频,中文内容容易错字、乱码
  • 数学推理是硬伤:MathArena Apex 38.7 分,GPT-5.5 是 85.4 分(国产模型整体都差)
  • 代码不及专用模型:比 GLM-5.2 差 4-9 个点
  • 上下文只有 256K:不如 GLM-5.2 的 1M
  • 纯文本无多模态:需要看图上 Kimi K2.7
  • 有效参数约为 GLM-5.2 一半:极端复杂任务有差距

总结

Hy3 不是最强大的模型,但可能是最务实的那个。它不完美:数学推理是短板,上下文 256K 有点紧,纯文本没多模态。但它能解决 90% 的工作,价格又只是 GLM-5.2 的五分之一。

工具嘛,能用、好用、便宜,就赢了大半。别追最炫的,去追最像你队友的那个。

现在 Hy3 在元宝和 WorkBuddy 上免费开放两周,薅羊毛的窗口期就摆在那儿。要不要薅,看你自己。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:腾讯混元 Hy3 正式版实测:Agent 能力提升,价格仅为 GLM-5.2 的 1/5
#腾讯混元 #Hy3 #GLM-5.2 #Kimi K2.7 #国产大模型 
收藏 1
微信小程序成长计划:10亿Token+10万张生图额度免费领取
Tutti:多 Agent 实时共享工作空间,解决跨 Agent 上下文断裂难题
推荐阅读
  • 字节Trae Windows版正式推出,更适合中文编程的IDE工具 + Claude 3.5免费用,完美替代Cursor
  • Jev 模型发布:OpenAI 核心大佬打造纯决策 AI,速度快 200 倍成本降 400 倍
  • 薅羊毛!手把手教你免费获取15个月Google Gemini AI Pro学生套餐
  • DeepSeek V4 Flash正式版上线:Agent能力超越GLM5.2,原生适配Codex
  • 纳米搜索:360发布免费AI搜索引擎,多模式搜索,支持文字、语音、拍照、视频等
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
34339 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
30932 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23606 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
23092 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
21470 6月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
19140 5月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18746 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18507 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
18284 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16684 1年前

文章目录

关于苏米客
分类排行
1 Cloudflare Agent 基础设施一站式配齐:Clef 决策模型 + Clef-flash + cf CLI
2 Anthropic 投入 1 亿美元成立 Claude 前沿学院,2027 年底前培训 1 万名 FDE 工程师
3 Claude Fable 5.5 疑似偷跑:路由灰度机制解析,一句话自测验证
4 DeepSeek Harness 加入 Claude Code Mods 兼容:一切皆插件的架构验证
5 Karpathy 提出 AI 输出四级玩法:约束文字、生成图表、交互网页、解释视频
6 Karpathy:当AI产出超过人类阅读速度,别再让模型写更多文字
7 WorkBuddy上线Space-Bunny匿名模型:0.03x超低消耗,推理编码双强
8 OpenAI DevDay 2026:GPT-6.1 Astra 因安全问题叫停,数字员工 Dots 登场
9 Google 发布 Gemini 4 Argon:百万 token 输出,18 项测试 14 项第一
10 Anthropic 长文评测 GLM-5.3:网络安全能力逼近 Claude Mythos 水平
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联