10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

GLM-5.3-FlashX 上线:推理提速 5 倍达 200 tokens/s,Agent 构建推理 Infra

1小时前 AI最新动态 10 0

智谱上线 GLM-5.3-FlashX,推理速度最高 200 tokens/s,较 GLM-5.3-Flash 模型提速 5 倍,价格提价 2.5 倍,API 同步开放。这背后是在 10 万张国产芯片提供的推理算力基础上,进一步加大对 Infra 侧的投入与推理优化。

GLM 的 Infra,由 GLM 构建

跑 Flash 的这套 Infra,是由 GLM-5.3 驱动 Agent 构建的——从模型适配一路做到生产上线,前后不到两周,端到端吞吐做到了初始基线的 3 倍。

GLM-5.3-Flash 性能演进

在构建过程中,人负责定目标、设边界、搭好反馈环境和关键修改审核,而测试、日志、Trace、微基准都交给 Agent。它自己查问题、改代码、跑实验,局部验证通过后再放回完整服务里验收,完成「稠密反馈」闭环。

基于稠密反馈的 Infra Agent 优化闭环

三个优化案例

案例一:输入 FP32,计算却用了 TF32

KDA 的 CP 路径出现精度偏差,长上下文下尤其明显。Agent 顺着状态合并和更新过程排查,问题落在两处 tl.dot 上:输入是 FP32,计算却默认用了 TF32,误差逐步积累。修复方式是显式加上 input_precision="tf32x3",已合入 Flash Linear Attention 上游。

案例二:KV Transfer 被 GIL 卡住

同样的 workload,Prefill 加上传输后性能差距应不超过 5%,测试却跑出了 20% 以上。Agent 翻看 Trace,发现 KV Transfer 的 Python 侧执行始终没能和 DeepEP 的 dispatch/combine 调用重叠——DeepEP v1.2.1 的两处 C++ 调用没有释放 GIL,负责 Mooncake Transfer 的 Python 线程拿不到锁。修复后,性能差距降到 1% 以内。

KV Transfer 并发瓶颈排查与修复

案例三:同一组计算做了四遍

KDA Decode 沿 V 维度分块,同一组 FP32 归一化和门控计算被不同分块重复做了四遍。Agent 把分块合到同一线程块里,提前批量计算并共享中间结果——并行度少了一些,但重复计算去掉了,算子性能提高到优化前的 1.71 倍。

KDA Decode 算子性能演进

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:GLM-5.3-FlashX 上线:推理提速 5 倍达 200 tokens/s,Agent 构建推理 Infra
#AI动态 #智谱 #GLM #推理优化 #Agent 
收藏 1
Jev 模型发布:OpenAI 核心大佬打造纯决策 AI,速度快 200 倍成本降 400 倍
这是最后一篇
推荐阅读
  • Cursor 教育优惠风险提示:SheerID验证error、学信网二次审核、国科大研究所等可能引发Cursor 风控
  • OpenAI 用 1 万个 Agent 88 小时求解纳维-斯托克斯方程:千禧年数学难题突破
  • OpenAi 刚刚在 ChatGPT 中试点群聊功能
  • 阿里发布AI 图像编辑模型Qwen‑Image‑Edit,真的够用吗?
  • 腾讯Hy4 preview实测:对比GLM-5.3,谁的Agent编程能力更强?
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
34036 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
30625 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23412 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
22812 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
20995 5月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
18892 5月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18491 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18327 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
18073 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16530 1年前

文章目录

关于苏米客
分类排行
1 GLM-5.3-FlashX 上线:推理提速 5 倍达 200 tokens/s,Agent 构建推理 Infra
2 Jev 模型发布:OpenAI 核心大佬打造纯决策 AI,速度快 200 倍成本降 400 倍
3 HD-V1 视频模型实测:先理解再生成,音画同步与物理规律全面突破
4 Agent 自动上传代码库引隐私担忧:开源办公 Agent 为何更重要——以有道 LobsterAI 为例
5 小米 MiMo-V2.6 公开 RL 训练直播:两天烧掉千万,过程数据成研究金矿
6 Anthropic公开AI递归自我改进核心数据:3万Agent参与研发,人类正退出一线
7 Gemini 3.8 Live 发布:语音天梯榜登顶,价格仅为 OpenAI 实时 API 的三分之一
8 OpenAI Codex 用户反馈:300 万阅读量下的额度限制、产品定位与体验痛点
9 ChatGPT Pro X20 暂停新订阅:定价策略还是算力不足?
10 GPT Image 2.5 全面升级:免越狱生成、Sketch 草图、精准编辑,实测对比 Z-Image
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联