10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

面壁智能 WAIC 发布 MiniCPM-Robot:开源具身智能模型,RMBench 得分 53 分

1月前 AI最新动态 410 0

让机器人执行「把这个按钮按五下」这样的指令,其实比想象中困难得多。不少 VLA(视觉-语言-动作)模型要么按一下就停,要么停不下来——因为它们根本不记得自己已经按过几次。这个看似不起眼的毛病,背后折射出的是具身智能领域一直未能解决好的核心问题:记忆。

在近日举行的世界人工智能大会(WAIC)上,面壁智能发布了首个具身智能系列模型并开源,包含两个模型:负责操作的 MiniCPM-RobotManip 和负责跟踪导航的 MiniCPM-RobotTrack。

具身智能的记忆门槛

主流的 VLA 模型靠摄像头「看」、语言指令「懂」,然后输出动作。但大多数模型只看「这一帧」——判断下一步时只依据当前画面和指令,不参考之前的观测和动作。如果把历史观测纳入判断,效果会更好,但计算量会成倍增长,许多团队因算力压力只能选择放弃记忆,回到「看一帧、算一步」的做法。

视觉 Token 压缩是关键

面壁智能的 MiniCPM-RobotManip 基于 MiniCPM-V 4.6 多模态大模型训练,核心技术是视觉 Token 极致压缩。在机器人应用场景中,VLA 模型每次推理通常要处理三张摄像头图片加一段文本指令,每秒重复多次。如果能把图片转换成的 Token 数量压低且信息不丢失,计算量就会显著减少,推理速度更快。凭借这一能力,MiniCPM-RobotManip 即使将历史观测数据纳入输入,推理成本仍能追平传统单帧模型。此外采用流式计算方法,让带记忆的推理成本与传统无记忆模型持平。

图片 1

图片 2

跑分数据

在主流 VLA 基准测试中,MiniCPM-RobotManip 的综合性能位列第一梯队,与 Qwen-VLA、π0.5 等主流模型相近甚至更出色。在考验上下文记忆的 RMBench 榜单上,主流 π0.5 模型得分仅 10 分(接近随机水平),而 MiniCPM-RobotManip 达到 53 分。

图片 3

纯本地跟踪:断网也能跟

MiniCPM-RobotTrack 解决的是另一个问题:机器人在没有网络的地方能否正常工作。基于 MiniCPM4-0.5B 模型训练,参数仅 0.9B,无需额外感知模块或外接开发板,仅靠原装摄像头和本地算力就能完成单目标跟踪、动态多目标跟踪和指令模糊跟踪。

评测结果显示,三项细分能力的跟踪成功率分别达到 89.8%、73.4% 和 80.4%,是目前开源方案中的最优结果。

图片 4

工程层面,团队围绕宇树 Go2 机器狗的完整运行链路做了系统级优化,在本地算力上稳定跑到每秒 5 帧以上,端到端响应延迟约 180 毫秒。纯本地部署带来了三方面优势:无需等待网络传输和云端响应、画面和指令不上传云端降低隐私风险、弱网或无网环境下依然正常工作。

配套推理引擎与落地案例

同时发布的推理框架 PhyAI,在 NVIDIA RTX 5090 上对 π0、π0.5、GR00T 等主流模型分别带来 2.9 倍、1.8 倍和 2.3 倍的推理加速。面壁发布的机器人模型在当天即完成适配,推理帧率从 10Hz 提升到 33Hz。

落地方面,面壁与乐聚机器人合作推出展厅导览和园区巡检方案;与吉利汽车联合训练 VLA 模型,通过 RoboHarness 框架将 VLM、VLA、机器人本体和导航系统整合,落地到生产仓储场景。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:面壁智能 WAIC 发布 MiniCPM-Robot:开源具身智能模型,RMBench 得分 53 分
#面壁智能 #具身智能 #MiniCPM #WAIC #机器人 
收藏 1
微信支付 SkillPay 上线:Agent 可付费调用技能,知识付费迎来新模式
Claude HUD:Claude Code 终端状态栏插件,实时监控上下文与Token用量
推荐阅读
  • 重磅更新:Claude 现可接管整台电脑,鼠标、键盘与屏幕一体化操控
  • GPT-5.5正式发布:全面超越 Claude Opus 4.7,重新夺回 SOTA 宝座
  • GLM-5.2 实测评估:DeepSeek 之上的复杂执行层模型,海外社区真实反馈
  • Cline 升级:Minimax‑2.1、Kimi‑k2.5 限时免费开放,Cline CLI 2.0 同步上线
  • Chrome 融合 Gemini:浏览器升级为可执行的智能代理,哪些工作流会真正受益?
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
33731 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
30222 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23210 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
22413 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
20141 5月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
18488 4月前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18127 1年前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18078 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
17702 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16321 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 WorkBuddy 应用市场上线:行业专属工作台+开放生态,要再造一个 AI 版小程序平台
2 谷歌发布 Gemini 2.5 Flash:跑分硬刚 Opus 5,价格仅七分之一的高性价比 AI 模型
3 WorkBuddy 开放平台上线实测:上传第一个 Skill 的完整体验
4 智谱 GLM-5.3 开放权重:Hacker News 热帖与本地部署指南
5 MiniMax H3 视频模型开源部署指南:含越狱编码器与提示词模板
6 腾讯Hy4 preview实测:对比GLM-5.3,谁的Agent编程能力更强?
7 豆包工作实测:只给一个博主名字,自动完成抖音博主内容研究
8 微信AI硬核技术开源:WeMM-Embedding 多模态搜索实测
9 豆包coding再升级:doubao-seed-evolving 无限流模式实测
10 智谱发布牛来模型:对标DeepSeek的国产大模型新突破
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联