面壁智能与 OpenBMB 社区开源了新一代端侧模型 MiniCPM5-2B。在国际权威基准 Artificial Analysis Intelligence Index 评测中,该模型以 23 分的成绩登顶全球 4B 以下开源基座模型第一,尤其在 Agent 能力上断层领先同级模型。
AA 榜单 4B 以下性能第一
按照 AA Index 最新榜单,MiniCPM5-2B 是全球 4B 参数以下得分最高的开源模型(23 分),高于参数量数倍于己的 Gemma 4 12B(22 分)、Qwen3.5 9B(22 分)和 Qwen3.5 4B(20 分)。

把全部模型按「参数量—得分」放进同一张坐标系,MiniCPM5-2B 站在整条帕累托线的最顶端——两个尺寸(2B 和 1B)各自占住了同级别的性能天花板,印证了面壁智能所坚持的「密度定律」。

低 token 消耗,高响应速度
完成同样的 Intelligence Index 任务时,MiniCPM5-2B 平均只消耗 21k 输出 token(推理 14k、回答 7k),处于全场最低一档——而得分相近的 Qwen3.5 9B 需要 34k,Granite 4.2 8B 需要 26k。对端侧部署来说,这意味着更快的响应和更低的推理成本。

Agent 能力断层领先
在 AA Agentic Index 上,MiniCPM5-2B 拿下 20 分——不仅是第二名 Granite 4.2 8B(9 分)的两倍以上,更远超 gpt-oss-20b(3 分)等参数量十倍于己的模型,而多数同级端侧模型仅有 2 分。

在 GDPval-AA v2 榜单上(以人类基线 1000 分为锚点的 Elo 评分),MiniCPM5-2B 拿到 891 分,是所有参评模型中最接近人类水平的一个,领先第二名 Granite 4.2 8B(702 分)近 190 分。

在「通用智能体」「搜索智能体」「工具调用」「代码推理」等关键维度上均斩获最高分,验证了通用 Agent 能力在高密度端侧模型上的技术可行性。

端侧 Agent 的落地价值
- 隐私安全:端侧 Agent 可直接读取屏幕内容、调用本地应用,处理设备上的本地数据——这些权限出于安全原因很难完全开放给云端服务。
- 离线可用与确定性响应:核心推理不依赖网络连接和远程服务,对嵌入操作系统和硬件产品的 Agent(手机、车机、机器人),确定性比绝对速度更重要。
- 成本优势:本地推理通常不需要按调用次数或 Token 数量持续支付云端 API 费用。对于常驻个人助理、每日自动化流程等长期高频任务,端侧方案有望降低长期使用成本。
MiniCPM 系列模型的开源下载量已突破 5000 万,社区用下载量投的票,往往比跑分更诚实。
高密度端侧模型是怎样炼成的
当参数规模受到端侧设备的硬约束时,底层的数据治理与训练技术栈就成为决定模型上限的关键变量。这次与 MiniCPM5-2B 一同开源了四个数据集:
- UltraX(预训练):用 0.6B 小模型对网页数据做「行级别」自动编辑,避免大模型端到端改写带来的语义漂移。用 UltraX 修复后的数据训练 1B 模型,160 亿 token 达到了原始数据训 200 亿 token 的效果。
- UltraData-Code(代码预训练):按 L0–L3 分级治理,从约 1.92 亿个 GitHub 仓库逐级精炼,完成清洗去重、算法代码筛选和任务导向的结构化合成。
- UltraData-SFT-Agent-2609(SFT):包含 50 多万条 Agent 训练样本,覆盖从基础工具调用到长链路复杂工作流等多样化任务。
- UltraData-RL-2609(RL 后训练):针对答案不可验证、奖励标签不可信、难度不匹配三大痛点,设计了「可验证性过滤→多模型共识校验→rollout 难度筛选」的三阶段清洗流水线。
自研 RL 框架 Meshy 与 JustRL II 算法
面壁智能随 MiniCPM5-2B 开源了全新的自研强化学习框架 Meshy,去掉了 RL 训练的中央控制器和 Ray 依赖,将训练、推理、奖励计算全部建模到对等服务,能够在同步、异步、全异步三种训练模式中灵活切换。
算法层面,MiniCPM 团队提出基于奖励的强化学习策略 JustRL II:数据上用三阶段流水线筛选校准训练数据,算法上给 GRPO 装上 Critic,实现词元级信用分配。在 JustRL II 加持下,MiniCPM5-2B 在 RL 后训练中获得了显著的性能收益。

一本开源账:十个数据集,三年时间线
行业里有个心照不宣的共识:数据管线是各家真正的护城河。绝大多数所谓的「开源模型」,开的其实只是权重。面壁智能这次 MiniCPM5-2B 将模型权重 + 训练 Recipe + 四个训练数据集一并开源,在头部大模型团队里是绝对罕见的做法。
从 2023 年底至今,面壁智能和 OpenBMB 社区累计开源了超过 10 个大模型训练数据集:
- 2023 年 4 月:UltraChat,约 150 万条合成多轮对话,被全球超过 200 个大模型用于对齐训练。
- 2023 年 12 月:UltraFeedback,6.4 万条提示词、38 万条 GPT-4 反馈的偏好数据集。
- 2025 年 12 月:Ultra-FineWeb,约 1T 英文 + 120B 中文 token 的高质量网页预训练语料。
- 2026 年:UltraData-Math(290B+ token 数学语料)、Ultra-FineWeb-L3(600B token)、UltraX-Preview、Ultra-FineWeb-L1,几乎「按月上新」。

截至 2026 年 9 月,UltraData 系列数据集的开源总下载量超过 266 万次。
高质量数据是最厚的地基
当「更大」不再自动等于「更好」,各家比拼的重心正在向数据侧转移。数据治理从不见光的后台工作,变成了决定成败的核心竞争力。一个模型的先进性是有保质期的,几个月后就会被新模型盖过;但一套公开的修复方法、一批高质量的数据集,是别人可以接着往上盖的地基。