心洲科技旗下 Mind Lab 实验室开源了 Macaron-V1 模型——全球首个基于 GLM-5.2 完成后训练的个人智能体模型。该模型采用 MoL(Mixture of LoRA)架构,在 GLM-5.2 基座之上外挂四个 1B 规模的 LoRA 专家,分别处理对话、智能体、代码和 UI 渲染任务,原生支持 2M 超长上下文。
模型概览
Macaron-V1 定位为面向个人智能体场景的开源模型,权重、官方 API 和配套工具已全部上线。提供两个版本:
- Macaron-V1-Venti:748B 参数(744B 基座 + 4 个 1B LoRA),旗舰版本,原生支持 2M 上下文
- Macaron-V1-Tall:35B 参数,基于通义千问 3.6 后训练,适合本地部署和隐私敏感场景
MoL 架构:四个专业专家,互不打架
Macaron-V1 的核心设计是 MoL(Mixture of LoRA)架构。GLM-5.2 基座完全冻结,上面挂四个独立的 LoRA 专家:
- L0 Chat:对话和指令遵循的主干
- L1 Agent:面向个人生活场景的重度工具使用,覆盖长程复杂任务(Preview 版 OpenClaw 相关 LoRA 已合并进 L1)
- L2 Coding:代码理解、SWE 任务、终端操作
- L3 UI/A2UI:UI4A 渲染和 UI 驱动操作
这种插件式架构天然支持持续学习——未来加入新能力只需训练新的 LoRA 接入,不会动摇模型已有知识体系。
实测:UI4A 生成式界面
Macaron V1 内置了 UI4A 生成式 UI 架构,由 L3 UI 专家驱动,能够直接渲染出丰富的交互式视图。通过在 Claude Code 中安装 Macaron Artifacts 插件进行了测试。
测试场景:用自然语言描述财务流水("花了 2500 块买显示器、卖了 500 股腾讯股票、发了 15000 元工资"),模型自动提取数据并渲染出包含环形图、资产走势折线图、可编辑数据表格的完整 Dashboard。表格数据修改后,图表联动更新。
API 地址:https://mintcn.macaron.xin/
实测:Coding 能力
Case 1:Three.js 机械太阳系仪
要求用 Three.js 创建蒸汽朋克风格的"机械太阳系仪",纯靠数学公式和原生几何体构建黄铜支架与齿轮,PBR 材质渲染,封装在单个 HTML 文件中。Macaron V1 在 Claude Code 中一边构建一边调用浏览器截图实时测试,直到成功。
Case 2:十二段落交互式水墨山水长卷
用 WebGL 手搓包含十二个段落的"交互式水墨山水长卷",每段视觉节奏和色调都有明确区别(晨雾远山 → 江畔渔舟 → 芦苇滩 → 溪涧飞瀑 → 松林听风 → 竹林幽径 → 云雾山谷 → 古寺扫径 → 悬崖栈道 → 暮色亭台 → 黄昏点萤竹林 → 月夜孤舟),配合古琴音色的 Web Audio API 背景音乐,书法文字用状态机管理防止重叠。整个过程耗时约 30 分钟,模型持续进行端到端测试和屏幕截图找故障。
最终效果涵盖了从晨雾远山到月夜孤舟的完整体验,十二段落的滚动阻尼、视差速度和墨色浓淡过渡清晰可辨。
实测:Agent 能力
让 Macaron V1 在 FastAPI 仓库(tiangolo/fastapi)中自主寻找被社区反复提出但未实现的功能需求。经过约 2 小时探索,模型选中了 #12481 号 issue——一个关于同时使用多个 Query、Header、Cookie 参数模型的老问题(从 2024 年 10 月提出至今未合并)。

模型定位根因:FastAPI 处理单个 Pydantic 模型时会展开字段为独立参数,但多模型同时传入时只有第一个被展开。它修复了两处单模型判断逻辑,新增六个测试覆盖多模型场景,补充了教程示例和八个配套测试。跑完仓库三千多个测试,全部通过。
训练基础设施
2M 原生上下文训练:团队提出 LongStraw 方案——共享长提示词只算一次存为可复用常驻状态,只重放有学习信号的回复分支。实测数据:8 张 H20 上 Qwen3.6-27B 的 GRPO 训练推到 210 万 token,常驻前缀训练到 446 万 token;32 张 H20 上 GLM-5.2 全模型训练同样达到 210 万 token。
模型自我进化:MinT 管理底层训练基础设施,Actor 和 Learner 之间只传 Adapter,端到端可支撑万亿参数模型。HyperRSI 跑递归自我改进闭环,MindForge 训练框架将生产环境 Harness 接入强化学习,用 HCP 协议对齐训练和线上环境。
评测表现
团队自建了两个评测集:
- ChatBench:模型在长智能体上下文中的诚实度评估
- LivingBench:跨数周的纵向评测,在模拟沙盒中测试长程任务稳定性

在 VitaBench、PinchBench、SWE-Verified、DeepSWE、TerminalBench 2.1、UI4A-Bench 等通用能力轴线上,与 Opus 4.8、GPT 5.5 等前沿模型对比。官方结论:在个人生活和生成式 UI 两条线上,Venti 能打平甚至超过前沿基线;编程能力保持接近前沿水平。

总结
Macaron-V1 的核心思路不是"什么都会",而是把个人场景拆开,用 MoL 架构隔离不同能力独立训练。指令遵循更安全,危险操作会先询问用户,coding 幻觉比原版 GLM-5.2 更小。对于关注 Agent 方向和个人智能体的开发者,这是一个值得关注的开源项目。