罗福莉也学雷军开直播了。没有主播,没有带货——页面上只有训练曲线,以及一串不断跳动的美元数字。
截至 9 月 17 日下午,MiMo-V2.6 Pro 和 Flash 两条训练线还没跑满两天,累计成本已约 137.8 万美元(按官方看板费率)。有人算账,有人盯曲线,还有工程师把这个页面称为学习强化学习的"金矿"。

Pro 每小时约 2.06 万美元,Flash 每小时约 1.03 万美元,合计一天约 74 万美元。

这不是从头训练,而是一次高强度"补课"
小米直播的是强化学习(RL)后训练。模型已具备语言和代码基础能力,现在被放进不同环境里完成任务,再根据结果调整。
每轮约 1,600 个任务,每个任务让模型尝试 16 次,一轮下来约 2.5 万次尝试。系统根据测试和评分结果调整模型,让它更倾向于选择有效的做法。

每次尝试往往要与工具、环境交互五六十轮——读信息、调用工具、检查结果、继续操作。这一连串操作与反馈,就叫一条"任务轨迹"。数万个隔离环境同时运行,成本就是这样堆起来的。

超过三分之二的任务都在练代码
从任务构成看,超过三分之二是代码任务,其余包括视觉、通用任务、网络安全和对话。可以看出这轮训练很看重 AI 自己调用工具、完成一件事的能力——也就是 Agent 能力。

模型做任务需要外面的一套软件来安排,页面里反复出现的 Harness 就是这套"考场系统"——负责组织过程、连接测试和评分。
成绩不会一直涨
看板里的曲线并不是算力一直增加、能力就稳定向上。以 DeepSWE v1.1 编程评测为例,Flash 的成绩从约 49 分升到约 57 分,又掉回约 54 分,后面继续上升但中间多次回落。

小米还公开了两次运行事故:Pro 曾因一台机器显存问题重启;Flash 因一类任务的运行系统出错,约 3 小时内没被正确识别,退回第 15 步重新运行。

为什么被称为"RL 金矿"
Metrics 栏目能看到每批任务的构成、操作轮数、成功率、耗时、系统故障等过程数据。研究员 Nathan Lambert 称其为目前公开过的最酷的大规模 RL 资源之一,@arjunkocher 说这个页面对 RL 工程师是一座"金矿"。

一扇观察窗口
看板公开了大量过程数据,但具体题目、模型每一步的回答以及完整评分方法尚未公开。罗福莉表示,团队会在接下来的几周陆续开源技术细节。看完这场直播至少能明白:AI 学会做事要经历大量尝试,尝试会失败,成绩会回落,系统也可能出故障——而这些不太漂亮的细节,反而让页面有了不同于产品发布会的价值。