#强化学习
小米 MiMo-V2.6 公开 RL 训练直播:两天烧掉千万,过程数据成研究金矿
罗福莉也学雷军开直播了。没有主播,没有带货——页面上只有训练曲线,以及一串不断跳动的美元数字。
截至 9 月 17 日下午,MiMo-V2.6 Pro 和 Flash 两条训练线还没跑满两天,累计成本已约 137.8…
Agentic RL:强化学习如何训练 AI Agent 的长周期决策能力
大模型的强化学习训练走过了三个阶段:RLHF 告诉模型人类喜欢哪种回答,Reasoning RL 训练思维链(o1、DeepSeek R1),而现在正在发生的第三个阶段目标更大——训练模型在真实环境里持续行动的能力。…