月之暗面 Kimi K3 模型如约开源。这是全球首个 3 万亿参数级别的开源模型,采用 MoE 架构,总参数 2.8 万亿,实际激活参数 1040 亿,支持 100 万 token 上下文窗口,同时具备原生视觉理解能力。

核心结论:Kimi K3 在综合能力上仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但已全面超越 Claude Opus 4.8、GPT-5.5 和 GLM-5.2。

架构核心改动
Kimi Delta Attention(KDA):线性注意力方法,每模块 3 层 KDA + 1 层全局注意力(Gated MLA),MLA 改为无位置编码(NoPE),位置信息靠 KDA 门控衰减机制隐式传递。

Attention Residuals:每层网络可选择性回看更早层信息,93 层网络分为 8 个块,仅在块与块之间做全量跨层注意力。
混合专家网络(MoE):专家数从 384 扩展到 896,每 token 激活从 8 个提升到 16 个,稀疏度从 48 倍提高到 56 倍。新激活函数 SiTU-GLU 限制数值幅度,Quantile Balancing(QB)算法解决负载均衡。

训练效率提升 2.5 倍
综合架构改动和训练方法优化,K3 相对 K2 整体训练效率提升约 2.5 倍。上下文长度从 128K 提升到 100 万 token,通过四阶段课程学习逐步扩展窗口。
后训练流程
- 监督微调:高质量复杂智能体轨迹数据打底
- 强化学习:通用任务、通用智能体、编程智能体三大类,每类三档推理强度,共九个专家模型
- 多教师同策略蒸馏:合并九个专家模型到统一模型

强化学习延续 co-located 协同部署架构,百万 token 级别实验控制在几百张 GPU 规模。从后训练阶段就使用 MXFP4 低精度格式训练专家权重。
基础设施:MoonEP
团队设计了 MoonEP 专家并行方案,通过动态调度冗余专家消除负载不均衡。与 DeepSeek DeepEP v2 对比,MoonEP 通信耗时几乎不受不均衡程度影响,始终保持稳定。目前除支持 NVIDIA GPU 外,还在适配阿里真武 PPU 国产芯片。

模型地址:huggingface.co/moonshotai/Kimi-K3
开源协议附带商用条件:年收入超 2000 万美元需单独授权,月活超 1 亿需在界面展示 Kimi K3 字样。