10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

Kimi K3 开源:全球首个 3 万亿参数 MoE 模型,100 万 token 上下文

1小时前 AI最新动态 10 0

月之暗面 Kimi K3 模型如约开源。这是全球首个 3 万亿参数级别的开源模型,采用 MoE 架构,总参数 2.8 万亿,实际激活参数 1040 亿,支持 100 万 token 上下文窗口,同时具备原生视觉理解能力。

图片 1

核心结论:Kimi K3 在综合能力上仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但已全面超越 Claude Opus 4.8、GPT-5.5 和 GLM-5.2。

图片 2

架构核心改动

Kimi Delta Attention(KDA):线性注意力方法,每模块 3 层 KDA + 1 层全局注意力(Gated MLA),MLA 改为无位置编码(NoPE),位置信息靠 KDA 门控衰减机制隐式传递。

图片 3

Attention Residuals:每层网络可选择性回看更早层信息,93 层网络分为 8 个块,仅在块与块之间做全量跨层注意力。

混合专家网络(MoE):专家数从 384 扩展到 896,每 token 激活从 8 个提升到 16 个,稀疏度从 48 倍提高到 56 倍。新激活函数 SiTU-GLU 限制数值幅度,Quantile Balancing(QB)算法解决负载均衡。

图片 4

训练效率提升 2.5 倍

综合架构改动和训练方法优化,K3 相对 K2 整体训练效率提升约 2.5 倍。上下文长度从 128K 提升到 100 万 token,通过四阶段课程学习逐步扩展窗口。

后训练流程

  • 监督微调:高质量复杂智能体轨迹数据打底
  • 强化学习:通用任务、通用智能体、编程智能体三大类,每类三档推理强度,共九个专家模型
  • 多教师同策略蒸馏:合并九个专家模型到统一模型

图片 5

强化学习延续 co-located 协同部署架构,百万 token 级别实验控制在几百张 GPU 规模。从后训练阶段就使用 MXFP4 低精度格式训练专家权重。

基础设施:MoonEP

团队设计了 MoonEP 专家并行方案,通过动态调度冗余专家消除负载不均衡。与 DeepSeek DeepEP v2 对比,MoonEP 通信耗时几乎不受不均衡程度影响,始终保持稳定。目前除支持 NVIDIA GPU 外,还在适配阿里真武 PPU 国产芯片。

图片 6

模型地址:huggingface.co/moonshotai/Kimi-K3

开源协议附带商用条件:年收入超 2000 万美元需单独授权,月活超 1 亿需在界面展示 Kimi K3 字样。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:Kimi K3 开源:全球首个 3 万亿参数 MoE 模型,100 万 token 上下文
#Kimi K3 #月之暗面 #开源模型 #MoE #大语言模型 
收藏 1
Agent Skills 沉淀企业 SOP:从静态文档到可调度知识资产
元宝接入美团外卖助手:语音点单全程不跳出App,腾讯生态再打通
推荐阅读
  • 2025年度AI报告合集|深度解读行业趋势与技术突破
  • GLM-5.1 技术报告:744B 参数开源模型,SWE-Bench Pro 58.4 分全球第一
  • 谷歌出手封禁接入OpenClaw的用户:Antigravity订阅账号不是 API
  • ChatGPT Agent 正式发布:OpenAI的"AI打工人"到底有多强?
  • 谷歌放大招!免费开源的 Gemini CLI,冲着Claude Code来的!
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
32831 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
29381 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
21704 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
21406 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
17764 4月前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
17471 1年前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
17366 3月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
16922 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
16895 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
15793 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 元宝接入美团外卖助手:语音点单全程不跳出App,腾讯生态再打通
2 Kimi K3 开源:全球首个 3 万亿参数 MoE 模型,100 万 token 上下文
3 MonkeyCode:国产开源 AI 编程平台,云端开发 + 手机编程,每天 3000 万免费 Token
4 Kimi K3 开源:2.8 万亿参数 MoE 架构,100 万 token 上下文,训练效率提升 2.5 倍
5 千问办公上线速测:钉钉生态打通的独立 AI Agent 办公产品
6 SkillOS:用 RL 训练 8B 小模型管理 Agent 技能库,效果超 Gemini
7 Google Gemini Spark 开放 AI Pro 订阅:20 美元/月的个人 AI 智能体
8 Doubao-Seed-Evolving:支持 1M 上下文、按周迭代的持续进化大模型
9 Macaron-V1:基于 GLM-5.2 的 MoL 架构个人智能体,2M 上下文 + 四大专家 LoRA
10 Qwen-Image-3.0:落字成画,字字如印——千问新一代图像生成模型
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联