2026年7月,中国大模型赛道接连投下两枚重磅炸弹。7月17日,月之暗面在 WAIC 上海发布 Kimi K3——全球首个 3 万亿级别的开源模型,以 2.8 万亿参数将开源阵营推入新纪元。仅仅两周后,7月31日,DeepSeek 祭出 V4 Flash 正式版,2840 亿参数的轻量模型凭借纯后训练优化,Agent 能力实现翻倍式跃升。
一个追求性能天花板,一个死磕极致性价比。本文将从架构设计、智能指数、Agent 能力、成本博弈、生态部署五大维度进行深度拆解。

架构对决:万亿旗舰 vs 轻量刺客
Kimi K3采用稀疏混合专家(Sparse MoE)架构,总参数量达 2.8 万亿,拥有 896 个专家网络,每次推理激活 16 个专家、约 1040 亿参数。核心创新在于 Kimi Delta Attention(KDA)线性注意力机制——在 93 层网络中,69 层使用 KDA,24 层使用门控多头注意力(MLA),配合注意力残差技术,在百万 token 上下文下实现最高 6.3 倍的解码效率提升。此外,K3 原生集成 MoonViT-V2 视觉编码器(401M 参数),支持图像和视频理解。
DeepSeek V4 Flash则走了完全不同的路:2840 亿总参数、仅 130 亿激活参数,MoE 架构配合压缩稀疏注意力(CSA)与重度压缩注意力(HCA)的混合机制。创新点在于流形约束超连接(mHC)和 Muon 优化器。在百万 token 场景下,V4 Flash 的推理 FLOPs 仅需前代 V3.2 的 27%,KV 缓存仅需 10%。模型采用 FP4/FP8 混合精度,43 层网络,在超过 32 万亿 token 上完成预训练。
智能与编程:天花板之争
在 Artificial Analysis Intelligence Index 评测中,截至 8 月 2 日,Kimi K3 以 57 分位居榜首,超越了 Claude Opus 5(56 分)、GPT-5.6 Sol(56 分)等海外旗舰。DeepSeek V4 Flash 以 50 分紧随其后。

K3 是史上首个在该榜单登顶的开源模型。在前端编程领域,K3 以 1679 分登顶 Arena.ai Frontend Code Arena,超越 Claude Fable 5(1631 分)和 GPT-5.6 Sol(1618 分)。V4 Flash 以 1586 分位列开放类别第三,被评价为「同类产品中性价比最高的」。
需要指出的是,K3 在专家级数学(FrontierMath Tier 4 约 39%)和事实幻觉控制(AA-Omniscience 非幻觉率 49%)上仍存在明显短板。
Agent 能力:后训练的奇迹
在软件工程基准 DeepSWE 上,K3 得分 69,V4 Flash 得分 54.4。但 V4 Flash 真正的故事在于「后训练奇迹」——预览版到正式版,模型架构和参数完全一致,唯一的变化是重新进行了后训练。结果 DeepSWE 从 7.3 分飙升至 54.4 分,涨幅超 6 倍;Terminal Bench 2.1 从 61.8 升至 82.7。

这一结果的技术含义极为深远:预训练决定能力上限,后训练决定上限能兑现多少。V4 Flash 此前「知道怎么做」但「做不到」——后训练将潜在知识转化为可执行的行动能力。
K3 在 Agent 领域的优势则体现在「长程」二字。它可在聊天界面直接启动完整 Agent 任务,在虚拟机环境中自主编写代码、测试、修复,连续工作 3 至 12 小时完成复杂项目开发。AA-Briefcase Agent 智能工作基准中,K3 排名全球第二,仅次于 Fable 5 Max。
成本博弈:50 倍价差
如果说性能差距是 7 分(AA 指数)和 15 分(DeepSWE),那么价格差距就是 50 倍。K3 的 API 定价为输入 20 元/百万 token(缓存命中 2 元)、输出 100 元/百万 token。V4 Flash 则为输入 1 元、输出 2 元,缓存命中低至 0.02 元(98% 折扣)。

有 AI 产品负责人反馈,同样的长任务此前用 K3 花了 200 多元,用 V4 Flash 只花了 3.67 元。V4 Flash 还引入了峰谷定价机制——高峰时段价格翻倍,平峰维持低价。这 50 倍价差意味着一个预算有限的创业团队,用 V4 Flash 可以跑 50 倍于 K3 的 Agent 任务量。
生态与部署
K3 采用 Modified MIT 许可证,权重已开放下载,支持 vLLM、SGLang、TensorRT-LLM。但其 2.8 万亿参数的体量意味着部署门槛极高——官方建议 64 张及以上加速卡组成超节点部署。
V4 Flash 同样采用 MIT 协议,凭借 2840 亿参数和 FP4/FP8 混合精度,128GB 内存的 Mac 设备即可本地运行。它还原生支持 OpenAI Responses API 格式,针对 Codex CLI、VS Code 插件做了专项适配,开发者不改 Base URL 即可一键接入。

两条路线的产业意义
K3 代表「性能天花板」路线——用最大的参数规模、最前沿的架构创新,将能力推到极致。对于不差钱的顶尖团队、有极高能力要求的复杂场景,K3 是当前开源阵营的最佳选择。
V4 Flash 代表「智能平权」路线——用最小的参数、最低的成本,让尽可能多的用户用上足够好的 AI。对于个人开发者、中小团队、高频 Agent 场景,V4 Flash 是当前性价比最优的选择。
这两条路线并非对立,而是互补。未来的大模型应用架构,很可能是「混合路由」模式:复杂任务用 K3 等旗舰模型处理,高频任务用 V4 Flash 等轻量模型兜底。
「重活上 K3,杂活上便宜模型。」——这可能是 2026 年大模型落地的最优解。
选型速查
| 使用场景 | 推荐模型 | 理由 |
|---|---|---|
| 大型代码库重构、长程 Agent | Kimi K3 | 编程榜单第一,百万上下文 |
| 多模态任务(截图、文档) | Kimi K3 | 原生视觉理解,V4 Flash 不支持 |
| 日常 Bug 修复、终端操作 | V4 Flash | Agent 能力够用,成本极低 |
| 批量自动化、高频调用 | V4 Flash | 50 倍价差,规模化优势 |
| 本地私有化部署 | V4 Flash | 128GB Mac 可跑,门槛低 |
| Codex 生态接入 | V4 Flash | 原生适配,一键接入 |
📦 开源地址:Kimi K3 — Hugging Face | DeepSeek V4 Flash — Hugging Face