近日,Kimi K3 正式发布,成为目前参数规模最大的开源大语言模型,引发业界广泛关注。如何看待这一模型的实际能力?本文将从多个维度进行分析。
性能表现是否接近旗舰水平?
综合多家国际评测机构的测试结果,Kimi K3 的性能表现基本可信。Arena AI 将其列为互联网开发领域第一名。需要注意的是,该榜单仅比较前端编程能力,在其他维度上仍有领先者。

独立评测机构 Artificial Analysis 将其排名第三。

在办公能力(GDPval v2)、写作能力(Writing Elo)、氛围编程(BridgeBench)、全栈编程(Next.js)等多项测试中,Kimi K3 均位列前三甚至第一。可以确认其官方公告中的定位基本可信:实力略逊于 Claude Fable 5 和 GPT 5.6 Sol,但强于 Claude Opus 4.8。
能力飞跃的原因:参数规模突破
上一个版本 Kimi K2.7 Code 发布于 6 月 12 日,在 Artificial Analysis 排名中仅列第 17 位。仅一个月后,K3 实现了巨大的性能提升,最核心的变化在于参数数量从 1T 增加到 2.8T。

2.8T 的参数规模是空前的,超越了其他所有开源模型,足以与国外旗舰模型比肩。参数量代表了模型在计算 Token 时需要考虑的因素数量——参数越多,通常生成效果越好。


如何控制计算量:MoE 架构
参数越多意味着计算量越大,使用成本和响应时间都会显著上升。真正的技术难点不在于增加参数,而在于如何控制计算量不让它随参数增长而爆炸。
Kimi K3 采用了"专家混合模型"(MoE)架构,每次运算只需激活一部分参数。K3 进一步降低了激活率:共有 896 位专家,每次仅激活 16 位,相当于约 50B 激活参数。相比 K2,整体扩展效率提升了约 2.5 倍。
此外,K3 还采用了两种额外的降算力技术:
- Kimi Delta Attention(KDA):随着新上下文加入,动态删除部分历史信息,降低显存占用。上下文窗口从 256K 扩展到 1M。
- Attention Residuals(注意力残差):动态选择跳过部分网络层,节省算力。
使用成本
尽管采用了多种优化手段,Kimi K3 的使用成本仍然较高。国内 API 定价为百万 Token 输入 20 元/输出 100 元,较 K2.7 Code 的 6.7 元/27 元翻了数倍,可能是目前国内最贵的模型。海外定价为 3 美元/15 美元,与 Claude Sonnet 系列持平,是中国模型在海外售价最高者。
根据 Artificial Analysis 报告,单次任务成本约 0.94 美元,与 GPT 5.6 Sol(1.04 美元)接近,约为 Claude Opus 4.8(1.80 美元)的一半。好消息是每个任务的 Token 消耗比 K2.6 降低了 21%。
实际测试对比
通过四项测试,将 Kimi K3 与 Claude Fable 5、GPT 5.6 Sol 进行对比:
测试一:3D 迷宫生成。GPT 5.6 Sol 最佳,最接近原版 DOOM 游戏;Kimi K3 排名第二,迷宫感强、操作流畅;Fable 5 排名第三,道路过窄。
测试二:3D 魔方动画。GPT 5.6 Sol 明显垫底,魔方质感不足。Kimi K3 与 Fable 5 表现相近,魔方逼真、动画流畅。
测试三:计算器生成。三者均可正常工作。Kimi K3 界面最美观但缺少退位键;GPT 5.6 Sol 表现均衡但样式普通;Fable 5 多出空键位。
综合来看,Kimi K3 的表现完全不逊于旗舰模型,较上一版本进步显著。考虑到其价格不到 Fable 5 的三分之一,加上权重开源、可自由部署,具备相当的竞争力。