#MoE
Kimi K3 开源:2.8 万亿参数 MoE 架构,100 万 token 上下文,训练效率提升 2.5 倍
Kimi K3 模型权重正式开源,参数量达到 2.8 万亿,实际激活参数 1040 亿,支持 100 万 token 上下文窗口,同时具备原生视觉理解能力。这是目前公开的首个 3 万亿参数级别的开源模型。
核心结论:Kimi K3 在综合能…
Kimi K3 深度评测:2.8T 参数开源模型,性能能否媲美旗舰?
近日,Kimi K3 正式发布,成为目前参数规模最大的开源大语言模型,引发业界广泛关注。如何看待这一模型的实际能力?本文将从多个维度进行分析。
性能表现是否接近旗舰水平?
综合多家国际评测机构的测试结果,Kimi K3 的性能表现基本可信。…
微信WeLM大模型Hidden Decoding更新:潜空间计算扩展到100B+ MoE架构
微信自研大语言模型 WeLM 近日再次更新。WeLM 官方博客发布了一篇题为《Hidden Decoding at Scale:面向前沿大模型的潜空间计算扩展》的技术论文,将此前已在中小规模模型上验证的「隐式解码」机制,扩展到了 100B+…
实测美团LongCat-2.0:5万张国产芯片跑出的万亿参数MoE大模型
美团发布了 LongCat-2.0,一个总参数 1.6 万亿(激活约 480 亿参数)的 MoE 模型。值得瞩目的是,该模型从预训练到大规模部署,全程跑在 5 万张国产算力芯片上,耗时一个多月,处理超过 35 万亿 tokens,全程无回滚…
微信大语言模型 WeLM 揭秘:专为微信生态设计的低成本 MoE 架构,128K 长上下文
随着微信 AI Agent「小微」的内测版上线,其背后的大语言模型也浮出了水面。
不是腾讯的混元,不是深度求索的 DeepSeek,不是智谱的 GLM,而是微信自研的大语言模型 WeLM(WeChat Language Model)。
01…
Qwen3.6-35B-A3B-Uncensored:35B参数仅3B激活的完全解锁开源MoE模型
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive 是一个基于 Qwen3.6 MoE 架构的去审查开源模型,由 HauhauCS 制作。该模型在 465 个测试案例中实现了 0 次拒绝,在 Hug…
本地 Coding Agent 最佳拍档:LM Studio + Pi Agent + Gemma 4 26B A4B 完整部署指南
在 Token 大饥荒时代,各家 Code Plan 订阅要么抢不到,要么限流,再不就是像 Anthropic 这样动不动就封号。本文测试本地 Coding Agent 能否真正干活——结论:可以,而且比预期好很多。…
GLM-5.1 技术报告:744B 参数开源模型,SWE-Bench Pro 58.4 分全球第一
智谱于 2026 年 4 月 8 日正式开源 GLM-5.1,这是一款拥有 744B 总参数、40B 激活参数的混合专家模型(MoE),采用 MIT 开源协议。该模型在长程任务执行能力上取得显著突破,能够零人工介入独立工作超过…
Moemate:AI虚拟伴侣,提供海量角色的AI虚拟伴侣平台
Moemate是一个由AI驱动的虚拟陪伴助手,可以进行生动的对话,提供日常生活中的有价值的帮助,成为一个有趣和智能的助手,为你的生活带来乐趣。它可以进行随和的交谈,当你孤单或无聊时陪伴你。它也可以提供日常生活中的协助,比如提醒日程安排、搜…