千问AI平台正式上线 Qwen3.8-Flash 模型。这款采用 Next 代架构的多模态混合专家(MoE)模型,在编程和智能体任务中展现出极高的性价比。
Qwen3.8-Flash 总参数达千亿级别,但每次推理仅激活 6B(60亿)参数,创下模型效率新基准。最新定价如下:
• 输入:0.8 元/百万 Tokens(国际站 0.15 美元)
• 输出:2.7 元/百万 Tokens(国际站 0.47 美元)
• 缓存命中:0.1 元/百万 Tokens(国际站 0.016 美元)

在架构层面,Qwen3.8-Flash 引入了四项核心创新:
QSA 稀疏注意力机制。与 GDN 融合构建混合注意力架构,显著降低计算开销。在 1M Tokens 长上下文的高缓存命中场景中,推理速度提升 8 倍以上。
Gated Residual 门控残差方法。将传统 Transformer 的单一信息主通道拆分为 4 条,模型可根据任务动态决定信息读写策略,训练稳定性大幅提升。
51B N-gram Embedding 外挂参数。通过高效查表寻址为 Transformer 提供"记忆指南手册",每次 token 计算时无需参与额外计算,以极小资源消耗扩展模型容量。
结构与优化协同训练。模型架构设计与后期调优同步进行,收敛效率和训练吞吐量显著改善,直接推动训练与推理成本下降。
API 服务已在千问AI平台首发上线,开发者可通过 API 或 Token Plan 调用。千问办公"标准模式"也已内置 Qwen3.8-Flash,可覆盖 95% 的日常办公场景。
Qwen3.8-Flash-Next 模型权重已在 Hugging Face 和魔搭社区开源。
至此,Qwen3.8 系列三大尺寸模型——2.4T 参数量的 Qwen3.8-Max、Qwen3.8-27B 及 Qwen3.8-Flash——均已上线千问AI平台提供 API 服务。