8月26日晚,阿里通义千问团队正式发布全新多模态 MoE 模型 Qwen3.8-Flash。该模型主模型参数量为 125B,额外配备 51B N-gram Embedding,每 Token 仅激活 6B 参数,原生支持 262,144 Tokens 上下文,并可通过 YaRN 扩展至100万 Tokens。

Qwen3.8-Flash 围绕 Attention、Residual、Embedding 和 Optimization 四个方向升级模型架构。在注意力机制方面,模型采用 Gated DeltaNet 与 Qwen Sparse Attention 组成的混合架构:GDN 负责压缩和保留历史信息,QSA 则在 Micro-block 粒度筛选重要上下文,从而降低长序列处理中的注意力与索引开销。
官方数据显示,在100万 Token 上下文下,QSA Attention Kernel 在 Prefill 和 Decode 阶段最高分别实现 7.6 倍和4.9倍加速。在90%前缀缓存命中率的测试环境中,Qwen3.8-Flash 的 Prefill 吞吐达到 Qwen3.7-Plus 的8.6倍。
模型同时引入 Gated Residual,将传统单一残差流扩展为4条并行分支,通过动态门控改善跨层信息传递和训练稳定性;51B N-gram Embedding 则以较低的额外计算成本扩展模型容量,并可卸载至 Host Memory。训练方面,Qwen3.8-Flash 采用 Muon Optimizer,并针对新架构重新拟合 Scaling Law。
与 Qwen3.7-Plus 相比,Qwen3.8-Flash 的训练开销约为前者的九分之一,但在 AI 编程、办公任务和智能体场景中表现更强。模型现已上线千问 AI 平台并提供 API 服务,价格为每百万 Tokens 输入1元、输出3元,生产版本默认提供100万 Token 上下文和官方内置工具。Qwen3.8-Flash 也同步首发接入“千问办公”,面向文档、表格、演示文稿和专业研究等办公场景提供服务。
与此同时,千问团队开放了 Qwen3.8-Flash-Next 模型权重。该版本是下一代 Qwen4 架构的实验性预览,开发者可以通过 Hugging Face 和 ModelScope 下载并自行部署。官方表示,提前开放权重是为了让开发者社区对新架构进行测试和验证,并为后续完整的 Qwen4 模型家族做准备。


