updream-视频生成助手
当前位置:首页>AI模型>Qwen3.8-Flash:阿里通义千问最新推出的多模态大模型

Qwen3.8-Flash:阿里通义千问最新推出的多模态大模型

Qwen3.8-Flash是什么

Qwen3.8-Flash 是阿里通义千问面向 AI 编程、办公智能体和长上下文任务推出的多模态 MoE 模型。模型通过稀疏注意力、门控残差与 N-gram Embedding 扩展模型容量并降低计算开销,在每 Token 仅激活 6B 参数的情况下,兼顾模型能力、响应效率与使用成本。生产版本由千问 AI 平台提供 API 服务,并默认支持100万 Token 上下文和官方内置工具。

需要注意,Qwen3.8-Flash 是面向生产环境的 API 版本;Qwen3.8-Flash-Next 则是面向社区开放权重的实验版本,也是下一代 Qwen4 架构的技术预览。

Qwen3.8-Flash-Next

Qwen3.8-Flash的主要特性

  • 高效MoE架构: 主模型拥有 125B 参数,每 Token 仅激活约 6B 参数,在保留较大模型容量的同时降低推理计算量。
  • GDN与QSA混合注意力: Gated DeltaNet 负责压缩和保留历史信息,Qwen Sparse Attention 在 Micro-block 粒度筛选重要上下文,兼顾长程记忆与精准检索。
  • 长上下文处理: 原生支持 262,144 Tokens,并可通过 YaRN 扩展至100万 Tokens,生产版本默认提供100万 Token 上下文。
  • 长序列推理加速: 在100万 Token 上下文测试中,QSA Attention Kernel 的 Prefill 和 Decode 阶段最高分别实现 7.6 倍和4.9倍加速。在90%前缀缓存命中率条件下,Prefill 吞吐可达到 Qwen3.7-Plus 的8.6倍。
  • Gated Residual: 将传统单一残差流扩展为4条并行分支,通过动态门控控制信息读写,改善深层网络中的信息传递和训练稳定性。
  • N-gram Embedding: 增加 51B 查表式参数,用于记录短语和局部语言模式。相关参数可卸载至 Host Memory,并通过异步预取降低显存占用。
  • 优化训练效率: 采用 Muon Optimizer,并针对新架构重新拟合 Scaling Law。官方数据显示,其训练开销约为 Qwen3.7-Plus 的九分之一。
  • 编程与办公能力: 在降低训练和推理成本的同时,重点增强代码生成、软件工程、办公任务和长周期智能体执行能力。
  • 多模态能力: 能够结合文本与视觉信息理解任务,适用于界面分析、多模态智能体及需要观察执行结果的工作流。

Qwen3.8-Flash的应用场景

  • AI编程: 用于代码生成、项目理解、错误修复、测试执行和大型代码仓库分析。
  • 办公智能体: 处理文档、表格、演示文稿和研究资料,完成多步骤办公任务及完整成果交付。
  • 长文档分析: 借助100万 Token 上下文分析合同、研究报告、技术文档和企业知识库。
  • 多模态智能体: 理解软件界面、图表和视觉结果,并结合工具完成操作、验证与迭代。
  • 企业API集成: 接入客服、知识库、数据分析、研发辅助和业务自动化系统。
  • 专业研究任务: 服务于金融研究、法律分析、技术调研及需要长程推理的专业场景。

Qwen3.8-Flash的API价格

千问 AI 平台采用按 Token 用量计费:

  • 输入价格: 1元/百万 Tokens
  • 输出价格: 3元/百万 Tokens

该价格使其适合长文档处理、智能体高频调用和大规模企业应用。实际计费规则、免费额度及活动价格以千问 AI 平台为准。

如何使用Qwen3.8-Flash

  1. 访问模型页面: 打开 https://www.qianwenai.com/models/qwen3.8-flash,查看模型介绍、调用方式和最新价格。
  2. 体验模型能力: 普通用户可通过千问办公使用 Qwen3.8-Flash,完成文档、表格、演示文稿及专业研究任务。
  3. 开通API服务: 开发者在千问 AI 平台注册并创建 API Key,按照平台文档配置请求地址和身份验证信息。
  4. 选择模型名称: 在 API 请求中将模型设置为 qwen3.8-flash,根据业务需求提交文本或多模态内容。
  5. 配置上下文与工具: 利用生产版默认100万 Token 上下文和官方内置工具,搭建长文档分析、AI 编程或办公智能体应用。
  6. 选择部署方式: 需要自主部署和研究新架构的用户,可下载 Qwen3.8-Flash-Next 权重;企业生产应用则更适合直接调用 Qwen3.8-Flash API。

Qwen3.8-Flash的官方资源

  • 千问AI平台:https://www.qianwenai.com/models/qwen3.8-flash
  • 技术博客:https://qwen.ai/blog?id=qwen3.8-flash-next
  • GitHub技术报告:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
  • Hugging Face:https://huggingface.co/Qwen/Qwen3.8-Flash-Next
  • ModelScope:https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next

常见问题

Q:Qwen3.8-Flash开源吗?

A:面向千问 AI 平台提供服务的 Qwen3.8-Flash 是生产版 API 模型。官方同步开放了 Qwen3.8-Flash-Next 权重,供开发者自主部署和研究新架构。

Q:Qwen3.8-Flash与Qwen3.8-Flash-Next有什么区别?

A:两者基于相近的新架构。Qwen3.8-Flash 是默认支持100万 Token 上下文和官方工具的生产服务版本;Flash-Next 是开放权重的实验版本,也是 Qwen4 架构的技术预览。

Q:Qwen3.8-Flash适合普通用户吗?

A:适合。普通用户可以通过千问办公体验其文档处理、办公创作和研究能力,无需自行部署模型。

Q:Qwen3.8-Flash主要强在哪里?

A:核心优势是以较低激活参数和 API 成本,提供较强的编程、办公智能体、多模态理解和超长上下文能力。

©版权声明:如无特殊说明,本站所有内容均为AIHub.cn原创发布和所有。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。否则,我站将依法保留追究相关法律责任的权利。 即梦AI