DeepSeek V4.1 Flash 是什么
DeepSeek-V4.1-Flash 是深度求索推出的原生多模态 MoE 大模型,也是其新一代模型结构系列中尺寸最小的一款,与此前的 DeepSeek-V4-Flash 并非同一架构。模型主干参数 552B,采用非对称的因果编码器-解码器(CED)结构,预填充阶段每 token 激活 8B 参数,解码阶段激活 16B,并通过多项 KV Cache 压缩设计降低长上下文推理的显存与存储占用。模型支持 1M 上下文与图文联合输入,主要面向高吞吐、低成本的 Agent、编程与多模态理解任务。

DeepSeek V4.1 Flash 的主要特性
- 非对称模型结构: 输入与输出采用不同的激活规模,输入仅激活 8B 参数,输出激活 16B 参数,在维持模型能力的同时降低推理资源消耗。
- 原生多模态能力: 可直接处理图像输入,完成图片理解、界面识别、图表分析以及视觉辅助推理等任务。
- 强化 Agent 能力: 支持工具调用、JSON Output、Responses API 和 Anthropic API,可用于复杂任务拆解、编程及自动化工作流。
- 支持双推理模式: 同一模型兼容思考模式和非思考模式,开发者可根据任务难度、延迟及成本要求灵活选择。
- 超长上下文: API 提供 1M tokens 上下文长度,最大输出长度达到 384K tokens,适合长文档、代码仓库和持续运行的 Agent 任务。
- 更小的 KV Cache: 相比上一代模型,对 HBM 的需求降低至约四分之一,对 SSD 的需求降低至约八分之一,有助于压缩长上下文缓存成本。
- 更低调用成本: 通过架构优化减少计算和缓存开销,并继续采用峰谷定价,闲时价格为高峰时段的一半。
- 开放模型权重: 官方已在 Hugging Face 发布模型权重和技术报告,便于研究机构与具备算力条件的团队开展推理适配和私有化部署。
DeepSeek V4.1 Flash 的应用场景
- AI 智能体开发: 用于需要长期上下文、频繁工具调用和多步骤执行的自主 Agent,降低缓存及持续推理成本。
- AI 编程: 支持代码生成、代码理解、错误排查、仓库级分析以及终端任务执行,可接入 OpenCode 等开发工具。
- 视觉理解: 处理截图、网页界面、图表、文档图片和其他视觉材料,并结合文本完成分析与推理。
- 长文档处理: 利用 1M 上下文分析报告、论文、合同、技术文档及大规模代码内容。
- 企业 API 集成: 通过兼容 OpenAI 与 Anthropic 的 API 格式,将模型接入客服、知识库、办公自动化及业务系统。
- 本地研究与部署: 适合拥有大规模 GPU 和存储集群的机构进行推理优化、模型评测及私有化部署研究。
DeepSeek V4.1 Flash 的 API 价格
DeepSeek API 按每 100 万 tokens 计费:
| 计费项目 | 闲时价格 | 高峰价格 |
|---|---|---|
| 输入(缓存命中) | 0.003 美元 | 0.006 美元 |
| 输入(缓存未命中) | 0.15 美元 | 0.30 美元 |
| 输出 | 0.60 美元 | 1.20 美元 |
工作日 UTC 01:00–04:00、06:00–10:00 为高峰时段,其余时间执行闲时价格。上述价格已于北京时间 2026 年9月10日12:00 生效,后续以 DeepSeek 官方价格页面为准。
如何使用DeepSeek-V4.1-Flash
- 网页端或 App 体验: 访问 https://chat.deepseek.com 或下载 DeepSeek App。官方发布公告主要介绍 API 与开源,网页端和 App 的模型切换情况以官方说明为准。
- 获取 API Key: 访问 https://platform.deepseek.com 注册账号,完成充值后创建 API Key。
- 配置调用参数: OpenAI 格式的 base_url 为
https://api.deepseek.com,Anthropic 格式为https://api.deepseek.com/anthropic,模型名填写deepseek-flash。完整文档见 https://api-docs.deepseek.com/zh-cn/ - 设置思考强度与图片输入: 通过
thinking参数开关思考模式,通过reasoning_effort设置 low、high 或 max。需要识图时,在 content 数组中加入image_url或file内容块。 - 下载开源权重: 访问 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash。该版本不含 Jinja 格式对话模板,需使用仓库内
encoding目录的参考实现,或官方 deepseek-recipe 工具库处理提示词编码。推荐采样参数为 temperature 1.0,top_p 0.95 或 1.0。 - 在合作工具中使用: 腾讯 WorkBuddy、CodeBuddy 以及 OpenCode 作为官方合作伙伴已接入该模型,可在对应产品中直接选用。
常见问题
Q:DeepSeek-V4.1-Flash 是开源的吗?可以免费使用吗?
A:模型权重以 MIT 协议在 Hugging Face 开源,可免费下载,协议允许商用与修改。通过 DeepSeek API 调用则按 token 付费,并区分高峰与空闲时段计价。
Q:它和 DeepSeek-V4-Flash、V4-Flash-Vision-Exp 是什么关系?
A:V4.1-Flash 采用了全新的 CED 模型结构和新的预训练方式,原生支持多模态,不是在 V4-Flash 基础上加装视觉模块。V4-Flash 与 V4-Flash-Vision-Exp 已在 API 下线,出于兼容考虑,旧模型名的请求会暂时由 V4.1-Flash 承接,并按 V4.1-Flash 价格计费。
Q:它和 DeepSeek-V4-Pro 相比如何?
A:官方表示,经多方测试,V4.1-Flash 在性能、费用、速度、总用时等指标上已超过 V4-Pro,并计划有序下线 V4-Pro。自北京时间 2026 年 9 月 14 日 12:00 起至 V4.1-Pro 上线前,deepseek-v4-pro 的请求将路由到 V4.1-Flash,按 V4.1-Flash 价格计费。不过从官方模型卡看,V4-Pro 在 GPQA Diamond、HLE 纯文本子集等部分推理与知识类指标上仍略高。
Q:如何调节思考强度?
A:API 支持 low、high、max 三档,默认开启思考模式且强度为 high。简单任务可选 low,复杂任务可选 max。自部署开源权重时,可以使用 1–100 的整数进行更细粒度的调节。
Q:本地部署需要什么条件?
A:官方未公布最低硬件要求。仓库提供 FP8 格式权重、权重转换与推理示例代码。官方表示将支持开源社区完成推理框架适配,主流推理框架的支持进度需关注后续更新。有大规模部署需求且具备约 2000 卡 GPU 和存储集群资源的团队,可以直接联系 DeepSeek 合作。


