2026年09月10日,DeepSeek 正式发布 DeepSeek V4.1 Flash。这是 DeepSeek 全新模型结构系列中尺寸最小的模型,定位是在提高能力上限的同时,兼顾推理速度、服务吞吐量与使用成本,并为未来扩展至更大参数模型验证新的技术架构。

DeepSeek V4.1 Flash 是一款总参数量为 552B 的 MoE 模型,采用全新的 Causal-Encoder-Decoder 非对称结构,输入阶段仅激活 8B 参数,输出阶段激活 16B 参数。配合新的预训练方法和更大规模的强化学习后训练,官方表示,该模型在多项 Agent 基准测试中的综合表现已经超过 DeepSeek V4 Pro 等旗舰模型。
V4.1 Flash 还具备原生多模态视觉理解能力,可处理图片、界面、图表及视觉文档等内容。官方 API 提供 1M tokens 上下文和最高 384K tokens 输出,并支持思考与非思考模式、工具调用、JSON Output、Responses API,以及兼容 OpenAI 和 Anthropic 的接口格式。
针对 Agent 长时间运行产生的缓存成本,DeepSeek 对 KV Cache 进行了进一步压缩。与上一代模型相比,新模型对 HBM 的需求降低至约四分之一,对 SSD 的需求降低至约八分之一。与 DeepSeek 初代模型相比,其 KV Cache 规模累计缩小约 437 倍,有助于降低多轮对话、长上下文和智能体任务的运行成本。
DeepSeek V4.1 Flash 已同步上线 DeepSeek API,开发者将模型名称设置为 deepseek-flash 即可调用。原有的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 暂时保持兼容,但实际请求将由 V4.1 Flash 处理。腾讯 WorkBuddy、CodeBuddy 和 OpenCode 也已全量接入该模型。
API 新价格已于北京时间 2026 年 9 月 10 日 12:00 生效。高峰时段每百万 tokens 的缓存命中输入、缓存未命中输入和输出价格分别为 0.006 美元、0.30 美元和 1.20 美元;闲时价格统一为高峰价格的一半。
此外,DeepSeek 计划从北京时间 9 月 14 日 12:00 起,在 V4.1 Pro 上线前,将发送至 deepseek-v4-pro 的请求统一路由至 V4.1 Flash,并按照 V4.1 Flash 单价计费。目前,V4.1 Flash 的模型权重与技术报告均已在 Hugging Face 开放。


