一、这次发布的是什么
2026 年 9 月 10 日,DeepSeek 发布了 DeepSeek-V4.1-Flash。官方说它是新架构家族里最小的模型,但自带“看图”能力,也就是原生视觉理解。它通过 DeepSeek API 提供服务,调用时把模型名设为 deepseek-flash 即可。
官方同时把模型权重和论文放到了 Hugging Face,说明这是一次开放权重的发布,而不是只藏在服务器里的闭源服务。对普通用户来说,可以把它理解成一个既能读文字又能看图片、而且跑得很快的智能助手。
二、它为什么又快又省
V4.1-Flash 采用 552B 参数的混合专家(MoE)架构,并使用新的因果编码器-解码器结构:处理输入时只激活 8B 参数,生成输出时只激活 16B 参数。官方称这种“非对称架构”能用更少成本换来更多智能。
打个比方,这就像一支接力队,虽然全队人数很多,但每一棒只让最合适的人上场跑,其他人待命。这样既保留了整体实力,又不会让所有人都同时消耗体力,所以速度更快、开销更低。
三、缓存变小带来什么好处
官方原文说,相比上一代,V4.1-Flash 的 KV 缓存只需要 1/4 的 HBM 和 1/8 的 SSD 存储。KV 缓存可以理解为模型“记住刚才聊过什么”的临时笔记本,笔记本越薄,占的地方和搬运成本就越小。
官方特别指出,缓存命中费用往往在智能体(agent)成本中占很大比例,压缩缓存能显著降低这类费用。对经常让 AI 连续处理多轮任务的用户来说,这意味着同样的预算可以跑更多任务。
四、性能与旧模型的关系
官方称,新的预训练方法加上更大规模的强化学习后训练,让 V4.1-Flash 的基准测试结果超过了旗舰模型 DeepSeek-V4-Pro。原文还提到,多方测试显示 V4.1-Flash 在性能、成本、速度和总运行时间上都领先 V4-Pro,因此官方正在逐步淘汰 V4-Pro。
从 2026 年 9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 请求都会按 V4.1-Flash 的费率路由到 V4.1-Flash,直到 V4.1-Pro 发布。同时,V4-Flash 和 V4-Flash-Vision-Exp 已退役,旧模型名会临时指向 V4.1-Flash 以保持兼容。
五、价格与使用方式的变化
官方表示,更高效的架构让他们能以更低成本服务更多用户,并把节省下来的费用让给用户。新的价格在 2026 年 9 月 10 日 04:00 UTC 生效,继续采用高峰/低谷定价来平衡需求,低谷费率为高峰费率的 50%。
对使用者来说,操作路径很直接:把模型设为 deepseek-flash,并把不着急的任务安排到低谷时段,就能省下费用。官方没有在原文中给出具体价格数字,因此实际花费需要以官方价格页面为准。
六、合作伙伴与开源支持
官方列出 WorkBuddy(包括 CodeBuddy)和 OpenCode 为官方合作伙伴,它们已全面支持 V4.1-Flash。这意味着使用这些工具的用户可以直接体验到新模型,而不必自己搭建环境。
官方还表示会与开源社区紧密合作,推进 V4.1-Flash 的推理支持,并探索更多部署方式;如果有 2000 块 GPU 以上的大规模部署加存储集群需求,可以联系官方洽谈。模型和论文链接都指向 Hugging Face。
七、适合谁用,有什么限制
它适合需要多模态理解、追求低延迟和高吞吐的开发者,也适合对智能体成本敏感、希望把缓存费用压下来的团队。对小学生和初中生来说,可以把它当成一个“看图说话又快又省”的智能小助手。
限制方面,原文没有说明上下文长度、训练数据截止时间、具体基准分数、开源许可证类型和 API 具体价格,也没有给出 V4.1-Pro 的发布时间。因此在大规模使用前,建议先核对官方价格页和模型卡,确认这些细节后再做决定。
本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。