刚刚,DeepSeek 开源了 V4.1 Flash ,原生支持视觉理解,也是全新架构系列中最小的一款模型, 550B 总参数,输入时激活 8B,输出时激活 16B(你没看错,输入输出激活不同) 对于这套全新基座,其设计目标便是: 能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型 配套的 DeepSeek Harness 同步更新至 v0.1.5,模型针对其中的不同运行配置做了专项训练。而在 API 中,这一代 Flash 接替上一代 Pro:V4 Pro 将有序下线,相关 API 请求转向 V4.1 Flash,并按新模型的价格计费 DeepSeek V4.1 Flash V4.1 Flash 的主要提升集中在 Agent 任务上。相比 V4 Pro,DeepSWE v1.1 从 62.7 提升到 74.2,Terminal-Bench 3.0 从 11.8 提升到 30.0,Automation-Bench 从 43.2 提升到 54.8,CyberGym 从 83.3 提升到 88.1 在官方列出的对比模型中,V4.1 Flash 在 DeepSWE v1.1、CyberGym 和 Automation-Bench 三项测试上得分最高,超过了表中的 Kimi K3、GLM 5.3、Opus 5 和 GPT 5.6-Sol DeepSeek V4.1 Flash 与其他模型在 Agent 测试中的表现 不过,各项能力的进展并不齐整。V4.1 Flash 在 GPQA Diamond 上的得分仍低于 V4 Pro,在 Terminal-Bench 3.0 等测试上也没有超过表中的全部竞品。更准确地说, 它在多项 Agent 测试中超过了上一代 Pro,部分成绩达到所列前沿模型中的最高水平 DeepSeek V4.1 Flash 完整基准测试结果 550B 总参数,输入只激活 8B V4.1 Flash 采用 MoE 结构, 总参数量为 550B,输入阶段激活 8B,输出阶段激活 16B 这次的新结构,把处理输入与生成输出做成了不对称的两部分 。输入使用较小的激活规模,输出使用较大的激活规模;550B 描述的是模型的总参数量,8B 和 16B 描述的是相应阶段参与计算的参数规模,两者不能混为一谈。 按照发布稿的介绍,这套非对称编码器—解码器结构,目标是在提高能力上限的同时,降低推理成本、提高速度和吞吐量,并继续扩展到更大参数规模。V4.1 Flash 是这个新系列中最小的一款,同时采用了新的预训练方式,以及更大规模的强化学习后训练 长上下文的费用下调 另一项变化在缓存,模型处理过的上下文,可以通过 KV Cache 保存一部分中间计算结果。后续请求中的相同前缀命中缓存时,便可以复用这些结果,不必每次都重新计算 按 DeepSeek 公布的数据,V4.1 Flash 每个 Token 的 KV Cache 从上一代 V4 Flash 的 3514 字节降到了 890 字节,约为此前的四分之一。与初代 DeepSeek V1 相比,则缩小到了约 1/437 DeepSeek 历代模型的每 Token KV Cache 大小 发布稿同时给出了两个存储口径:与上一代相比,缓存相关的 HBM 需求降至 1/4 ,SSD 需求降至 1/8 。这里说的是缓存资源,不能直接理解为整个模型的部署显存也降到了四分之一 配套的 Harness 更新也涉及缓存: 使用 V4.1 Flash 时,新版 DeepSeek Harness 支持在保留已有 KV Cache 的情况下更新系统提示词 这些成本变化反映到了 API 定价上。新价格自 北京时间 2026 年 9 月 10 日 12:00 生效,继续采用峰谷定价,闲时价格为高峰时段的一半。单位均为人民币元/百万 Token 时段: 空闲时段 输入:缓存命中: 0.02 元 输入:缓存未命中: 1 元 输出: 4 元 时段: 高峰时段 输入:缓存命中: 0.04 元 输入:缓存未命中: 2 元 输出: 8 元 高峰时段为工作日北京时间 9:00—12:00、14:00—18:00 ,其余时间均为空闲时段,包括周末休息日。 同样是 100 万输入 Token,闲时缓存未命中收 1 元,命中缓存收 2 分钱,两者相差 50 倍。不过,任务总费用还要加上未命中的输入和输出,不能把缓存单价当成全部 Token 的价格。 举个假设的账单:一批任务累计产生 1 亿缓存命中输入 Token、100 万未命中输入 Token,以及 10 万输出 Token。按上述单价计算,全部在闲时执行,费用为 2+1+0.4=3.4 元 ;同样的用量全部在高峰时段执行,则为 6.8 元 配套的 Harness 一起更新