DeepSeek V4.1 Flash 官方发布:552B CED MoEdeepseek-flash 与峰谷定价
- ID: 78956e92
- 原文链接: https://www.deepseek.com/news/deepseek-v4-1-flash
- 作者: DeepSeek
- 日期: 2026-09-10
- 平台: blog
- 来源类型: article
- 标签: deepseek, v4.1-flash, model-release, moe, pricing, multimodal, field-note
- 质量评分: 4/5
- 抓取时间: 2026-09-11T15:54:30+00:00
- 抓取状态: ok
中文导读
DeepSeek 官方发布 V4.1 Flash,称其为全新结构系列的小尺寸模型:552B 参数 MoE,Causal-Encoder-Decoder 非对称结构,输入激活 8B输出激活 16B,并具备原生多模态视觉理解官方强调 KV Cache 对 HBM/SSD 需求分别降到上一代的 1/4 和 1/8,API 模型名为 deepseek-flash,V4 Flash/Vision Exp 将路由到新模型,并从 2026-09-10 12:00 起执行新的峰谷定价
为什么值得关注
V4.1 Flash 的重点不只是新分数,而是 CED MoEKV Cache 压缩API 路由和峰谷价格一起改变 DeepSeek 的 agent 成本面
图片
- https://www.deepseek.com/images/blog/deepseek-v4-1-flash/agentic-benchmark.png
- https://www.deepseek.com/images/blog/deepseek-v4-1-flash/benchmark-zh.png
- https://www.deepseek.com/images/blog/deepseek-v4-1-flash/kv-cache.png
- https://www.deepseek.com/images/blog/deepseek-v4-1-flash/pricing-zh.jpg
抓取内容(opencli-first)
DeepSeek V4.1 Flash:更强、更快、更普惠
发布时间: 2026-09-10
原文链接: https://www.deepseek.com/news/deepseek-v4-1-flash/
今天,我们正式发布 DeepSeek V4.1 Flash 模型。这是我们全新模型结构系列中的最小尺寸的模型,具备原生多模态视觉理解能力。新模型结构的设计初衷是:能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型。
非对称模型结构,小成本大智能
DeepSeek V4.1 Flash 为 552B 参数的 MoE 模型,采用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称,输入激活只有 8B,输出激活 16B,成本显著低于已知的同尺寸模型。同时,V4.1 Flash 还采用了新的预训练方式、经过了更大规模的强化学习后训练,在基准测试中,成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平。
DeepSeek-V4.1-Flash 与主流前沿模型在 Agentic Benchmark 上的性能对比
更少缓存,更省成本
新一代模型大幅减少了 KV Cache 缓存的大小,与上一代模型相比,对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8。在 Agent 使用场景中,缓存命中的费用往往占比较高,对 KV Cache 的压缩大幅降低了 Agent 类任务的使用成本。
如图展示了 DeepSeek 在减少上下文存储方面的持续进展。相对于初代模型,KV Cache 已经缩小了 437 倍。
API 支持
DeepSeek V4.1 Flash 已同步上线 DeepSeek API,原生支持多模态,将模型名称更改为 deepseek-flash 即可调用最新的 V4.1 Flash 模型。旧版本模型 V4 Flash 与 V4 Flash Vision Exp 现已下线,出于兼容考虑,模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 将被暂时路由到 V4.1 Flash。
同时,经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 DeepSeek V4 Pro,因此我们计划有序下线 V4 Pro 模型。北京时间 2026 年 9 月 14 日 12:00 之后,至未来 V4.1 Pro 上线之前,用户访问 deepseek-v4-pro 的请求将全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。
WorkBuddy(含 CodeBuddy)和 OpenCode 作为官方合作伙伴,现已全量接入 DeepSeek V4.1 Flash,欢迎使用!
API 定价调整
得益于模型架构的创新,DeepSeek V4.1 Flash 能够以更低的成本服务更多的用户,因此我们相应下调了 V4.1 Flash 的定价。同时,为了更合理地调配资源,我们仍然采用峰谷定价,闲时价格为高峰时段价格的一半,鼓励用户根据实际使用情况调整任务时间。新价格于 2026 年 9 月 10 日 12:00 开始生效。
模型开源
我们将会全力支持开源社区进行新模型的推理适配,并尝试通过各种方式扩大部署的范围。如果您有大规模部署的需求且具备相应的资源(2k 卡 GPU、有存储集群),欢迎与我们联系。
Obsidian evidence excerpt
执行摘要
- 题目:DeepSeek-V4.1-Flash —— 官方合同行 vs AA 分栏
- 材料:
DeepResearch/2026-09-11-evening-DeepSeek-V41-Flash-研究材料/ - 主结论:Flash 是 552B CED MoE +
deepseek-flash+ MIT;AA 给 Index 40 / Automation 69% / ~$0.27/task;9/14 Pro 下线计划被现网 docs 改口为继续提供 - 产出:调研本文件 + Content 公众号/TG + Adapted X 长帖
唯一问题
读 09-10 发版材料时,哪些句子属于 DeepSeek 官方合同,哪些属于 Artificial Analysis 第三方,两套数字怎么并列才不串口径?
来源
- 官帖 https://x.com/deepseek_ai/status/2097930608790167907
- 新闻 https://www.deepseek.com/news/deepseek-v4-1-flash/
- Pricing https://api-docs.deepseek.com/quick_start/pricing
- AA https://x.com/ArtificialAnlys/status/2098148674203488422
- HF https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
- Brief [[Hermes 定时任务/X-每日简报/2026-09-10-X-Hot-Brief_DeepSeekV41Flash-CursorProjects-Edge0]]
核对表(仅调研用,不进读者标题)
| 行 | 主张 | 级别 | |----|------|------| | API 名 deepseek-flash | official | docs | | 552B / 8B/16B | official | news | | 峰谷价表 | official | pricing | | 9/14 后 Pro 继续 | official_update | docs note (2) 覆盖 news 下线计划 | | Index 40 | third_party | AA | | Automation 69% | third_party | AA | | 763B total | hf_meta / AA | 与 552B 并列 | | 本机分数 | 无 | 未测 |
边界
- 未 OCR 官网 benchmark 图
- 未跑 AA 套件
- 不与 Cursor Projects 并题