推出 DeepSeek-V4.1-Flash:更智能、更快速、更高效
- 推出我们新架构家族中最小的模型,具备原生视觉理解能力。
- 专为更强的能力、更快的推理、更高的吞吐量以及向更大模型扩展而设计。
非对称架构:更多智能,更低成本
- 552B 参数的 MoE(混合专家)架构。
- 全新的因果编码器-解码器架构:输入仅需 8B 活跃参数,输出仅需 16B 活跃参数。
- 结合新的预训练方法与更大规模的强化学习后训练,其基准测试结果领先于包括 DeepSeek-V4-Pro 在内的旗舰模型。
更小的 KV 缓存:更大的节省
与上一代相比,V4.1-Flash 的 KV 缓存需求仅为:
- 1/4 的 HBM(高带宽内存)
- 1/8 的 SSD 存储空间
缓存命中费用通常占 Agent 成本的很大一部分。压缩缓存可以显著降低这些成本。
V4.1-Flash 现已在 DeepSeek API 上线,支持原生多模态
将您的模型设置为 deepseek-flash。
- V4-Flash 和 V4-Flash-Vision-Exp 已退役。为了兼容性,deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 暂时路由到 V4.1-Flash。
- 多方测试表明,V4.1-Flash 在性能、成本、速度和总运行时间上均领先于 V4-Pro。我们正在逐步淘汰 V4-Pro。
- 自 2026 年 9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 请求将以 V4.1-Flash 的费率路由到 V4.1-Flash。此状态将持续到 V4.1-Pro 发布。
官方合作伙伴 WorkBuddy(包括 CodeBuddy)和 OpenCode 现已全面支持 V4.1-Flash。欢迎立即试用!
更高效的架构:更低的 API 价格
V4.1-Flash 让我们能够以更低的成本服务更多用户。我们将把这些节省下来的成本传递给用户。
- 峰谷定价继续用于平衡需求。
- 非高峰费率是高峰费率的 50%。将灵活的工作负载安排在非高峰期以节省成本。
- 新定价于 2026 年 9 月 10 日 04:00 UTC 生效。
支持开源:扩展部署选项
我们将与开源社区密切合作,提供 V4.1-Flash 的推理支持,并探索更多的部署选项。
计划使用 2000 个以上 GPU 和存储集群进行大规模部署?请与我们联系。
相关链接:
- DeepSeek-V4.1-Flash — Hugging Face
- DeepSeek-V4.1-Flash 技术报告
原始来源: DeepSeek 官方 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。