AI

DeepSeek发布V4.1-Flash模型:更智能、更快速、更高效

DeepSeek正式发布V4.1-Flash模型,这是其新架构家族中最小且具备原生视觉理解能力的模型。该模型采用552B参数MoE架构,输入和输出分别仅需8B和16B活跃参数,并大幅优化KV缓存以降低存储需求。目前V4.1-Flash已在API上线并支持原生多模态,将逐步取代V4-Pro等旧系列。同时,官方宣布下调API价格,并继续深化开源社区支持。

推出 DeepSeek-V4.1-Flash:更智能、更快速、更高效

  • 推出我们新架构家族中最小的模型,具备原生视觉理解能力。
  • 专为更强的能力、更快的推理、更高的吞吐量以及向更大模型扩展而设计。

非对称架构:更多智能,更低成本

  • 552B 参数的 MoE(混合专家)架构。
  • 全新的因果编码器-解码器架构:输入仅需 8B 活跃参数,输出仅需 16B 活跃参数。
  • 结合新的预训练方法与更大规模的强化学习后训练,其基准测试结果领先于包括 DeepSeek-V4-Pro 在内的旗舰模型。

更小的 KV 缓存:更大的节省

与上一代相比,V4.1-Flash 的 KV 缓存需求仅为:
- 1/4 的 HBM(高带宽内存)
- 1/8 的 SSD 存储空间

缓存命中费用通常占 Agent 成本的很大一部分。压缩缓存可以显著降低这些成本。

V4.1-Flash 现已在 DeepSeek API 上线,支持原生多模态

将您的模型设置为 deepseek-flash
- V4-Flash 和 V4-Flash-Vision-Exp 已退役。为了兼容性,deepseek-v4-flashdeepseek-v4-flash-vision-exp 暂时路由到 V4.1-Flash。
- 多方测试表明,V4.1-Flash 在性能、成本、速度和总运行时间上均领先于 V4-Pro。我们正在逐步淘汰 V4-Pro。
- 自 2026 年 9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 请求将以 V4.1-Flash 的费率路由到 V4.1-Flash。此状态将持续到 V4.1-Pro 发布。

官方合作伙伴 WorkBuddy(包括 CodeBuddy)和 OpenCode 现已全面支持 V4.1-Flash。欢迎立即试用!

更高效的架构:更低的 API 价格

V4.1-Flash 让我们能够以更低的成本服务更多用户。我们将把这些节省下来的成本传递给用户。
- 峰谷定价继续用于平衡需求。
- 非高峰费率是高峰费率的 50%。将灵活的工作负载安排在非高峰期以节省成本。
- 新定价于 2026 年 9 月 10 日 04:00 UTC 生效。

支持开源:扩展部署选项

我们将与开源社区密切合作,提供 V4.1-Flash 的推理支持,并探索更多的部署选项。

计划使用 2000 个以上 GPU 和存储集群进行大规模部署?请与我们联系。

相关链接:
- DeepSeek-V4.1-Flash — Hugging Face
- DeepSeek-V4.1-Flash 技术报告

原始来源: DeepSeek 官方

本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。

更多「AI」资讯

让品牌在 AI 中生长

免费诊断你的品牌 AI 可见度