AI

DeepSeek发布V4.1 Flash,长文本缓存硬盘占用暴降88%

2026年9月10日,DeepSeek正式发布DeepSeek V4.1 Flash模型。该模型采用全新架构,参数规模为552B,在多项基准测试中性能超越DeepSeek V4 Pro等旗舰模型。新模型大幅提升了KV Cache缓存效率,对HBM和SSD的需求显著降低,并下调了API定价。同时,旧版V4 Flash下线,V4 Pro也将于9月14日有序退场,请求将路由至新模型。

来源:智东西

智东西9月10日报道,DeepSeek正式发布DeepSeek V4.1 Flash模型。该模型采用全新架构,是一款552B参数的MoE模型,为DeepSeek全新模型架构系列中尺寸最小的成员,在性能上超越了包括DeepSeek V4 Pro在内的一众旗舰模型。

一、性能全面超越旗舰,定价下调

价格方面,得益于模型架构的创新,DeepSeek下调了V4.1 Flash的定价,保留峰谷定价机制。全新定价为闲时输入(缓存命中)0.02元、未命中1.0元、输出4.0元;高峰时段输入(缓存命中)0.04元,未命中2.0元,输出8.0元。

该模型具备原生多模态视觉理解能力,采用全新的Causal-Encoder-Decoder架构,输入和输出不对称,输入激活参数只有8B,输出激活为16B,成本显著低于同尺寸模型。在新的预训练方式和更大规模强化学习后训练的加持下,这款更小尺寸的模型在Agentic Benchmark等基准测试中超越了DeepSeek V4 Pro、GLM5.3、Kimi-K3等多款前沿旗舰模型。

二、缓存大幅压缩,DeepSeek V4 Pro即将退场

新一代模型在KV Cache缓存效率方面大幅提升。与DeepSeek V4 Flash相比,V4.1 Flash对HBM的需求减少到1/4,对SSD的需求减少到1/8。

此次压缩由架构、缓存精度和部署策略三方协同完成。架构上采用CSA2机制,将全局KV缓存和Top-K索引跨层复用;缓存精度方面,从训练阶段直接用FP4格式存储全局KV缓存;部署一侧新增SWA有界重放机制。这些设计将上下文从4K拉长到1M,单token解码FLOPs只增加约四分之一。

目前,旧版本模型V4 Flash与V4 Flash Vision Exp已下线。DeepSeek宣布将于北京时间9月14日12:00起有序下线V4 Pro,所有请求都将被路由到新模型并按V4.1 Flash单价计费。

三、全力支持开源,生态全量接入

DeepSeek宣布全力支持开源社区进行新模型的推理适配。DeepSeek Harness v0.1.5版本同步上线,针对V4.1 Flash进行了专项训练和优化。

生态方面,腾讯(WorkBuddy、CodeBuddy等)和OpenCode作为官方合作伙伴,已全量接入DeepSeek V4.1 Flash。同期开源的还有DeepJIT,一个轻量级的xPU内核JIT编译库,支持NVIDIA CUDA GPU和华为昇腾NPU两大后端。

原始来源: 智东西

本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。

更多「AI」资讯

让品牌在 AI 中生长

免费诊断你的品牌 AI 可见度