众力资讯网

DeepSeek V4.1 Flash 发布:缓存压缩百倍,长上下文 Agent

DeepSeek V4.1 Flash 发布:缓存压缩百倍,长上下文 Agent 迎来成本拐点

DeepSeek 正式发布 V4.1 Flash 多模态 MoE 模型,552B 骨干参数加 196B Engram 记忆参数,支持 1M token 上下文窗口。预填充阶段单 token 仅激活 8B 参数,解码阶段激活 16B,核心指标全局 KV 缓存占用仅 890 字节每 token,约为上代 V4 Flash 的四分之一,相比 V1 降低 437 倍,直接击穿长上下文推理的成本瓶颈。

技术架构采用多层优化组合拳。因果编码器解码器结构将 40 层骨干拆分为 20 层编码器与 20 层解码器,提示词仅流经编码器,解码器从编码器最终状态投影权重,预填充计算量近乎减半。第二代压缩稀疏注意力 CSA2 采用 Full、Reindex、Reuse 三层模式跨层共享 KV 缓存与索引,避免每层重复计算。主 KV 缓存采用 FP4 量化,搭配 E4M3 微块缩放策略,存储体积相比上代 FP8 再降近一半。同时引入 Engram 条件记忆模块与 mHC 流形约束超连接,兼顾知识检索与推理深度。

部署层面的优化同样彻底。滑动窗口 KV 不再持久化到 SSD,转驻主机 DRAM 分布式池,生命周期分钟级;全局 KV 保留 72 小时生命周期。缓存未命中时仅重计算 128 个 token 即可重建滑动窗口状态,而非全量重算。最终 1M 上下文下,单 token 解码计算量仅比 4K 上下文增加四分之一,实现了近乎线性的成本增长。

基准测试表现亮眼。Terminal-Bench、DeepSWE 等 Agent 与代码评测中,模型以 MIT 权重超越 Opus-5 与 GPT-5.6 Sol。基础能力比肩 V4 Pro,但总参数量仅为其三分之一,激活参数量仅为其四分之一,用更小的计算代价实现了旗舰级表现。

从行业视角看,V4.1 Flash 是大模型竞争转向效率优先的标志性产品。Agent 时代长上下文、多轮交互成为常态,KV 缓存占用的显存与带宽早已成为主要成本项。DeepSeek 从架构、量化、缓存调度多层切入,把长上下文的成本打下来,本质上是把大规模 Agent 部署的经济账算通了。这套技术路线会倒逼全行业向推理效率内卷,推动大模型真正走向规模化落地。

但也要看到潜在局限。非对称编码器解码器结构在长输出、强推理场景的表现稳定性仍需验证,输入输出的能力错配可能在部分长尾任务中出现短板。FP4 量化对高精度要求场景的精度影响,以及跨层 KV 复用带来的注意力衰减风险,也需要更多真实场景检验。此外开源版本的部署门槛与适配工作量,也会影响中小团队的落地效果。

大模型KV缓存Agent推理效率前沿在线