DeepSeek 今日正式发布 V4.1 Flash 模型,作为全新结构系列的最小尺寸版本,原生搭载多模态视觉理解能力。该模型用架构创新实现小成本承载大智能,同时拉开了新一代模型结构迭代的序幕。
核心突破来自非对称架构设计。552B 总参数的 MoE 模型采用全新 Causal-Encoder-Decoder 结构,输入侧仅激活 8B 参数,输出侧激活 16B,推理成本显著低于同量级模型。搭配新的预训练范式与更大规模的强化学习后训练,基准测试中整体智能水平超越自家 V4 Pro 等旗舰模型,用更小的激活参数实现了更强的综合表现。
成本优化是另一大亮点。新一代架构大幅压缩 KV 缓存体积,HBM 需求降至上代的 1/4,SSD 需求降至 1/8。对缓存开销占比高的 Agent 类任务而言,缓存压缩直接拉低了长链路多轮交互的使用成本,让大规模 Agent 部署的经济性显著提升。
API 与商业化同步推进。V4.1 Flash 已同步上线 API,原生支持多模态能力。官方同步下调定价,延续峰谷定价机制,闲时价格为高峰时段的一半,引导用户错峰调度资源。同时启动旧版模型有序下线,V4 Flash 系列与 V4 Pro 将逐步路由至新模型,腾讯 WorkBuddy、CodeBuddy 等合作伙伴已完成全量接入。模型也同步推进开源适配,支持社区推理优化,面向具备算力条件的大规模部署需求开放合作。
从行业维度看,非对称架构是大模型效率竞争的新方向。通过输入输出侧的差异化激活,在保证能力的前提下极致压缩推理成本,本质上是把算力花在真正需要的环节。DeepSeek 用小尺寸模型击穿旗舰能力门槛,同时用降价推动普惠化,会进一步加剧通用大模型的性价比内卷,倒逼全行业向效率优先的方向演进。
但也要看到潜在挑战。非对称结构在长文本生成、复杂推理等长输出场景的表现稳定性仍需验证,输入输出的能力错配可能在部分长尾任务中出现短板。缓存压缩是否会影响长上下文的推理精度,也需要更多真实场景检验。此外旧版模型路由过渡期间的兼容性问题,也可能影响存量用户的使用体验。
大模型MoEAI效率Agent前沿在线



