众力资讯网

DeepSeek官方数据显示,V4 Flash支持100万词元上下文,未命中缓存

DeepSeek官方数据显示,V4 Flash支持100万词元上下文,未命中缓存的输入价格为每百万词元0.14美元,输出为0.28美元。这样的定价会明显降低编程代理、文档处理和批量内容生成的使用门槛,也是海外开发平台愿意接入它的直接原因。
但模型调用费不等于完整产品成本。一款3D游戏还涉及美术素材、运行环境、测试、服务器和人工修改,“7分钱完成游戏”只能代表某次演示消耗的模型费用,不能推广为普遍成本。
DeepSeek降低算力需求也不是简单地“删除接近零的参数”。其核心路线包括混合专家架构、低精度计算和注意力优化。
以DeepSeek V3为例,模型共有6710亿参数,每个词元实际激活约370亿参数。它不是让全部参数同时计算,而是根据任务选择部分专家参与推理,从而降低单次计算量。
混合专家并非DeepSeek首创,真正有价值的是它对专家细分、路由、通信和工程实现的改进。把“只激活部分参数”直接换算成“算力下降96%”也不严谨,因为注意力层、共享专家、内存访问和跨芯片通信仍会消耗资源。
“V4摆脱CUDA”同样言过其实。vLLM公开的V4部署方案仍使用CUDA,并需要多块英伟达B200或B300 GPU。DeepSeek正在扩大对不同芯片和软件生态的适配,但兼容国产硬件,不等于训练和推理已经完全脱离英伟达。
华为提出的“韬定律”确有其事,核心是通过时间缩微和逻辑折叠提高系统性能,但它是一条新的工程演进路线,不代表摩尔定律立即失效,更不能证明既有半导体专利“全部无效”。
DeepSeek真正带来的冲击,不是用一个算法让芯片突然变得不重要,而是证明模型架构、系统软件和定价策略能够共同提高算力利用率。
未来AI竞争仍然需要先进芯片,但胜负不会只由谁拥有最多GPU决定,还取决于谁能用更少计算完成同样任务。