众力资讯网

大模型部署,其实还是有很多坑的。网上的二手显卡,如果是个人玩玩,那主要瓶颈是显存容量和带宽。但如果要部署大模型生产token,想卖钱,那么还是最新的硬件性价比可能更高。 因为大模型并发推理时,多个用户的token一起算,合一批,把权重占用的显存遍历一遍这样,瓶颈就不是带宽,带宽影响单流速度 ​

大模型部署,其实还是有很多坑的。网上的二手显卡,如果是个人玩玩,那主要瓶颈是显存容量和带宽。但如果要部署大模型生产token,想卖钱,那么还是最新的硬件性价比可能更高。

因为大模型并发推理时,多个用户的token一起算,合一批,把权重占用的显存遍历一遍这样,瓶颈就不是带宽,带宽影响单流速度。但影响多流速度的,主要是gpu的算力,尤其是fp4之类4比特数据的算力。

B200/B300为啥算力恐怖,因为它们都支持fp4。现在大模型推理,经常都是量化到fp4,fp4计算量通常只有fp8的一半,所以吞吐基本能翻倍(当然不是绝对,只是正相关)。

因此,一些老旧硬件,比如mi 250,看着便宜,其实是坑。它的token生产性价比,远不如后来的硬件。因为它不支持低精度的量化指令。

像我的v100s,也是这种类型。不过它单流没大问题。因为算力是富余的,都是在等显存读写。

还有训练,训练主要是靠F16算力。如果没有F16矩阵乘指令,也是会相当糟糕的。