要知道Kimi K3的参数量可是2.8万亿,规模极大,就连官方推荐配置也是数据中心级GPU,而且还至少需要「64个加速器超节点」。
而博主用80张RTX 5090组成10个节点完成,每个节点8张显卡,总显存达到2.56TB。
这套方案没有采用AI服务器常见的HBM高带宽显存,也没有使用NVLink、InfiniBand等高端互联设备,而是依靠消费级显卡的GDDR7显存和普通25GbE以太网完成运行。
测试结果显示,Kimi K3单流推理速度达到20tok/s,目前还未经过进一步优化。
对比其他推荐配置,要么是32张H100、要么是16张H200/B200。
这套方案用80张5090,内存带宽就达到了143TB/s,超过32张H100方案的107TB/s。
仔细扒了一下,Ning团队也不简单,此前还曾让GLM-5.2运行在RTX4090消费级显卡上。Kimi

