1️⃣ Scale-Up vs Scale-Out——一个是“造大船”,一个是“组舰队”
Scale-Up指单卡堆更多HBM、算力更强(把每颗GPU做大);Scale-Out指用更多GPU组成集群(用数量换总容量)。HBM短缺下,英伟达从“造大船”转向“组舰队”——单卡容量降33%,但576卡集群总容量暴增433%。
2️⃣ HBM——AI芯片的“超级内存”
高带宽内存,紧挨着GPU封装的高速内存,数据传输带宽远超普通DRAM,是AI训练推理的“命脉”。目前是AI芯片最紧缺的环节之一。
3️⃣ NVLink域——GPU之间的“内部高速公路”
NVLink是英伟达的GPU高速互联技术,一个“NVLink域”内的GPU可以高速共享数据。从72卡到576卡,意味着更大的集群规模。
4️⃣ 12-Hi vs 8-Hi——HBM的“楼层数”
HBM由多层DRAM芯片垂直堆叠而成,“Hi”是层数。12-Hi=12层堆叠(288GB),8-Hi=8层堆叠(192GB)。层数越多,容量越大,但制造更复杂、良率更低。
5️⃣ KV Cache——大模型推理的“草稿纸”
大模型生成回答时缓存中间计算结果,占内存巨大。HBM不够用时,部分KV Cache需“溢出”到服务器DDR5或SSD上,这正是花旗判断DDR5和eSSD需求强劲的逻辑。
