黄仁勋又放话了。9 月 7 日,英伟达 CEO 在社交平台上发文祝贺 OpenAI 发布 Astra,顺手写了一句"AGI 已经到来",强调这个模型是用英伟达芯片训练的,然后暗示"接下来将有 40 万块 GPU 上线"。
40 万块 GPU 是什么规模?作为参照,一座大型 AI 数据中心的 GPU 数量通常以万为单位。40 万,是把现役最大规模的算力集群再翻上好几倍。
配合着看另一条消息:英伟达的 Vera Rubin 平台已经进入下半年出货阶段。旗舰 NVL72 单柜塞进 72 颗 Rubin GPU 和 36 颗 Vera CPU,用 NVLink 6 互联,能给出 3.6 EFLOPS 的 NVFP4 推理性能和 20.7TB 的 HBM4 显存。英伟达自己的说法是,相比上一代 Blackwell,推理性能提升 5 倍,单 token 成本降低 10 倍。
首批部署方名单很长:亚马逊、谷歌、微软、甲骨文这几家的云都在里面,再加上 CoreWeave、Lambda、Nebius 这批中立云厂商。Anthropic、Meta、Mistral、OpenAI 都表示要拿它训练更大的模型。
"AGI 到了"这种话听听就好,但"单 token 成本降低 10 倍"这句话很值钱。
翻译成人话:同样一个问题,明年的回答成本可能只有今年的十分之一。这意味着几件事会接连发生——
你现在觉得贵的 AI 功能,会陆续变成免费的。那些按月限量、超额收费的套餐,限额会往上抬。视频生成、长文档分析、实时语音这些现在算"重活"的功能,会下放到普通套餐里。
再往后推一步,过去因为成本太高而做不了的 AI 应用会突然可行。比如给你的相册做全量视频理解,比如一个能连续工作八小时不中断的办公助手,比如本地跑、不联网的实时同声传译。
当然也有另一面。这么大体量的算力砸下去,真正抢的是企业市场和开发者市场,普通用户感受到的降价会有滞后。而且成本降 10 倍不代表你付的钱会降 10 倍——中间还有一层定价策略。
黄仁勋的话,一半是说给投资人听的,一半是说给竞争对手听的。但那 40 万块卡是真的要插上电的,它们会把 AI 的价格曲线往下压一段,这点没啥悬念。
如果 AI 明年真的便宜一大截,你最想拿它来干哪件现在舍不得干的事?
