众力资讯网

根据 FundaAI的说法,GPT-6 使用的训练计算量大约是 GPT-5 时代的 10 倍。 “根据我们行业的讨论、实验、RL、合成数据生成以及支持基础设施,这些因素加起来可能会消耗比主要预训练运行多几倍的计算量,甚至可能高达十倍。” “一旦 TPU 8t 和 Vera Rubin 大规模出货,下一次预训练加速就可以开始, ​

根据 FundaAI的说法,GPT-6 使用的训练计算量大约是 GPT-5 时代的 10 倍。

“根据我们行业的讨论、实验、RL、合成数据生成以及支持基础设施,这些因素加起来可能会消耗比主要预训练运行多几倍的计算量,甚至可能高达十倍。”

“一旦 TPU 8t 和 Vera Rubin 大规模出货,下一次预训练加速就可以开始,而大规模互连和光学技术将在那个周期中受益最多。”