昨天晚点报,字节正在训练一个超 5 万亿参数的模型,今天 FT 报,3 位知情人士透露,字节在训练一个 10 万亿参数的模型。
按照前段时间梁文锋的分析,DeepSeek 眼下不会去做这样的规模,算力资源无法支撑,即使训出来了,研究所需的算力也是远远不够的,还不如优先做好几千万激活的模型。


昨天晚点报,字节正在训练一个超 5 万亿参数的模型,今天 FT 报,3 位知情人士透露,字节在训练一个 10 万亿参数的模型。
按照前段时间梁文锋的分析,DeepSeek 眼下不会去做这样的规模,算力资源无法支撑,即使训出来了,研究所需的算力也是远远不够的,还不如优先做好几千万激活的模型。

