训练万亿参数模型,像让一座超大型医院同时给所有科室换教材:不仅每个部门都要参与,彼此还得频繁同步,任何等待都会拖慢全局。SLAI T-Rex解决的正是这类难题:它在昇腾Ascend SuperPOD——把大量神经网络专用处理器高速连成的集群——上,对DeepSeek-V4家族进行全参数后训练,也就是让基础模型的全部参数继续学习,而非只调整少量适配模块。
DeepSeek-V4采用MoE(混合专家模型):模型像医院分诊,每次只调用少数“专家”处理输入,但总参数仍可达到万亿规模。团队从模型并行、通信与计算编排、底层算子执行三个层次优化,尤其让芯片一边计算、一边交换数据,减少集体停工等待。作者报告,系统的MFU——实际有效计算量占硬件理论计算能力的比例——达到34.22%,是开源基线方案的2.93倍,同时保持训练稳定。它的看点因此不只是“模型能在昇腾上跑”,而是展示了一条从集群协作到底层执行的完整优化路径;不过这些性能与稳定性结论目前均来自论文作者自述。