在分布式训练中,数据并行(Data Parallelism)的主要思想是:
将模型的不同层放置在不同的计算设备上,实现流水线式计算
将模型的单个层(如一个大矩阵乘法)切分到多个设备上并行计算
将训练数据分发到多个计算设备,每个设备都拥有完整的模型副本,并处理部分数据
同时利用数据并行、流水线并行和张量并行来加速训练