完全分片数据并行(Fully Sharded Data Parallelism, FSDP)与传统数据并行相比,其核心优势在于:
FSDP将模型参数、梯度和优化器状态都进行了分片,极大地减少了每个GPU的显存占用
FSDP只需要一个GPU即可完成大规模模型的训练
FSDP能够自动选择最优的模型架构,无需人工干预
FSDP主要用于加速模型的推理速度,而非训练速度