关于 MoE 模型的显存优化与通信开销,下列描述正确的是:
MoE 模型虽然计算量与稠密模型相近,但由于所有专家参数都需要加载,显存占用远大于同等计算量的稠密模型
MoE 模型在分布式训练中不需要跨设备通信,因为每个专家独立工作
MoE 模型的显存占用与稠密模型完全相同
专家并行(Expert Parallelism)会增加显存占用但不会带来通信开销