关于大模型推理中的资源管理和性能优化,下列说法正确的是:
大模型推理的性能瓶颈可能来自计算(compute-bound)或内存带宽(memory-bound),不同阶段的瓶颈可能不同
所有大模型推理任务的瓶颈都相同,都是计算瓶颈
增加 GPU 数量一定能线性提升推理速度
模型性能优化只需要关注模型精度,不需要考虑延迟和吞吐量