关于解码加速的优化算法和系统级优化,下列描述正确的是:
推测解码(Speculative Decoding)使用一个小模型快速生成候选 token,再由大模型并行验证,从而加速生成
FlashAttention 通过降低注意力计算精度来加速,会显著损失模型精度
PagedAttention 是一种新型的注意力计算公式,与显存管理无关
非自回归解码比自回归解码更慢,因为它需要逐个生成 token