关于大语言模型的解码方式和推理工具,下列说法正确的是:
增量解码(KV Cache)通过缓存已计算的 Key 和 Value,避免重复计算,从而加速自回归生成
全量解码每一步都重新计算所有位置的注意力,效率高于增量解码
vLLM 是一个专门用于训练模型的工具,不用于推理加速
解码效率的评估只看生成文本的质量,不考虑吞吐量和延迟