关于自回归语言模型的"下一个词元预测"任务,下列说法正确的是:
它要求模型根据前文预测下一个token,是Decoder-only大语言模型常见预训练目标
它会利用答案右侧的token提供信息,因此因果掩码的重要性较低
它主要适用于图像分类模型
它与最大似然学习的关系较弱