关于 DPO 的变种算法,下列描述正确的是:
Token-level DPO 旨在对句子中的每一个词元(Token)进行独立的奖励赋值,以实现更精细的信用分配
Reference-free DPO 彻底取消了 KL 散度约束,使得模型可以无限偏离原始分布
Reference-free DPO 主要是为了通过移除参考模型(Reference Model)来降低训练时的显存占用
Token-level DPO 只能应用于图像生成任务,不适用于文本生成