DPO 算法在对齐大模型时,相比于传统的 RLHF(基于 PPO 算法),其最核心的改变是:
引入了更强大的外部奖励模型
放弃了使用强化学习优化器,通过数学变换直接在偏好数据上通过分类损失函数优化策略模型
增加了模型对图像数据的处理能力
仅在预训练阶段使用,不需要微调