关于打分式、对比式(两两比较)和排序式(列表排序)损失的逻辑,以下说法正确的是:
打分式损失要求模型对每个回答给出一个绝对分数,它能有效避免不同标注者之间因为“评分标准不一”带来的噪声
对比式损失通过让模型学习“回答 A 优于回答 B”的相对关系来更新参数,是目前主流 RLHF 流程中处理两两比较数据的核心逻辑
排序式损失只能处理两个回答的先后顺序,当一次性出现三个或更多备选回答时,该逻辑将失效
这三种损失函数在训练时的目标完全一致,即要求模型必须准确预测出人类给出的具体分值