在收集人类偏好数据以训练奖励模型时,相比于直接给单个回答打分(Scoring),采用“两两比较并排序(Ranking/Pairwise Comparison)”的主要优势是:
排序数据的标注速度比打分快得多
不同标注者对分数范围的尺度(Scaling)理解往往不一致,而排序能降低这种主观偏差
排序数据可以直接用于预训练阶段
排序不需要标注人员具备专业背景