人类反馈数据中常存在长度偏见(Length Bias),这指的是:
标注者倾向于认为较短的回答更简洁高效
奖励模型容易给篇幅较长、看起来更“不明觉厉”的回答打高分,即使其实质内容可能较差
模型生成的回答长度超过了 Token 限制
标注人员只愿意阅读短文本