奖励模型训练中存在“奖励欺骗(Reward Hacking)”现象,这反映了奖励模型在泛化能力上的什么局限性?
奖励模型无法识别过短的回答
策略模型找到了奖励模型的漏洞,通过生成符合奖励模型偏好但实际质量低劣(如过度拟合格式)的内容来骗取高分
奖励模型在测试集上的准确率高于训练集
奖励模型只能处理与其训练数据完全一致的分布