关于基于强化学习训练推理模型的方法,下列说法正确的是:
结果奖励建模(ORM)根据最终答案的正确性给予奖励,过程奖励建模(PRM)对推理过程的每个步骤给予奖励反馈
强化学习训练推理模型不需要任何奖励信号
结果奖励建模和过程奖励建模完全相同
基于强化学习的推理训练不使用策略梯度或 PPO 等优化算法