关于强化学习训练推理模型时的探索策略,下列描述正确的是:
在强化学习训练中,模型需要平衡探索(尝试新的推理路径)和利用(使用已知有效的推理策略)
探索策略只要求模型始终使用相同的推理路径
增大采样温度会减少探索的多样性
探索策略对推理模型的训练效果没有影响