基础题库
探索各种基础编程概念和问题解决技巧
请登录后使用状态筛选
简单单选题
在收集人类偏好数据以训练奖励模型时,相比于直接给单个回答打分(Scoring),采用“两两比较并排序(Ranking/Pairwise Comparison)”的主要优势是:
在收集人类偏好数据以训练奖励模型时,相比于直接给单个回答打分(Scoring),采用“两两比较并排序(Ranking/Pairwise Comparison)”的主要优势是:
正确率: 100%已完成: 2人LMCC大模型认证人类对齐人类偏好数据收集——排序
简单单选题
人类反馈数据中常存在长度偏见(Length Bias),这指的是:
人类反馈数据中常存在长度偏见(Length Bias),这指的是:
正确率: 100%已完成: 2人LMCC大模型认证人类对齐人类偏好数据收集——排序
中等单选题
DPO 算法在对齐大模型时,相比于传统的 RLHF(基于 PPO 算法),其最核心的改变是:
DPO 算法在对齐大模型时,相比于传统的 RLHF(基于 PPO 算法),其最核心的改变是:
正确率: 100%已完成: 2人LMCC大模型认证人类对齐非强化学习训练的对齐方法
中等单选题
关于 DPO 的变种算法,下列描述正确的是:
关于 DPO 的变种算法,下列描述正确的是:
正确率: 100%已完成: 2人LMCC大模型认证人类对齐非强化学习训练的对齐方法
中等单选题
关于打分式、对比式(两两比较)和排序式(列表排序)损失的逻辑,以下说法正确的是:
关于打分式、对比式(两两比较)和排序式(列表排序)损失的逻辑,以下说法正确的是:
正确率: 100%已完成: 2人LMCC大模型认证人类对齐奖励模型训练
中等单选题
奖励模型训练中存在“奖励欺骗(Reward Hacking)”现象,这反映了奖励模型在泛化能力上的什么局限性?
奖励模型训练中存在“奖励欺骗(Reward Hacking)”现象,这反映了奖励模型在泛化能力上的什么局限性?
正确率: 100%已完成: 2人LMCC大模型认证人类对齐奖励模型训练
简单单选题
大模型的幻觉可以分为“内在幻觉”和“外在幻觉”。关于“外在幻觉(Extrinsic Hallucination)”,下列描述准确的是:
大模型的幻觉可以分为“内在幻觉”和“外在幻觉”。关于“外在幻觉(Extrinsic Hallucination)”,下列描述准确的是:
正确率: 25%已完成: 1人LMCC大模型认证人类对齐幻象
简单单选题
在实际应用中,为了缓解大模型的幻觉问题,以下哪种技术手段被证明是最直接有效的“外挂知识库”方案?
在实际应用中,为了缓解大模型的幻觉问题,以下哪种技术手段被证明是最直接有效的“外挂知识库”方案?
正确率: 100%已完成: 2人LMCC大模型认证人类对齐幻象
简单单选题
关于语言模型的解码方法,下列说法正确的是:
关于语言模型的解码方法,下列说法正确的是:
正确率: 100%已完成: 2人LMCC大模型认证解码与部署解码方法
简单单选题
关于束搜索的超参数调优,下列描述正确的是:
关于束搜索的超参数调优,下列描述正确的是:
正确率: 100%已完成: 2人LMCC大模型认证解码与部署解码方法