基础题库
探索各种基础编程概念和问题解决技巧
请登录后使用状态筛选
简单单选题
关于 AdamW 优化器的改进,以下说法正确的是?
关于 AdamW 优化器的改进,以下说法正确的是?
正确率: 100%已完成: 3人LMCC大模型认证预训练技术优化设置
简单单选题
一个简单的全连接层(Fully Connected Layer),其输入维度为 N,输出维度为 M。则该层有多少个可训练参数?
一个简单的全连接层(Fully Connected Layer),其输入维度为 N,输出维度为 M。则该层有多少个可训练参数?
正确率: 67%已完成: 2人LMCC大模型认证预训练技术参数量计算
简单单选题
对于一个包含 K 个专家的稀疏激活 MoE 模型,所有专家参数量相同,门控网络每次选择 M 个专家(M<K)。评估该 MoE 模型的总参数量时,最主要的组成部分是:
对于一个包含 K 个专家的稀疏激活 MoE 模型,所有专家参数量相同,门控网络每次选择 M 个专家(M<K)。评估该 MoE 模型的总参数量时,最主要的组成部分是:
正确率: 75%已完成: 2人LMCC大模型认证预训练技术参数量计算
简单单选题
对于一个 Transformer Decoder-only 模型,在处理一个长度为 L 的序列时,其自注意力(Self-Attention)机制的计算复杂度(按乘加运算次数计)大致为:
对于一个 Transformer Decoder-only 模型,在处理一个长度为 L 的序列时,其自注意力(Self-Attention)机制的计算复杂度(按乘加运算次数计)大致为:
正确率: 50%已完成: 2人LMCC大模型认证预训练技术训练运算量及时间计算
简单单选题
一个大模型训练任务的理论计算量(FLOPs)估算为 ( 10^{24} ) FLOPs。若硬件峰值算力为 ( 10^{17} ) FLOPs/s,且能充分利用峰值算力,则完成该训练任务所需的最少时间约为:
一个大模型训练任务的理论计算量(FLOPs)估算为 ( 10^{24} ) FLOPs。若硬件峰值算力为 ( 10^{17} ) FLOPs/s,且能充分利用峰值算力,则完成该训练任务所需的最少时间约为:
正确率: 100%已完成: 3人LMCC大模型认证预训练技术训练运算量及时间计算
简单单选题
假设一个大模型的训练中,模型参数量为 P,梯度大小为 G,优化器状态大小为 O。单次前向/反向传播(不含优化器状态)所需的显存主要由以下哪项组成?
假设一个大模型的训练中,模型参数量为 P,梯度大小为 G,优化器状态大小为 O。单次前向/反向传播(不含优化器状态)所需的显存主要由以下哪项组成?
正确率: 67%已完成: 2人LMCC大模型认证预训练技术训练显存计算
简单单选题
梯度检查点(Gradient Checkpointing)技术在训练大模型时,其主要的权衡是:
梯度检查点(Gradient Checkpointing)技术在训练大模型时,其主要的权衡是:
正确率: 100%已完成: 3人LMCC大模型认证预训练技术训练显存计算
简单单选题
在深度学习模型训练过程中,梯度裁剪(Gradient Clipping)技术的主要作用是什么?
在深度学习模型训练过程中,梯度裁剪(Gradient Clipping)技术的主要作用是什么?
正确率: 100%已完成: 3人LMCC大模型认证预训练技术稳定优化技术
简单单选题
在深度学习模型训练中,混合精度训练(Mixed Precision Training)技术的主要作用是什么?
在深度学习模型训练中,混合精度训练(Mixed Precision Training)技术的主要作用是什么?
正确率: 100%已完成: 3人LMCC大模型认证预训练技术稳定优化技术
简单单选题
在分布式训练中,数据并行(Data Parallelism)的主要思想是:
在分布式训练中,数据并行(Data Parallelism)的主要思想是:
正确率: 100%已完成: 3人LMCC大模型认证预训练技术并行训练