在自监督学习中,针对自然语言(如文本)的掩码预测任务(如 MLM)与针对图像的掩码预测任务(如 MAE - Masked Autoencoders)相比,主要区别在于:
图像掩码预测直接操作像素,而文本掩码预测操作的是离散的词元/子词
文本掩码预测的“遮盖”比例通常远大于图像掩码预测
图像掩码预测更容易受到全局上下文信息的影响
图像掩码预测通常使用自回归方式,而文本是基于重构