自监督学习中的“掩码预测”(Masked Prediction)任务,例如 BERT 的 Masked Language Model (MLM),其核心思想是:
学习将输入数据(如文本)在不同视图下进行编码,使其在表示空间中距离拉近
随机遮盖(mask)输入序列中的一部分词元,并让模型预测被遮盖的词元
预测输入序列中的下一个词元
将输入数据映射到低维空间,以捕获主要变化趋势