DeepMind 提出的 Chinchilla 扩展法则给出的核心启示是:
只要算力充足,参数量越大的模型性能永远越好,无需考虑数据量
当算力预算增加时,应同比例地增加模型参数量和训练数据量,许多早期模型往往“训练不足”
175B 参数的模型是人类能训练的极限
模型的训练数据应该全部来自教科书,以保证质量