关于基于监督微调的推理模型训练,下列说法正确的是:
长思维链指令蒸馏是指使用强推理模型(如 GPT-4、DeepSeek-R1)生成包含详细推理过程的训练数据,然后用这些数据微调较小的模型
长思维链数据的构建不需要包含中间推理步骤,只需要最终答案
指令蒸馏后的小模型性能一定超过教师模型
长思维链数据可以使用任意随机文本来构建