关于大语言模型的评测范式,下列说法正确的是:
基于评测基准使用标准化测试集进行自动评测,基于人类评估邀请人类评判模型输出质量,基于模型评估使用另一个模型来评价目标模型
基于人类评估是唯一可靠的评测方式,其他方式完全不可信
基于模型评估(如 GPT-4 作为裁判)不存在任何偏差
所有评测范式的结论总是完全一致的