关于常见的公开综合评测集,下列说法正确的是:
MMLU 涵盖 57 个学科的多选题,用于评测模型的多领域知识和推理能力;C-Eval 是中文领域的综合评测基准
所有评测数据集测试的能力完全相同
BIG-Bench 只包含一种类型的任务
HELM 评测框架不关注模型的鲁棒性和公平性