关于大语言模型的高级评测维度,下列说法正确的是:
鲁棒性评测通过对抗样本(如添加微小扰动或误导性提示)测试模型在异常输入下能否保持正确的输出
人类对齐评测只关注模型输出是否语法正确
工具使用评测与模型调用外部 API 的能力无关
环境交互评测不需要模型与外部环境进行实际交互