关于常见的模型评测指标,下列说法正确的是:
F1 分数是精确率和召回率的调和平均值,综合衡量模型的精确性和覆盖能力
BLEU 指标主要用于分类任务的评测
困惑度(Perplexity)越高表示语言模型的质量越好
ROUGE 指标与文本生成质量无关