跳到正文
原文
arXiv 自然语言处理· Parth Kulshreshtha, Shivali Dalmia, Abhishek Mukherji·· 6 小时前AI 评分37

相同输出不同参考标准:测量参考标准选择对多语言基准评分的影响

Same Output, Different Gold: Measuring How Reference Choice Moves a Multilingual Benchmark Score

AI 导读

在保持系统输出固定的情况下仅更换参考标准,6 语言 PII 基准评测得分波动可达 4.95 F1,最差语言波动达 7.55 F1。不同输出间的对比分差亦变动 +2.95 分并改变了单一语言的优劣判定,主因是未说明的标注聚合规则使参考标准偏向特定输出。研究团队据此提出参考敏感度区间(reference-sensitivity band)指标,主张将其与基准得分一同展示。

来源:arXiv 自然语言处理 · arxiv.org