跳到正文
原文
arXiv 自然语言处理· Thomas Reiter, Christoph Kern, Fedor Miasnikov, Sofiia Nikolenko, Rob Chew, Stephanie Eckman, Frauke Kreuter·· 1 天前AI 评分38

LLM 标注中的工具不确定性:结果可靠但对设计敏感

Reliable but Design-Sensitive: Instrument Uncertainty in LLM Annotation

AI 导读

研究发现大语言模型(LLM)数据标注对任务设计高度敏感,会引入显著的“工具不确定性”。测试 7 个 LLM 与 12 种任务设计显示,同设计下重复标注一致性达中位数 Fleiss' $\kappa = 0.91$,但更换设计后中位数 Cohen's $\kappa$ 降至 0.76,使攻击性语言和仇恨言论的患病率估计方差分别增加 76.7 倍和 110.6 倍。

来源:arXiv 自然语言处理 · arxiv.org