arXiv 自然语言处理· Antonela Tommasel, Markus Schedl·· 3 小时前AI 评分36
在 LLM 中测量人类偏见?对大语言模型评测中引入人类偏见概念的批判
Measuring Human-Like Bias in LLMs? A Critique of Human-Derived Bias Constructs in LLM Evaluation
AI 导读
一项最新研究批判了将隐性偏见、锚定效应等源自人类的偏见概念直接套用于大语言模型(LLM)评测的做法。论文指出心理学工具与基于概率和文本补全的 LLM 机制之间存在推断鸿沟,容易导致对模型偏见的解释产生混淆。为此,研究提出了一套分析框架,从目标概念、操作化、推断范围及人类类比局限等维度规范模型偏见的推断。
来源:arXiv 自然语言处理 · arxiv.org