跳到正文
原文
arXiv 机器学习· Nicolas Martorell, Wendy Brau, Gonzalo A. Heredia, Tom\'as Pablo Korenblit, Gaspar Labasti\'e, Tom\'as Gimenez Molina·· 4 小时前AI 评分47

PowerBench:评测大语言模型在权力转移请求中的偏见

PowerBench: Measuring Language Model Bias in Power-shifting Requests

AI 导读

研究团队开源了 PowerBench 评测基准与数据集,用于评估大语言模型在自我赋权、剥夺权力及争夺权力等权力转移请求中的拒绝偏见。该研究评测了来自美中开发者的 24 款模型(美中各 12 款),涵盖 8 种请求语言和不同受影响规模。结果显示模型对争夺权力的拒绝率最高,且受影响规模扩大或用户为 AI 智能体时拒绝率显著上升。

来源:arXiv 机器学习 · arxiv.org