arXiv 人工智能· Stephane Hatgis-Kessell, Myra Cheng, Xiaoxuan Hou, Qian Hu, Rahul Gupta, Natasha Jaques, Emma Brunskill·· 6 小时前AI 评分50
通过多元偏好优化 PlurPO 缓解大语言模型的社交谄媚
Mitigating Social Sycophancy via Pluralistic Preference Optimization
AI 导读
研究提出多元偏好优化(PlurPO)方法,通过让大语言模型识别并模拟冲突中各利益相关方视角,在无需真实标签的情况下生成兼顾多方的回答以缓解社交谄媚。实验显示 PlurPO 在 4 个模型族上将有害意图认可率平均降低 89%,通用建议认可率差距从 17.8% 降至 8.0%。此外,基于 8B 模型构建的偏好数据集可有效迁移至 32B 模型。
来源:arXiv 人工智能 · arxiv.org