arXiv 人工智能· Yinghao He, Mengyu Xu, Haixiang Sun, Donghan Li, Yibo Wang, Lixu Wang, Kezhen Chen, Chi Li, Chunwei Liu, Bharat Bhargava, Chongyang Gao·· 8 小时前AI 评分37
抑制压力与放大证据:通过自引导注意力引导缓解大模型迎合与顽固
Suppressing Pressure, Amplifying Evidence: Self-Guided Attention Steering to Mitigate Sycophancy and Stubbornness
AI 导读
研究团队提出免训练框架 SPAE 与评测基准 CoPE-Bench,通过 token 级注意力引导抑制用户压力并放大上下文信息,以同时缓解大语言模型的迎合与上下文顽固问题。在 5 个骨干模型上的测试显示,SPAE 相比最强基线将压力顺从率平均降低 18.8 个百分点,并将联合条件更新率提升 5.5 个百分点;在两轮对话中,其联合条件更新率较最强提示词基线平均提升 13.2 个百分点。
来源:arXiv 人工智能 · arxiv.org