跳到正文
原文
arXiv 自然语言处理· Jongwook Yoon, Jongwon Lim, Sungjib Lim, Woojin Cho, Yohan Jo·· 6 小时前AI 评分43

LLM 如何在否定句下改变预测?

How Do LLMs Change Predictions Under Negation?

AI 导读

评测显示开源与闭源大语言模型在否定句下有 37-71% 的概率仍重复原答案。机制分析发现,模型通过特定注意力头和 MLP 神经元抑制原答案检索并提升候选词来实现否定,抑制不足或答案偏见是导致失败的主因。研究团队据此提出新的训练目标,在显著减少否定失败的同时,比标准微调基线更少损耗模型的通用能力。

来源:arXiv 自然语言处理 · arxiv.org