arXiv 自然语言处理· Qingjia Huang, Yakai Li, Jianguo Wu, Qihang Zhou, Aimin Yu, Xiaoqi Jia, Luping Ma, Weijuan Zhang·· 2 天前AI 评分49
对齐悖论:大语言模型后训练如何加剧高置信度幻觉
The Alignment Paradox: How Post-Training Amplifies Confident Hallucinations in Language Models
AI 导读
大语言模型后训练对齐本身是加剧高置信度模型幻觉的主要原因,跨 5 个模型族的指令微调使长尾事实查询的高置信度错误增加了 10 至 35 倍。Logit Lens 逐层探测表明过度自信主要在模型后层产生。基于此在 DPO 中引入基于熵的边界约束,在 Mistral-7B 上将高置信度错误降低了最高 35.3%,同时保持了通用推理基准性能。
来源:arXiv 自然语言处理 · arxiv.org