arXiv 自然语言处理· Lin Tian, Marian-Andrei Rizoiu·· 4 小时前AI 评分50
论文提出无触发词虚假信息研究:揭示大语言模型事实问答与下游决策间的审计鸿沟
Misinformation Without Triggers: From Factual Answers to Downstream Decisions
AI 导读
最新论文研究了无触发词虚假训练数据对大语言模型下游决策的影响,发现直接事实探测与模型实际行为之间存在明显的审计鸿沟。在受控决策任务与真实网络虚假信息测试中,即使模型在直接探测中回答正确或经过真实性修正,其下游决策依然会被注入的错误信息干扰,且虚假数字被移除后误导性叙事仍会残留。
来源:arXiv 自然语言处理 · arxiv.org