跳到正文
原文
arXiv 自然语言处理· Phongsakon Mark Konrad, Toygar Tanyel, Serkan Ayvaz·· 1 天前AI 评分38

自我报告无法证明大语言模型的自我模型:反事实报告可辨识性测试

Self-Reports Do Not Identify Self-Models: An Identifiability Test for Counterfactual Reports

AI 导读

大语言模型的自我报告仅反映其在提示词环境下的行为表现,本身无法证明其具备自我模型。针对三个开源指令模型在激活干预下类情感状态的研究显示,错误来源的演示会使反事实报告偏向来源答案族,而明确的机制绑定能减轻该偏差。研究建议自我报告评测基准引入固定干预下的环境漂移不变性测试,以防误判自主报告机制。

来源:arXiv 自然语言处理 · arxiv.org