arXiv 自然语言处理· David I. Atkinson, Dillon Plunkett, David Bau·· 4 小时前AI 评分48
从模型内部识别大语言模型的真实内省
Identifying Introspection From the Inside
AI 导读
研究人员通过分析模型内部机制,提出了在受控设定下区分大语言模型真实自述与虚构内省的特征方法。实验发现,对隐式决策任务进行持续微调可使模型自发涌现准确的偏好自述,并伴随偏好表征向网络更早层转移。利用 attribution patching,研究证实真实模型在决策与自述任务间具有显著更高的归因相似度,可仅凭网络结构区分其真实性。
来源:arXiv 自然语言处理 · arxiv.org