arXiv 自然语言处理· Jonathan Drechsel, Steffen Herbold·· 2 天前AI 评分37
梯度用于干预而激活值用于检测:大语言模型中的目标特征学习研究
Gradients for Interventions and Activations for Detection: Targeted Feature Learning in Language Models
AI 导读
研究针对大语言模型预定义概念的目标特征学习展开系统评估,发现对比激活值方法在概念检测上表现最强,而基于梯度的方法在因果干预上效果最佳。该研究组合 3 种模型信号与 2 种估计器构建了 6 种方法(包含 CAA、GRADIEND 及 4 种新方法),并在 15 项任务和 3 个语言模型上与预训练 SAE 进行了对比。结果表明目标特征质量取决于信号与估计器的共同作用,检测与干预体现出互补特性。
来源:arXiv 自然语言处理 · arxiv.org