arXiv 人工智能· Tong Che, Yilong Li·· 1 天前AI 评分43
LLM 是否真的在利用特征?区分大语言模型中的特征操控与内在机制
Does the Model Use the Feature? Separating Steering from Mechanism in LLMs
AI 导读
能够操控行为的内部特征并不代表 LLM 实际在计算中使用该特征,操控可能超出特征的自然取值范围。研究提出在自然输入取值下通过安装(installation)、移除(removal)与下游恢复测试来评估特征的充分性与真实使用程度。对 Gemma 和 Llama 等模型的实验表明,仅凭概念追踪和行为操控无法证明模型在机制上使用了对应特征。
来源:arXiv 人工智能 · arxiv.org