跳到正文
原文
arXiv 人工智能· Tong Che, Yilong Li·· 1 天前AI 评分43

LLM 是否真的在利用特征?区分大语言模型中的特征操控与内在机制

Does the Model Use the Feature? Separating Steering from Mechanism in LLMs

AI 导读

能够操控行为的内部特征并不代表 LLM 实际在计算中使用该特征,操控可能超出特征的自然取值范围。研究提出在自然输入取值下通过安装(installation)、移除(removal)与下游恢复测试来评估特征的充分性与真实使用程度。对 Gemma 和 Llama 等模型的实验表明,仅凭概念追踪和行为操控无法证明模型在机制上使用了对应特征。

来源:arXiv 人工智能 · arxiv.org