跳到正文
原文
arXiv 人工智能· Han Wang, Erik Miehling, Dennis Wei, Karthikeyan Natesan Ramamurthy, Huan Zhang·· 3 小时前AI 评分38

论大语言模型拒绝行为的引导维度

On the Steering Dimensionality of Refusal in Language Models

AI 导读

一项针对大语言模型拒绝机制的研究提出了“引导维度”概念,发现安全对齐触发的拒绝具备 1 维可引导性,多个不同方向均能实现可靠控制。而在通用语境下,拒绝行为展现出更丰富的激活几何结构,即使采用 5 维引导子空间也无法完全覆盖其变化。研究表明模型拒绝底层的激活几何高度依赖语境,远比单一线性方向复杂。

来源:arXiv 人工智能 · arxiv.org