跳到正文
原文
arXiv 自然语言处理· Vincent Siu, Glenn Grant-Richards, Vlad Pavlovich, Yizhou Sun, Dawn Song, Chenguang Wang·· 5 小时前AI 评分44

Transformer 拒绝机制中的组件与维度稀疏性研究

Component and Dimension Sparsity in Transformer Refusal Mechanisms

AI 导读

研究人员针对 4 款开源权重模型分解拒绝引导干预,发现大语言模型的拒绝行为并非弥散编码,而是由结构化的稀疏机制组装而成。实验表明,干预仅占 28%–48% 的上游组件即可保留 88%–101% 的引导效果,且信号进一步集中在约 50% 的残差流维度中(保留 85%–98% 效果)。该成果已被 COLM 2026 接收,代码与原始实验数据已全部开源。

来源:arXiv 自然语言处理 · arxiv.org