跳到正文
原文
arXiv 人工智能· Muhammad Zeeshan Karamat, Christiana Chamon Garcia·· 6 小时前AI 评分36

端侧语言模型安全有多脆弱?定位安全关键参数进行稀疏故障分析

How Fragile Is On-Device Language Model Safety? Localizing Safety-Critical Parameters for Sparse Fault Analysis

AI 导读

研究表明 LLaMA-2-7B-Chat 的安全敏感行为高度集中于稀疏参数中,MLP 的 down_proj 是最显著的安全敏感组件。实验显示仅修改 down_proj 中 0.19% 的权重即可达到 53% Basic ASR 和 56% GCG ASR,同时 tinyBenchmarks 准确率仍保持在 51.6%(未修改基线为 52.2%),为端侧及智能体场景的选择性完整性保护提供了依据。

来源:arXiv 人工智能 · arxiv.org