热点事件持续更新
研究显示自适应微调可攻破LLM安全层定位防御
1 篇报道1 个报道来源6 小时前更新
先了解这件事
AI 综述
2026年10月,arXiv发表的一项针对大语言模型安全层的研究显示,基于定位安全层的防御机制在自适应微调攻击下容易失效,安全破坏会转移至未受保护区域。测试涵盖4个模型家族的6个检查点,结果显示即使冻结关键安全层,攻击者仅用100个有害样本微调即可使模型拒答率接近归零。在Llama-3.1-8B上的实验表明,攻击者通过分散参数更新就能击破奇异方向修复机制。该研究指出,局部冻结策略仅在少量有害样本意外混入时有效。
AI 根据报道生成 · 5 小时前更新
最新进展10月2日 12:00
最新研究显示,冻结LLM关键安全层仍会被100个有害样本微调攻破,拒答率接近归零。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv 自然语言处理拒答可定位但破坏会转移:少样本微调下的大语言模型安全层研究
最新研究表明,基于定位大语言模型安全层的防御机制在自适应微调攻击下容易失效,安全破坏会转移至未受保护区域。在4个模型家族的6个检查点测试中,即使冻结关键安全层,100个有害样本微调仍使拒答率接近归零。在 Llama-3.1-8B 上,攻击者通过分散参数更新即可击破奇异方向修复机制,局部冻结仅在少量有害样本意外混入时有效。
本事件热度走势
当前热度 9·可比范围峰值 10(10月2日 13:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。