arXiv 人工智能· Benoit Dherin, Michael Munn, Xavier Gonzalvo, Adrian Goldwaser, Blaz Bratanic, Ananth Balashankar, Andrey Vlasov, Pinzhi Huang, Cecile Loge, Nicole Mitchell, Andre Fernandes, Trilok Acharya, Wendy Kan, Ziyue Wang, Hanna Mazzawi, Felipe Tiengo Ferreira, Mor Geva·· 10 小时前AI 评分37
安全算子:通过谱优化调节大模型安全指令表达
The Safety Operator: Modulating the Expression of Safety Instructions via Spectral Optimization
AI 导读
研究团队提出“安全算子”(Safety Operator)机制,通过谱优化调节 Transformer 语言模型权重乘法算子的主特征值,以控制安全指令对生成的影响强度。基于此衍生的 Contrastive Safety Loss 可平衡有害查询强化与无害查询抑制,有效调节攻击成功率与过度拒答率之间的平衡,实现安全指令的帕累托改进。
来源:arXiv 人工智能 · arxiv.org