跳到正文
热点事件持续更新

研究提出通过谱优化调节安全指令表达的Safety Operator方法

1 篇报道1 个报道来源11 小时前更新

先了解这件事

AI 综述

2026年9月30日,arXiv发布的研究提出了一种名为“安全算子”(Safety Operator)的机制。该方法通过谱优化调节Transformer语言模型权重乘法算子的主特征值,以控制安全指令对模型生成过程的影响强度。基于该算子衍生的对比安全损失(Contrastive Safety Loss)能够同时平衡对有害查询的强化和对无害查询的抑制,从而有效调节攻击成功率与过度拒答率之间的平衡,实现了安全指令的帕累托改进。

AI 根据报道生成 · 9 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv 人工智能
    安全算子:通过谱优化调节大模型安全指令表达

    研究团队提出“安全算子”(Safety Operator)机制,通过谱优化调节 Transformer 语言模型权重乘法算子的主特征值,以控制安全指令对生成的影响强度。基于此衍生的 Contrastive Safety Loss 可平衡有害查询强化与无害查询抑制,有效调节攻击成功率与过度拒答率之间的平衡,实现安全指令的帕累托改进。

本事件热度走势

当前热度 8·可比范围峰值 9(9月30日 14:00)·近 24 小时可比范围变化 –

02.557.5109月30日14:009月30日17:009月30日19:009月30日22:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。