跳到正文
热点事件持续更新

基于Router Logits的MoE视觉语言模型安全检测方法提出

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月,相关研究提出了一种利用Router Logits提升MoE视觉语言模型多模态安全的新方法。该方法通过在prompt prefill阶段读取模型的router logits信号,无需修改模型参数或专家路由,即可在文本生成前有效识别不安全请求。实验显示,该轻量级检测器在Qwen3-VL和Kimi-VL上大幅降低了HoliSafe基准的安全错误,并在MISHard及MM-SafetyBench等分布外安全基准上展现出良好的泛化能力。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv 自然语言处理
    读取而非操控:利用 Router Logits 提升 MoE 视觉语言模型的多模态安全

    新方法通过读取 MoE 视觉语言模型在 prompt prefill 阶段的 router logits 信号,无需修改模型参数或专家路由即可在生成前有效识别不安全请求。该轻量级检测器在 Qwen3-VL 与 Kimi-VL 上大幅降低了 HoliSafe 基准的安全错误,并在 MISHard 和 MM-SafetyBench 等分布外安全基准上展现出良好的泛化能力。

本事件热度走势

当前热度 9·可比范围峰值 10(10月7日 13:00)·近 24 小时可比范围变化 –

02.557.51010月7日13:0010月7日14:0010月7日14:0010月7日15:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。