热点事件持续更新
基于Router Logits的MoE视觉语言模型安全检测方法提出
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月,相关研究提出了一种利用Router Logits提升MoE视觉语言模型多模态安全的新方法。该方法通过在prompt prefill阶段读取模型的router logits信号,无需修改模型参数或专家路由,即可在文本生成前有效识别不安全请求。实验显示,该轻量级检测器在Qwen3-VL和Kimi-VL上大幅降低了HoliSafe基准的安全错误,并在MISHard及MM-SafetyBench等分布外安全基准上展现出良好的泛化能力。
AI 根据报道生成 · 3 小时前更新
最新进展10月7日 12:00
研究提出通过读取MoE模型prefill阶段的router logits进行多模态安全检测的方法。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv 自然语言处理读取而非操控:利用 Router Logits 提升 MoE 视觉语言模型的多模态安全
新方法通过读取 MoE 视觉语言模型在 prompt prefill 阶段的 router logits 信号,无需修改模型参数或专家路由即可在生成前有效识别不安全请求。该轻量级检测器在 Qwen3-VL 与 Kimi-VL 上大幅降低了 HoliSafe 基准的安全错误,并在 MISHard 和 MM-SafetyBench 等分布外安全基准上展现出良好的泛化能力。
本事件热度走势
当前热度 9·可比范围峰值 10(10月7日 13:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。