跳到正文
原文
arXiv 自然语言处理· Ziyuan Yang, Wenxuan Ding, Shangbin Feng, Yulia Tsvetkov·· 5 小时前AI 评分41

读取而非操控:利用 Router Logits 提升 MoE 视觉语言模型的多模态安全

Reading, Not Manipulating: Leveraging Router Logits for Multimodal Safety in MoE Vision-Language Models

AI 导读

新方法通过读取 MoE 视觉语言模型在 prompt prefill 阶段的 router logits 信号,无需修改模型参数或专家路由即可在生成前有效识别不安全请求。该轻量级检测器在 Qwen3-VL 与 Kimi-VL 上大幅降低了 HoliSafe 基准的安全错误,并在 MISHard 和 MM-SafetyBench 等分布外安全基准上展现出良好的泛化能力。

来源:arXiv 自然语言处理 · arxiv.org