arXiv 机器学习· Elad David, Max Fomin·· 4 小时前AI 评分39
提示模型判别:恶意输入探测器的野外泛化研究
Prompted to Discriminate: Generalizing Malicious-Input Probes in the Wild
AI 导读
研究发现,在用户输入后添加简短分类后缀并读取模型隐藏状态,可使激活探测器在分布外恶意输入检测上的 AUC 最高提升约 4 个点。该结论在 Llama-3.1-8B、Qwen3.5-9B 和 Gemma-4-12B 等模型及 13 个安全基准上得到验证,性能提升主要源于分类格式本身。该方法可通过 KV cache 分叉以极低成本部署,并兼容生产环境的多位置池化探测器。
来源:arXiv 机器学习 · arxiv.org