KV缓存压缩下的“软拒绝”:关键词失效但分类器仍能识别的安全隐患研究
该论文研究了长上下文大模型推理中KV缓存压缩对安全拒绝监测机制的影响。在实际部署中,系统常用关键词过滤或分类器判断模型是否拒绝有害请求。研究通过对200个长上下文有害提示词的配对测试发现,即使KV缓存压缩保持了任务准确率,也可能导致模型生成“软拒绝”表达,使得轻量级关键词监测失效,而强分类器仍能检测到,揭示了推理加速与安全护栏之间的一致性漏洞。
推荐理由揭示了长文本推理中KV缓存压缩对基于关键词的安全监测系统的潜在破坏,对模型部署与安全对齐有一定参考价值。
原标题:When Keywords Drop but Classifiers Hold: Soft Refusals under KV Cache Compression
阅读 arXiv 机器学习 原文 ↗