跳到正文
原文
arXiv 机器学习· Kang Chen, Xiuze Zhou, Hong Chen, Yuanguo Lin·· 2 天前AI 评分37

KV cache 压缩下的软拒绝现象:关键词检测下降而分类器保持稳定

When Keywords Drop but Classifiers Hold: Soft Refusals under KV Cache Compression

AI 导读

研究发现大语言模型在 KV cache 压缩推理下会出现“软拒绝”现象,导致轻量级关键词监控与分类器判断脱节。在 Qwen2.5-3B 上的测试显示,压缩后关键词拒绝率从 98.0% 降至 80.5%,而 HarmBench 分类器拒绝率仍维持在 99.0%-99.5% 且 MMLU 准确率保持 50.0% 不变。

来源:arXiv 机器学习 · arxiv.org