跳到正文
原文
arXiv 机器学习· Sara Abdali, Jongwoo Ko, Pashmina Cameron·· 2 小时前AI 评分38

AttSVD:基于注意力引导 SVD 的提示词自适应低秩 KV cache 压缩

AttSVD:Prompt-Adaptive Low-Rank KV Cache Compression via Attention-Guided SVD

AI 导读

研究人员提出 AttSVD,一种基于注意力引导 SVD 的提示词自适应低秩 KV cache 压缩方法。该方法在特征轴保留全部 token,仅截断保留注意力实际读取的方向,并提供 accumulating 与 streaming 两种解码缓存策略。在多个模型、智能体基准及完整 LongBench 上,AttSVD 仅使用至多 50% 的 KV cache 内存即可保持与密集缓存持平的性能。

来源:arXiv 机器学习 · arxiv.org