arXiv 机器学习· Davis Wertheimer, Haochen Shen, Ahan Gupta, Derrick Liu, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang·· 5 小时前AI 评分42
自剪枝 Transformer:通过 Universal Attention 实现极限 KV cache 压缩
A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention
AI 导读
研究人员提出一种可端到端训练的 Universal Attention 架构,在保留 RoPE 嵌入和 Softmax 注意力的同时引入复合衰减机制,能够自适应剪除对注意力计算贡献最小的 token。实验显示,该架构在自然语言和合成任务中实现了 10x 的 KV cache 压缩且下游性能更优,并在 16k 长度下达到 25x 的压缩率。
来源:arXiv 机器学习 · arxiv.org