超越均值注意力:面向大模型 KV Cache 驱逐的多样性感知与分层评分机制
现有如 SnapKV 和 PyramidKV 等 KV Cache 驱逐方法通常仅根据观察窗口内的平均注意力权重对 Token 进行排序。该研究提出了一种统一评分机制,引入了窗口查询中的注意力离散度以及相对于已选 Token 的冗余度惩罚,在无需额外前向传播的情况下平衡相关性与多样性。同时,研究还探索了随网络深度变化的分层评分系数配置,以优化大模型长上下文推理时的缓存保留效果。
推荐理由针对大模型长文本推理中的 KV Cache 驱逐策略进行了有价值的算法改进,兼顾了多样性与分层特征。
原标题:Beyond Mean Attention: Diversity-Aware, Layer-Wise Scoring for KV Cache Eviction
阅读 arXiv 自然语言处理 原文 ↗