arXiv 机器学习· Linfeng Dong·· 5 小时前AI 评分44
KVFetch:通过时间预取补全 KV cache 压缩缺失的另一半
KVFetch: Temporal Prefetching for the Missing Half of KV Cache Compression
AI 导读
研究人员提出免训练即插即用框架 KVFetch,通过时间预取机制解决 KV cache 压缩中按位置顺序遍历缺失导致的“顺序遗忘”问题。它将被驱逐候选降级至量化冷层,借助单调读取指针检测复制行为并向热层预取后续 token,不增加注意力计算成本。在同等预算的 RULER-16K 测试中,它将逐字复制表现从 0.8 恢复至 78.4,使 13 项任务平均分提升 +8.4。
来源:arXiv 机器学习 · arxiv.org