跳到正文
原文
arXiv 自然语言处理· Ahsan Bilal, Muhammad Ahmed Mohsin, Muhammad Umer, Wajih Hassan Raza, Atta Ul Asad, Young D. Kwon, Michal Valko, Dean F. Hougen·· 5 小时前AI 评分35

用于 KV cache 驱逐的蒙特卡洛估计

Monte Carlo Estimation for KV Cache Eviction

AI 导读

研究提出无需训练的 KV cache 驱逐方法 LORE-KV,通过采样模型未来的响应 query 轨迹来估计 prompt token 的重要性。在 B=128 预算下,该方法将 Qwen2.5-14B 的 LongBench 平均分从 45.49 提升至 48.24(+2.75),并将 Mistral-7B 的 16K RULER 平均分从 45.20 提升至 51.05(+5.85)。

来源:arXiv 自然语言处理 · arxiv.org