arXiv 人工智能· Sreetama Sarkar, Saptarshi Mitra, Sitao Huang, Souvik Kundu, Peter A. Beerel·· 5 小时前AI 评分44
RaReCache:通过基于秩不一致性的选择性重计算弥合跨模型 KV Cache 复用差距
RaReCache: Bridging the Gap in Cross-Model KV Cache Reuse via Rank disagreement-based Selective Recomputation
AI 导读
RaReCache 框架通过选择性重计算关键 token,使大模型能精准复用小模型预填充的 KV cache,实现最高 3.04x prefill 加速。在 Qwen3-0.6B 至 14B(23x 参数差)上仅重算 30% 位置即可保留 95-99% 精度,Llama3-8B 至 70B 上重算 40% 保留 96.5% 精度。
来源:arXiv 人工智能 · arxiv.org