arXiv 机器学习· Yufeng Wang·· 4 小时前AI 评分35
冻结 Decoder 修复 Encoder:基于 SVD 的 KV cache 压缩参数高效微调
Freeze the Decoder, Heal the Encoder: Parameter-Efficient Adaptation for SVD-Based KV-Cache Compression
AI 导读
在基于 SVD 的 KV cache 压缩中,冻结 decoder 且仅修复 encoder 在单独调优学习率后能达到与其他方案相当的精度,并减少 3x 可训练参数与 3x 优化器状态显存。该结论在视觉语言模型 Qwen2.5-VL-3B-Instruct 及两个纯文本骨干网络上均得到验证。研究同时揭示,在共享学习率下对比参数量差异大的微调方案会产生虚假性能优势。
来源:arXiv 机器学习 · arxiv.org