arXiv 自然语言处理· Jiangfeng Chen, Xinyu Wang, Tianshuo Yan, Hanwei Wu, Xiao-Wen Chang, Yang Zhang, Lei Ding·· 3 小时前AI 评分35
面向大语言模型注意力机制的顺序结构化 Tucker 压缩框架 FTC
Sequential Functional Structured Tucker Compression for Large Language Model Attentions
AI 导读
研究人员提出大语言模型注意力压缩框架 FTC,无需微调或基于梯度的恢复,可在固定存储预算下联合利用原生 Q/K/V 头结构并动态适应顺序压缩带来的表征偏移。在 6B 至 32B 参数的 7 款 decoder-only 模型测试中,FTC 在 5 款 GQA 模型的所有保留比例下均取得对比方法中最低的 WikiText-2 困惑度。该性能提升可有效迁移至下游任务,并在 32B 规模下保持显著优势。
来源:arXiv 自然语言处理 · arxiv.org