跳到正文
原文
arXiv 自然语言处理· Hanzuo Liu, Chunyu Liu, Chaofan Lin, Alex Lamb, Mingyu Gao·· 8 小时前AI 评分36

缓存内部编码器:跨 LLM 查询的紧凑可复用内存架构 EncBank

Cache the Encoder Within:Compact, Reusable Memory across LLM Queries

AI 导读

EncBank 将预训练 LLM 较低层作为可复用文档编码器并紧凑存储中间状态,结合自蒸馏后缀适配器消除跨查询重复编码开销。在 3 个 Qwen 基座和 5 项基准测试中,4-bit 存储使基准得分与原生精度相差 1 分以内,并在 Qwen3-8B 负载下仅占用 28.1% GPU 存储。

来源:arXiv 自然语言处理 · arxiv.org