跳到正文
原文
arXiv 自然语言处理· Jingxuan Wu, Yuzhe Yang, Yiqiao Huang, Chengzhi Liu, Qingni Wang, Chengxuan Qian, Shutong Wu, Jiawei Zhang, Xin Eric Wang·· 1 天前AI 评分38

MemFold:通过同策略优化学习用于长上下文个性化的紧凑软记忆

MemFold: Learning Compact Soft Memory for Long-Context Personalization via On-Policy Optimization

AI 导读

MemFold 提出通过同策略优化将文本记忆压缩为固定预算的 K 个连续向量(软记忆),以解决长上下文个性化问题。该方法结合任务结果的群体相对奖励与置信度门控同策略蒸馏训练 Reader,推理阶段完全移除教师模型。

来源:arXiv 自然语言处理 · arxiv.org