arXiv 自然语言处理· Muhammed Ustaomeroglu, Ziyue Xu, Hanshen Xiao, Peter Cnudde, Guannan Qu, Holger R. Roth·· 2 天前AI 评分41
TRAP:理解并缓解语言模型的隐私记忆问题
TRAP: Understanding and Mitigating Privacy Memorization in Language Models
AI 导读
针对大语言模型微调时容易记忆并复现敏感记录的问题,研究团队提出了基于目标参考优势(TRA)的单侧惩罚方法 TRAP。研究发现隐私记忆在验证损失达到最低点后仍会持续增长,且早停策略对嵌入文本中的罕见敏感片段效果有限。在学生论文与临床病例数据测试中,TRAP 仅付出极小实用性代价便将记忆降至接近未训练模型的水平。
来源:arXiv 自然语言处理 · arxiv.org