arXiv 人工智能· Pinaki Mohanty, Haoran Tang, Maggie Makar, Rajiv Khanna·· 7 小时前AI 评分35
学会遗忘:面向 LLM 表征空间的分布遗忘
Learning What to Forget: Distributional Unlearning for LLM Representation Spaces
AI 导读
研究人员提出面向 LLM 表征空间的非参数分布遗忘框架 Mamushi,利用概率分类器估计遗忘与保留数据的对数密度比来筛选删除样本。理论上,对该密度比设定阈值可在固定预算下实现最优选择规则,并具备非渐近迁移保证。在毒性语言及特定主题移除实验中,Mamushi 取得了优于基线的移除与保留权衡,有效减少了遗忘所需样本数。
来源:arXiv 人工智能 · arxiv.org