arXiv 自然语言处理· Kenan Tang, Andong Hua, Chengxuan Qian, Saket Tiwari, Yao Qin·· 3 小时前AI 评分43
SFT-as-Context:通过上下文学习缓解监督微调中的能力遗忘
SFT-as-Context Mitigates Forgetting in Supervised Fine-Tuning
AI 导读
研究团队提出无需训练的方法 SFT-as-context,让预训练母模型将 SFT 模型的回复作为上下文,通过上下文学习获取微调能力并保留自身通用能力。在 19 对模型及 11 个评测基准中,该方法在 AIME 2024 和 LiveCodeBench 上与 SFT 模型差距仅 2.2 和 2.1 个百分点,通用能力与母模型平均差距在 2.2 个百分点以内。
来源:arXiv 自然语言处理 · arxiv.org