针对黑盒在线策略蒸馏的持久负样本对抗优化方法
该论文针对黑盒在线策略蒸馏(OPD)场景展开研究。在黑盒对抗蒸馏中,判别器通过区分教师与学生生成结果来提供策略奖励,但每步仅从最新学生模型采样负样本会导致奖励函数面临“移动目标”问题。研究团队提出持久负样本对抗蒸馏方法,通过动态负样本池缓解分布剧烈变化带来的训练不稳定,提升黑盒知识蒸馏效果。
推荐理由针对黑盒大模型对齐与蒸馏中的判别器训练稳定性问题提出了实用的工程优化方案,对模型蒸馏研究有一定参考价值。
原标题:Persistent Negatives for Adversarial Black-Box On-Policy Distillation
阅读 arXiv 自然语言处理 原文 ↗