AIDC
← 返回全部动态
arXiv 自然语言处理AI 评分 60/10009月28日 12:00

针对黑盒在线策略蒸馏的持久负样本对抗优化方法

该论文针对黑盒在线策略蒸馏(OPD)场景展开研究。在黑盒对抗蒸馏中,判别器通过区分教师与学生生成结果来提供策略奖励,但每步仅从最新学生模型采样负样本会导致奖励函数面临“移动目标”问题。研究团队提出持久负样本对抗蒸馏方法,通过动态负样本池缓解分布剧烈变化带来的训练不稳定,提升黑盒知识蒸馏效果。

推荐理由针对黑盒大模型对齐与蒸馏中的判别器训练稳定性问题提出了实用的工程优化方案,对模型蒸馏研究有一定参考价值。

原标题:Persistent Negatives for Adversarial Black-Box On-Policy Distillation

阅读 arXiv 自然语言处理 原文 ↗

同一事件的其他来源

arXiv 自然语言处理09月28日 12:00

利用策略内自蒸馏实现推理能力的递归自我提升

该研究探讨了大模型推理能力的递归自我提升方法。针对传统的策略内蒸馏(OPD)依赖外部教师模型提供密集的token级监督,研究提出了策略内自蒸馏(OPSD)机制。该机制通过复制一份冻结的学生模型,并在其上下文中提供真实标签作为特权教师模型,引导仅接收问题的学生模型进行模仿学习,从而在无需更强外部教师的情况下实现模型的自主迭代强化。