跳到正文
原文
arXiv 人工智能· Jingyuan Huang, Zuming Huang, Yucheng Shi, Zhongzhi Li, Xiaoming Zhai, Wei Chu, Ninghao Liu·· 1 天前AI 评分37

Train4Merge:基于 OPD 模型合并中 RL 与 SFT 教师模型的对照研究

Train4Merge: A Controlled Single-Teacher Study of RL vs. SFT Teachers for OPD-Based Model Merging

AI 导读

Train4Merge 研究发现在基于同策略蒸馏(OPD)的模型合并中,强化学习(RL)教师指导的学生模型表现显著优于监督微调(SFT)教师。

来源:arXiv 人工智能 · arxiv.org