arXiv 人工智能· Jingyuan Huang, Zuming Huang, Yucheng Shi, Zhongzhi Li, Xiaoming Zhai, Wei Chu, Ninghao Liu·· 1 天前AI 评分37
Train4Merge:基于 OPD 模型合并中 RL 与 SFT 教师模型的对照研究
Train4Merge: A Controlled Single-Teacher Study of RL vs. SFT Teachers for OPD-Based Model Merging
AI 导读
Train4Merge 研究发现在基于同策略蒸馏(OPD)的模型合并中,强化学习(RL)教师指导的学生模型表现显著优于监督微调(SFT)教师。
来源:arXiv 人工智能 · arxiv.org