跳到正文
原文
arXiv 机器学习· Emre Can Acikgoz, Yang Li, Zeyu Leo Liu, Srijan Bansal, Dilek Hakkani-T\"ur, Shafiq Joty, Semih Yavuz·· 1 天前AI 评分46

理解大语言模型后训练中 SFT、RLVR 与 OPD 的协同效应

Understanding the Synergy between SFT, RLVR, and OPD in LLM Post-Training

AI 导读

一项针对 Qwen3 模型的研究揭示了大语言模型后训练中 SFT、RLVR 与在线策略蒸馏(OPD)的协同机制,指出各阶段的效果高度取决于师生兼容性。实验表明,结合教师 RLVR 适配与学生 SFT 预热,可将平均 OPD 准确率从 29.2% 提升至 43.8%(相对提升 50%)。此外,OPD 比 SFT 能为下游 RLVR 提供更优的初始化,且该优势随算力扩展而扩大。

来源:arXiv 机器学习 · arxiv.org