跳到正文
原文
arXiv 自然语言处理· Tianle Wang, Jiayu Liu, Ruizhi Zhao, Ning Miao·· 7 小时前AI 评分36

SAPD:步对齐特权蒸馏

SAPD: Step-Aligned Privileged Distillation

AI 导读

研究人员提出无需 rollout 生成的自蒸馏后训练方法 SAPD,通过将参考解答与各推理步骤对齐来提供针对性的特权分布监督。在数学推理基准上,SAPD 表现超越监督微调与标签平滑,且能媲美 on-policy 强化学习,同时较好保留了域外编程能力。该方法相比 on-policy 基线实现了约 2x 的训练循环加速,相关代码已开源。

来源:arXiv 自然语言处理 · arxiv.org