跳到正文
热点事件持续更新

研究人员提出步对齐特权蒸馏方法SAPD

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月8日,研究人员提出了一种无需 rollout 生成的自蒸馏后训练方法——步对齐特权蒸馏(SAPD)。该方法通过将参考解答与各个推理步骤进行对齐,提供针对性的特权分布监督。测试结果显示,在数学推理基准上,SAPD 表现超越了监督微调与标签平滑,且能媲美 on-policy 强化学习,同时较好地保留了模型的域外编程能力。此外,SAPD 相比 on-policy 基线实现了约2倍的训练循环加速,相关代码已正式开源。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv 自然语言处理
    SAPD:步对齐特权蒸馏

    研究人员提出无需 rollout 生成的自蒸馏后训练方法 SAPD,通过将参考解答与各推理步骤对齐来提供针对性的特权分布监督。在数学推理基准上,SAPD 表现超越监督微调与标签平滑,且能媲美 on-policy 强化学习,同时较好保留了域外编程能力。该方法相比 on-policy 基线实现了约 2x 的训练循环加速,相关代码已开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。