DACA-GRPO:面向扩散语言模型强化学习的去噪感知信用分配算法
扩散大语言模型作为自回归模型的替代方案备受关注,但现有强化学习方法通常将所有去噪步视为同等重要,且依赖高方差、有偏的似然估计。为此,研究团队提出 DACA-GRPO(去噪感知信用分配 GRPO)。该方法作为一种轻量级、即插即用的增强方案,解决了去噪轨迹中时间信用分配缺失及策略优化时平均场似然估计的系统性偏差问题,提升了扩散语言模型的强化学习训练效果。
推荐理由针对扩散语言模型强化学习训练中信用分配缺失的痛点提出改进方案,技术针对性强,值得关注扩散模型架构优化的研究者阅读。
原标题:DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
阅读 Apple Machine Learning Research 原文 ↗