Apple Machine Learning Research·· 15 天前AI 评分35
DACA-GRPO:面向扩散语言模型强化学习的去噪感知信用分配机制
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
AI 导读
研究人员提出 DACA-GRPO,为扩散大语言模型的 GRPO 强化学习训练引入去噪进度评分与分层掩码似然机制,解决时间信用分配缺失及似然估计偏差问题。该方法作为即插即用模块,在数学推理、代码生成、约束满足和 JSON 模式遵循基准上分别实现最高 5.6pp、7.4pp、36.3pp 和 5.9pp 的性能提升。
来源:Apple Machine Learning Research · machinelearning.apple.com