跳到正文
原文
Apple Machine Learning Research·· 15 天前AI 评分35

DACA-GRPO:面向扩散语言模型强化学习的去噪感知信用分配机制

DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models

AI 导读

研究人员提出 DACA-GRPO,为扩散大语言模型的 GRPO 强化学习训练引入去噪进度评分与分层掩码似然机制,解决时间信用分配缺失及似然估计偏差问题。该方法作为即插即用模块,在数学推理、代码生成、约束满足和 JSON 模式遵循基准上分别实现最高 5.6pp、7.4pp、36.3pp 和 5.9pp 的性能提升。

来源:Apple Machine Learning Research · machinelearning.apple.com