arXiv 自然语言处理· Kaibo Wang, Ding Ding, Fangyu Ding, Zijin Feng, Han Shi, Haili Bai, Jiacheng Sun, Yang Xiang·· 1 天前AI 评分34
弱均匀离散扩散模型更强大且具扩展性
Less Uniform Discrete Diffusion is More Powerful and Scalable
AI 导读
研究人员提出离散扩散语言模型框架 LUDI,通过引入弱均匀损失与逐 token 时间嵌入,解决了均匀扩散语言模型过度均匀的训练目标与采样混淆问题。基于 7B 自回归模型继续训练得到的 LUDI-7B 具备复杂推理能力,不仅在性能上媲美掩码扩散基准,相比自回归解码还实现了每步 3 个 token 的生成加速。
来源:arXiv 自然语言处理 · arxiv.org