跳到正文
原文
arXiv 机器学习· Yiping Ji, James Martens, Simon Lucey·· 4 小时前AI 评分34

我们应该跳过扩散吗?解耦扩散 Transformer 架构 DDT-RFE 研究

Should We Skip Diffusion?

AI 导读

研究提出 DDT-RFE 架构,通过移除解耦扩散 Transformer(DDT)编码器中 Self-Attention 和 MLP 的残差连接,促进各层学习更深度的抽象语义表征。模型通过融合输入 patch embedding 与多层编码器特征供给解码器,在使用更少编码器块的情况下,在图像分类、语义分割等视觉理解任务上全面超越 DDT,并在 ImageNet 图像生成中取得了更低的 FID。

来源:arXiv 机器学习 · arxiv.org