arXiv 自然语言处理· Rana Aref Salama, Abdou Youssef, Mona Diab·· 5 小时前AI 评分36
WNet:基于离散小波变换实现高效 Token 混合
WNet: Discrete Wavelets Transform for Efficient Token Mixing
AI 导读
研究提出 Transformer 编码器 WNet,采用离散小波变换(DWT)替代自注意力机制进行高效 token 混合。该模型设计了线性融合、学习门控与 token 自选尺度 3 种无注意力混合器,并提供仅在末层引入自注意力的混合版本。在 4,096 tokens 长度下,其 token 门控混合器的训练速度比自注意力机制快 2.7 倍。
来源:arXiv 自然语言处理 · arxiv.org