跳到正文
原文
arXiv 机器学习· Ryan Solgi, Parsa Madinei, Zheng Zhang·· 7 小时前AI 评分34

面向多维序列建模的 Tucker Bottleneck Attention

Tucker Bottleneck Attention for Multi-Dimensional Sequence Modeling

AI 导读

TuBA(Tucker Bottleneck Attention)通过低秩张量结构将隐藏张量投影到紧凑的 Tucker 核心执行多头自注意力,实现亚二次方计算并支持自回归扩展。在视频预测和全球天气预报任务中,TuBA 相比标准自注意力实现最高 4.27 倍加速,误差分别降低最高 24.7% 与 37.1%,计算量分别减少最高 66.6% 与 85.1%。

来源:arXiv 机器学习 · arxiv.org