跳到正文
原文
arXiv 自然语言处理· Xiaoran Liu, Ziwei He, Xipeng Qiu·· 5 小时前AI 评分42

长上下文混合模型机制 Part 1.1:从混合注意力到混合位置

Mechanics of Long-Context Hybrid Models Part 1.1: From Hybrid Attention to Hybrid Position

AI 导读

长上下文混合模型机制研究探讨了全注意力与滑动窗口注意力(SWA)或门控线性注意力(GLA/GDN)的混合架构,揭示了两者在持续预训练和长度外推上的“跷跷板效应”。针对线性注意力混合模型,研究提出 Sliding-Window Linear Attention,实现 16x 免训练长度外推,并在 64k 上下文的 NIAH-SK1 测试中保持 100% 准确率。

来源:arXiv 自然语言处理 · arxiv.org