热点事件持续更新
长上下文混合模型机制及外推研究取得进展
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月8日,相关研究团队在arXiv发布长上下文混合模型机制论文(Part 1.1)。该研究探讨了全注意力与滑动窗口注意力(SWA)或门控线性注意力(GLA/GDN)的混合架构,揭示了两者在持续预训练和长度外推上的“跷跷板效应”。针对线性注意力混合模型,研究提出了Sliding-Window Linear Attention方法,成功实现16倍免训练长度外推,并在64k上下文的NIAH-SK1测试中保持100%的准确率。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv 自然语言处理长上下文混合模型机制 Part 1.1:从混合注意力到混合位置
长上下文混合模型机制研究探讨了全注意力与滑动窗口注意力(SWA)或门控线性注意力(GLA/GDN)的混合架构,揭示了两者在持续预训练和长度外推上的“跷跷板效应”。针对线性注意力混合模型,研究提出 Sliding-Window Linear Attention,实现 16x 免训练长度外推,并在 64k 上下文的 NIAH-SK1 测试中保持 100% 准确率。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。