跳到正文
热点事件持续更新

长上下文混合模型机制及外推研究取得进展

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月8日,相关研究团队在arXiv发布长上下文混合模型机制论文(Part 1.1)。该研究探讨了全注意力与滑动窗口注意力(SWA)或门控线性注意力(GLA/GDN)的混合架构,揭示了两者在持续预训练和长度外推上的“跷跷板效应”。针对线性注意力混合模型,研究提出了Sliding-Window Linear Attention方法,成功实现16倍免训练长度外推,并在64k上下文的NIAH-SK1测试中保持100%的准确率。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv 自然语言处理
    长上下文混合模型机制 Part 1.1:从混合注意力到混合位置

    长上下文混合模型机制研究探讨了全注意力与滑动窗口注意力(SWA)或门控线性注意力(GLA/GDN)的混合架构,揭示了两者在持续预训练和长度外推上的“跷跷板效应”。针对线性注意力混合模型,研究提出 Sliding-Window Linear Attention,实现 16x 免训练长度外推,并在 64k 上下文的 NIAH-SK1 测试中保持 100% 准确率。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。