arXiv 自然语言处理· Zizhuo Fu, Runsheng Wang, Meng Li·· 1 天前AI 评分34
扩展注意力参数与上下文:基于 Mixture-of-Head 的原生稀疏注意力机制 NAMOH
Scaling Parameter and Context in Attention: Native Sparse Attention from Mixture-of-Head
AI 导读
研究团队提出 NAMOH,一种基于 Mixture-of-Head 的架构原生稀疏注意力机制,每个 token 仅激活 H 个头中的 K 个。每个头仅保留分配给它的 token 并在子序列内执行因果注意力,在不增加总 KV 存储的情况下减少单 token 的 KV 访问。实验表明 NAMOH 性能优于同等总参数的全激活模型,长上下文推理效率高于同激活参数的稠密模型,且兼容 GQA。
来源:arXiv 自然语言处理 · arxiv.org