跳到正文
原文
arXiv 人工智能· Dich Nhat Minh Nguyen, Tran Dang Duong Nguyen·· 8 小时前AI 评分43

MOIRA:面向长上下文解码的自适应稀疏注意力方案

MOIRA: Mass-Oriented Indexing with Ragged Attention for Long-Context Decoding

AI 导读

MOIRA 是一种在 vLLM 中实现的免训练长上下文稀疏解码方案,可按 KV head 和层自适应分配预算,并依托自规划 kernel 将解码保留在 CUDA graph 内。在 H200 的 RULER 128k 上下文测试中,MOIRA 仅读取约 30% 的 page 即可匹配稠密精度,单 token 生成时间相对 FA3 缩短 2.2-2.5x。在高负载下,其服务吞吐量最高可提升 51%。

来源:arXiv 人工智能 · arxiv.org