热点事件持续更新
研究团队提出长上下文稀疏解码方案MOIRA
1 篇报道1 个报道来源7 小时前更新
先了解这件事
AI 综述
2026年10月6日,研究团队提出名为MOIRA的长上下文自适应稀疏注意力解码方案。该方案在vLLM中实现且无需训练,支持按KV head和层自适应分配预算,并依托自规划kernel将解码流程保留在CUDA graph内。在基于H200的RULER 128k上下文测试中,MOIRA仅需读取约30%的page即可匹配稠密计算精度,单token生成时间相对FA3缩短2.2至2.5倍;在高负载场景下,其整体服务吞吐量最高可提升51%。
AI 根据报道生成 · 6 小时前更新
最新进展10月6日 12:00
研究团队发布MOIRA方案,在128k上下文下仅读约30% page达稠密精度,吞吐量最高提升51%。报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- arXiv 人工智能MOIRA:面向长上下文解码的自适应稀疏注意力方案
MOIRA 是一种在 vLLM 中实现的免训练长上下文稀疏解码方案,可按 KV head 和层自适应分配预算,并依托自规划 kernel 将解码保留在 CUDA graph 内。在 H200 的 RULER 128k 上下文测试中,MOIRA 仅读取约 30% 的 page 即可匹配稠密精度,单 token 生成时间相对 FA3 缩短 2.2-2.5x。在高负载下,其服务吞吐量最高可提升 51%。
本事件热度走势
当前热度 8·可比范围峰值 10(10月6日 13:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。