跳到正文
热点事件持续更新

研究团队提出长上下文稀疏解码方案MOIRA

1 篇报道1 个报道来源7 小时前更新

先了解这件事

AI 综述

2026年10月6日,研究团队提出名为MOIRA的长上下文自适应稀疏注意力解码方案。该方案在vLLM中实现且无需训练,支持按KV head和层自适应分配预算,并依托自规划kernel将解码流程保留在CUDA graph内。在基于H200的RULER 128k上下文测试中,MOIRA仅需读取约30%的page即可匹配稠密计算精度,单token生成时间相对FA3缩短2.2至2.5倍;在高负载场景下,其整体服务吞吐量最高可提升51%。

AI 根据报道生成 · 6 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. arXiv 人工智能
    MOIRA:面向长上下文解码的自适应稀疏注意力方案

    MOIRA 是一种在 vLLM 中实现的免训练长上下文稀疏解码方案,可按 KV head 和层自适应分配预算,并依托自规划 kernel 将解码保留在 CUDA graph 内。在 H200 的 RULER 128k 上下文测试中,MOIRA 仅读取约 30% 的 page 即可匹配稠密精度,单 token 生成时间相对 FA3 缩短 2.2-2.5x。在高负载下,其服务吞吐量最高可提升 51%。

本事件热度走势

当前热度 8·可比范围峰值 10(10月6日 13:00)·近 24 小时可比范围变化 –

02.557.51010月6日13:0010月6日15:0010月6日16:0010月6日18:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。