跳到正文
原文
arXiv 人工智能· Chence Yang, Ningxi Cheng, Arash Akbari, Qitao Tan, Qingchan Zhu, Ci Zhang, Changdi Yang, Yanzhi Wang, Wei Niu, Jinhui Wang, Jin Lu, Geng Yuan·· 5 小时前AI 评分34

BitNest:用于显存高效 LLM 推理加速的位嵌套投机解码框架

BitNest: Bit-Nested Speculative Decoding for Memory-Efficient LLM Inference Acceleration

AI 导读

研究人员提出 BitNest 位嵌套投机解码框架,将低精度 draft 模型直接嵌入高精度 target 中以共享单一物理权重,从而显著降低显存开销。该框架通过残差细化恢复高精度表示,并将渐进精度设计扩展至长上下文推理的 KV cache。

来源:arXiv 人工智能 · arxiv.org