跳到正文
原文
vLLM 官方博客(网页)·· 22 小时前精选AI 评分73

vLLM 推出分层 KV Cache 卸载框架

Tiered KV Cache Offloading in vLLMSep 10, 2026·10 min readA host-centric framework for scaling KV cache across host memory, filesystems, object stores, and remote peers — reducing recomputation and increasing serving capacity.

AI 导读

vLLM 正式推出分层 KV Cache 卸载框架(Tiered KV Cache Offloading),支持将加速卡显存中逐出的 KV 数据下沉至主机内存、文件系统、对象存储或远端节点以避免重复计算。

推荐理由

框架通过主机内存统筹多级存储与节点间共享,为长上下文和大并发下的显存瓶颈提供了低成本扩展方案。

来源:vLLM 官方博客(网页) · vllm.ai