vLLM 官方博客(网页)·· 22 小时前精选AI 评分73
vLLM 推出分层 KV Cache 卸载框架
Tiered KV Cache Offloading in vLLMSep 10, 2026·10 min readA host-centric framework for scaling KV cache across host memory, filesystems, object stores, and remote peers — reducing recomputation and increasing serving capacity.
AI 导读
vLLM 正式推出分层 KV Cache 卸载框架(Tiered KV Cache Offloading),支持将加速卡显存中逐出的 KV 数据下沉至主机内存、文件系统、对象存储或远端节点以避免重复计算。
推荐理由
框架通过主机内存统筹多级存储与节点间共享,为长上下文和大并发下的显存瓶颈提供了低成本扩展方案。
来源:vLLM 官方博客(网页) · vllm.ai