vLLM 官方博客(网页)·· 6 小时前精选AI 评分72
vLLM-Omni 推出分布式分层卸载技术,支持超显存容量 DiT 模型高效推理
Distributed Layerwise Offload: Scaling Toward 200B+ DiT Models Efficiently in vLLM-OmniAug 17, 2026·23 min readDistributed Layerwise Offload shards and streams DiT weights across devices, serving a measured 124 GB Cosmos3 model on 64 GB HBM and estimating a path toward 200B+ models.
AI 导读
vLLM-Omni 推出分布式分层卸载(DLO)技术,通过 Meta 设备与 mmap 加载、权重切分重构、双缓冲预取以及数据并行多并发,使单卡显存不足的超大视频生成模型可在多卡 GPU 或 NPU 上高效运行。
推荐理由
vLLM-Omni 结合 mmap 与多流 AllGather 卸载降低显存与内存峰值,为大参数量扩散模型的低成本分布式推理提供了落地路径。
来源:vLLM 官方博客(网页) · vllm.ai