跳到正文
原文
vLLM 官方博客(网页)·· 21 小时前精选AI 评分70

vLLM 基于 Ray Direct Transport 实现大规模分片权重传输引擎

Large-Scale Sharded Weight Transfer with Ray Direct Transport (RDT) in vLLMAug 22, 2026·18 min readWe implement a native sharded weight transfer engine in vLLM utilizing Ray Direct Transport (RDT), achieving weight transfer for the Kimi K2 model in BF16 on 48 8xH100 nodes in 7.53s

AI 导读

vLLM 联合 NIXL 团队推出了基于 Ray Direct Transport(RDT)的原生分片权重传输引擎,在 48 台 8×H100 节点集群上实现 Kimi K2 模型 BF16 格式 7.9TB 权重在 7.53 秒内完成同步,聚合带宽达 1,049 GB/s。

推荐理由

针对在线强化学习超大 MoE 权重同步慢且显存开销高的问题,该方案通过分片点对点拉取与流水线重叠优化提供了高效的训推协同实践路径。

来源:vLLM 官方博客(网页) · vllm.ai