vLLM 官方博客(网页)·· 18 小时前AI 评分45
vime 联合 RL-Kernel 与 AMD 在 ROCm 上实现训练与 Rollout 逐比特数值一致性
vime × RL-Kernel × AMD: Bitwise Train–Rollout Consistency on ROCmSep 14, 2026·10 min readvime and RL-Kernel align selected-token logprobs bit for bit across Megatron training and vLLM rollout on AMD Instinct MI300X, with zero mismatches across 200 GRPO steps.
AI 导读
vime、RL-Kernel 与 AMD 合作在 ROCm 上实现了 Megatron 训练与 vLLM rollout 的逐比特数值一致性。在 8× AMD Instinct MI300X 运行的 Qwen3-8B GRPO 端到端实验中,系统连续 200 步实现 mismatch_count = 0 且 max_abs_diff = 0。
来源:vLLM 官方博客(网页) · vllm.ai