AMD MI300X实现Megatron训练与vLLM推理的按位完全一致性
vime与RL-Kernel在AMD Instinct MI300X及ROCm软件栈上,实现了Megatron训练端与vLLM推理端(Rollout)选定Token对数概率的按位(bit-for-bit)完全一致。该技术解决了大模型强化学习微调过程中,因训练与采样引擎底层算子实现差异导致的数值偏差痛点,达成测试零误差,大幅提升了AMD算力生态在RLHF等强化学习工作流中的稳定性和可用性。
推荐理由攻克了大模型强化学习中训练与采样数值不一致的关键系统工程难题,完善了AMD GPU的开源生态。
原标题:vime × RL-Kernel × AMD: Bitwise Train–Rollout Consistency on ROCm
阅读 vLLM 官方博客(网页) 原文 ↗