跳到正文
原文
vLLM 官方博客(网页)·· 1 天前AI 评分42

IsoExec:通过统一执行消除 SkyRL 训练与推理不一致

IsoExec: Unified Execution to Eliminate Trainer-Inference Mismatch in SkyRLAug 21, 2026·11 min readIsoExec unifies numerical execution across SkyRL's vLLM and Megatron runtimes, reducing the average rollout-versus-training logprob difference below 1e-6 on Qwen3.5-35B-A3B with 25% overhead.

AI 导读

SkyRL 引入跨框架统一执行抽象 IsoExec,通过统一执行契约与对齐的批次无关算子,消除 vLLM 推理引擎与 Megatron 训练引擎之间的数值执行不一致。在单台 8×H100 节点运行 Qwen3.5-35B-A3B 同步 DAPO 训练时,IsoExec 将采样与训练间的平均 logprob 差异降至 1e-6 以下,50 步内的额外开销为 25%。

来源:vLLM 官方博客(网页) · vllm.ai