基于 Amazon EKS、EFA 与 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%
文章介绍了如何在 Amazon EKS 上利用 Elastic Fabric Adapter (EFA) 和 DeepEP 扩展混合专家模型(MoE)的强化学习训练。该方案构建了结合 Amazon EKS、EFA 与 Amazon S3 的技术架构,有效针对大规模 RLHF 与 GRPO 训练场景,将整体强化学习 rollout 阶段的吞吐量提升了 40%,优化了分布式集群的通信与计算效率。
文章介绍了如何在 Amazon EKS 上利用 Elastic Fabric Adapter (EFA) 和 DeepEP 扩展混合专家模型(MoE)的强化学习训练。该方案构建了结合 Amazon EKS、EFA 与 Amazon S3 的技术架构,有效针对大规模 RLHF 与 GRPO 训练场景,将整体强化学习 rollout 阶段的吞吐量提升了 40%,优化了分布式集群的通信与计算效率。
该实践指南介绍了如何在 Amazon SageMaker HyperPod 上运行开源强化学习框架 SkyRL,采用 GRPO 算法对 Qwen3-VL-8B 视觉语言大模型进行后训练。内容涵盖构建容器镜像、通过 SageMaker Studio 启动 Ray 分布式集群、提交与监控训练作业,以及最终部署和托管训练所得的 LoRA 适配器以进行推理。
该方案结合 Amazon SageMaker HyperPod 与云原生存储 Qumulo,支持将模型训练算力集群与数据集部署在不同的 AWS 区域。测试验证结果显示,通过利用 NeuralCache 进行短暂预热后,跨地域远程计算集群的训练数据吞吐量能够达到与本地同地域集群相同的性能水平,有效解决了跨区域算力调度与数据访问的瓶颈。
Amazon SageMaker AI 推出并发扫描功能,帮助用户在不同负载水平下系统性基准测试生成式 AI 端点,以实现算力资源的合理配置(Right-sizing)。文章详细介绍了模型部署流程,以及如何利用 CreateAIBenchmarkJob API 运行自动化并发测试,并根据测试结果在算力集群规模(Fleet Size)和容量规划上做出基于数据的决策。
亚马逊云科技(AWS)汇总了 Amazon SageMaker AI 在 2026 年初至今推出的 13 项推理相关更新,涵盖全托管端点与 Amazon SageMaker HyperPod Inference 两大部署路径。重点功能包括推理配置推荐、容量感知实例池、分层 KV 缓存机制,以及预填充与解码解耦(disaggregated prefill and decode)等大模型推理优化技术,旨在提升云端 AI 部署效率并降低算力成本。