AIDC
← 返回全部动态
AWS 机器学习AI 评分 72/10009月25日 23:49

基于 Amazon SageMaker HyperPod 与 Qumulo 实现跨区域大模型训练

该方案结合 Amazon SageMaker HyperPod 与云原生存储 Qumulo,支持将模型训练算力集群与数据集部署在不同的 AWS 区域。测试验证结果显示,通过利用 NeuralCache 进行短暂预热后,跨地域远程计算集群的训练数据吞吐量能够达到与本地同地域集群相同的性能水平,有效解决了跨区域算力调度与数据访问的瓶颈。

推荐理由展示了解决跨区域算力与数据集分离痛点的高效大模型分布式训练架构与实测性能。

原标题:Multi-Region training with Amazon SageMaker HyperPod and Qumulo

阅读 AWS 机器学习 原文 ↗

同一事件的其他来源

AWS 机器学习09月26日 00:29

基于 Amazon EKS、EFA 与 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%

文章介绍了如何在 Amazon EKS 上利用 Elastic Fabric Adapter (EFA) 和 DeepEP 扩展混合专家模型(MoE)的强化学习训练。该方案构建了结合 Amazon EKS、EFA 与 Amazon S3 的技术架构,有效针对大规模 RLHF 与 GRPO 训练场景,将整体强化学习 rollout 阶段的吞吐量提升了 40%,优化了分布式集群的通信与计算效率。

AWS 机器学习09月26日 00:18

基于 Amazon SageMaker HyperPod 与 SkyRL 加速多模态强化学习训练

该实践指南介绍了如何在 Amazon SageMaker HyperPod 上运行开源强化学习框架 SkyRL,采用 GRPO 算法对 Qwen3-VL-8B 视觉语言大模型进行后训练。内容涵盖构建容器镜像、通过 SageMaker Studio 启动 Ray 分布式集群、提交与监控训练作业,以及最终部署和托管训练所得的 LoRA 适配器以进行推理。