Google DeepMind 发布 Decoupled DiLoCo:跨远距离数据中心的弹性分布式 AI 训练架构
Google DeepMind 提出全新分布式训练架构 Decoupled DiLoCo,通过异步数据流将大规模训练解耦到独立的算力单元中,实现跨全球数据中心的高容错与低通信开销训练。
推荐理由:原文给出了跨数据中心训练的异步解耦方案和实测数据,读者可以了解如何在低广域网带宽与异构硬件条件下维持高效预训练。
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
Google DeepMind 提出全新分布式训练架构 Decoupled DiLoCo,通过异步数据流将大规模训练解耦到独立的算力单元中,实现跨全球数据中心的高容错与低通信开销训练。
推荐理由:原文给出了跨数据中心训练的异步解耦方案和实测数据,读者可以了解如何在低广域网带宽与异构硬件条件下维持高效预训练。
Google 宣布在 Flood Hub 中推出城市暴洪(Urban Flash Flood)预测功能,利用 AI 技术可提前至多 24 小时预测城市暴洪风险。
推荐理由:Google 利用大模型从公开新闻中提取历史灾害真值,解决了物理传感器不足区域的暴洪预测难题。
Google 推出 Groundsource 框架,利用 Gemini 将多语言新闻报道转化为结构化的自然灾害历史数据,并公开发布包含 150 多个国家、260 万条记录的城市突发洪水数据集。
推荐理由:该成果展示了利用大语言模型从全球多语言新闻中批量提取高精度时空历史数据的工程化路径。
Sebastian Raschka 深入剖析了 DeepSeek 从 V3 到 V3.2 的技术演进,涵盖模型架构、稀疏注意力机制与强化学习优化。DeepSeek V3.2 引入了由 Lightning Indexer 驱动的 DeepSeek 稀疏注意力机制(DSA),将注意力计算复杂度从二次方降低至线性 O(Lk)。
推荐理由:梳理了稀疏注意力 DSA 与 GRPO 算法调优的技术演进脉络,有助于理解开源大模型在长上下文效率与强化学习稳定性上的工程实现细节。
SemiAnalysis 发布分析指出,AWS 正为其核心客户 Anthropic 建设超过 1.3GW 的数据中心 IT 负载容量并大规模部署自研 Trainium2 芯片,有望推动 AWS 增速重回 20% 以上。
推荐理由:文章从总体拥有成本与内存带宽维度拆解了 Anthropic 采购 Trainium2 的考量,展现出软硬件协同设计对大模型训练成本的深远影响。
SemiAnalysis 发布 H100 与 GB200 NVL72 的训练基准与 TCO 测算,指出 GB200 NVL72 的每 GPU 综合 TCO 约是 H100 的 1.6 倍,实际训练性能需至少提升 1.6 倍才具备成本优势。
推荐理由:报告通过实际集群实测对比了芯片全周期 TCO,量化了新架构在可靠性不足与软件未成熟时的真实成本门槛。