跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 21–26 条 · 共 26 条
4月22日周三
  1. Google DeepMind75

    Google DeepMind 发布 Decoupled DiLoCo:跨远距离数据中心的弹性分布式 AI 训练架构

    Google DeepMind 提出全新分布式训练架构 Decoupled DiLoCo,通过异步数据流将大规模训练解耦到独立的算力单元中,实现跨全球数据中心的高容错与低通信开销训练。

    推荐理由:原文给出了跨数据中心训练的异步解耦方案和实测数据,读者可以了解如何在低广域网带宽与异构硬件条件下维持高效预训练。

3月12日周四
  1. Google Research61

    Google 推出 Groundsource 框架并开源 260 万条全球突发洪水数据集

    Google 推出 Groundsource 框架,利用 Gemini 将多语言新闻报道转化为结构化的自然灾害历史数据,并公开发布包含 150 多个国家、260 万条记录的城市突发洪水数据集。

    推荐理由:该成果展示了利用大语言模型从全球多语言新闻中批量提取高精度时空历史数据的工程化路径。

12月3日周三
  1. Sebastian Raschka75

    从 DeepSeek V3 到 V3.2:架构、稀疏注意力与强化学习演进解析

    Sebastian Raschka 深入剖析了 DeepSeek 从 V3 到 V3.2 的技术演进,涵盖模型架构、稀疏注意力机制与强化学习优化。DeepSeek V3.2 引入了由 Lightning Indexer 驱动的 DeepSeek 稀疏注意力机制(DSA),将注意力计算复杂度从二次方降低至线性 O(Lk)。

    推荐理由:梳理了稀疏注意力 DSA 与 GRPO 算法调优的技术演进脉络,有助于理解开源大模型在长上下文效率与强化学习稳定性上的工程实现细节。

9月4日周四
  1. SemiAnalysis · 算力产业76

    SemiAnalysis 解析亚马逊 AWS 与 Anthropic 的吉瓦级 Trainium 算力扩张

    SemiAnalysis 发布分析指出,AWS 正为其核心客户 Anthropic 建设超过 1.3GW 的数据中心 IT 负载容量并大规模部署自研 Trainium2 芯片,有望推动 AWS 增速重回 20% 以上。

    推荐理由:文章从总体拥有成本与内存带宽维度拆解了 Anthropic 采购 Trainium2 的考量,展现出软硬件协同设计对大模型训练成本的深远影响。

8月20日周三
  1. SemiAnalysis · 算力产业77

    SemiAnalysis 发布 H100 与 GB200 NVL72 训练基准评测:功耗、TCO 与可靠性分析

    SemiAnalysis 发布 H100 与 GB200 NVL72 的训练基准与 TCO 测算,指出 GB200 NVL72 的每 GPU 综合 TCO 约是 H100 的 1.6 倍,实际训练性能需至少提升 1.6 倍才具备成本优势。

    推荐理由:报告通过实际集群实测对比了芯片全周期 TCO,量化了新架构在可靠性不足与软件未成熟时的真实成本门槛。