跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 1–20 条 · 共 23 条
9月30日周三
  1. Cerebras 官方博客(网页)77

    Cerebras 实测 Karpathy 的 autoresearch:如何防止 AI 自主研究闭环失控与偏离目标

    Cerebras 针对 Karpathy 提出的 autoresearch 框架开展了 71 次实测,开源了 codex-autoresearch-harness 和 reap-expert-swap 工具,并总结了防止智能体自主实验偏离目标的工程实践。

    推荐理由:原文通过两组真实任务实测了自主研究智能体的边界,给出了约束环境漂移和控制算力开销的具体方案。

  2. vLLM 官方博客(网页)64

    vLLM 强化学习框架 vime 适配 ROCm,支持在 AMD Instinct GPU 上端到端后训练

    vLLM 团队宣布强化学习框架 vime 正式支持 AMD ROCm 生态,可在 AMD Instinct MI355X 等 GPU 上开箱即用运行端到端强化学习后训练。

    推荐理由:官方提供了预构建容器与端到端实测数据,开发者可直接在 AMD 硬件上复用 vLLM 的强化学习后训练工作流。

  3. vLLM 官方博客(网页)69

    vLLM 团队基于 GB300 NVL72 与 Mooncake 训练 Kimi K3 的 DSpark 投机草稿模型

    vLLM 团队通过 Speculators 训练库与 Mooncake 传输引擎,在 Verda 提供的 GB300 NVL72 机架上完成了 2.8T 参数 Kimi K3 模型的 DSpark 投机草稿模型训练与部署。

    推荐理由:原文给出了基于 Mooncake 跨节点传输隐藏状态训练超大模型投机草稿模型的完整拓扑,读者可直接参考其多机训练与部署配置。

  4. Google Developers · AI 筛选67

    Google 推出 autofinetune:在 TPU 上基于 Tunix 实现 LLM 自主后训练

    Google 推出开源项目 autofinetune,利用 Gemini Flash 3.7、Tunix 与 Cloud TPU 驱动 AI 智能体自主闭环完成大语言模型的监督微调(SFT)与 GRPO 强化学习后训练。

    推荐理由:展示了如何通过规范配置让智能体在硬件集群上自主调优并验证变更,为模型后训练提供了可复用的自动化实践路径。

  5. Google Developers · AI 筛选63

    Google 基于 MaxText 与 TPU 完整复现 Olmo 3 7B 预训练流程

    Google 团队使用基于 JAX 的 MaxText 框架与 Cloud TPU,从头完整复现了 Ai2 的 Olmo 3 7B 第一阶段约 5.9T token 预训练与第二阶段 mid-training 退火训练。

    推荐理由:原文系统复盘了在 TPU 上复现 PyTorch 大模型预训练的工程细节与性能调优,读者可据此参考跨框架对齐与断点续训的验证方法。

9月29日周二
  1. Hugging Face76

    NVIDIA 开源表格基础模型 Kumo Tabular

    NVIDIA 正式开源表格基础模型 Kumo Tabular,支持在无需训练、微调或特征工程的前提下,通过单次前向传播直接完成表格数据的分类与回归预测。该模型包含 28M 到 215M 三种参数规模,完全基于结构因果模型生成的合成数据完成预训练,并在 TabArena、BeyondArena、TALENT 与 ScoringBench 四项基准测试中均位居榜首。

    推荐理由:模型展示了完全依赖因果合成数据预训练表格大模型的可行路径,读者可以借此了解免微调与零特征工程在表格预测任务中的落地机制。

9月10日周四
  1. Hugging Face70

    Hugging Face 展示基于 Storage Bucket 与代理的跨节点 LoRA 异步 GRPO 训练实践

    Hugging Face 在 TRL v1.14 中为 AsyncGRPOTrainer 增加了 LoRA 适配器同步支持,使训练节点与 vLLM 推理副本无需跨机 NCCL 即可跨节点独立运行。

    推荐理由:原文展示了无需 NCCL 跨机通信的异步 GRPO 架构实现与调优细节,读者可据此排查强化学习训练与推理流水线的吞吐瓶颈。

9月3日周四
  1. Hugging Face66

    利用 TRL 进行 100 步 GRPO 微调提升 350M 模型结构化输出能力

    Hugging Face 发布实践指南,展示在免费 GPU 上使用 TRL 库对 LFM2.5-350M 模型进行 100 步 GRPO 微调,将其在 IFStruct 基准上的得分从 22.6% 提升至 29.7%。

    推荐理由:教程展示了仅用百步轻量强化学习提升端侧模型格式遵循的可行路径,为低成本专用小模型调优提供了落地参考。

8月26日周三
  1. AWS HPC63

    基于 AWS ParallelCluster 管理大规模大语言模型训练环境实战

    AWS 团队分享了在韩国国家 AI 研究项目中为多所科研机构提供 30 台 p5en.48xlarge 实例(240 张 H200 GPU)的管理实战经验。文章详细拆解了 AWS ParallelCluster 的 cluster-config.yaml 配置要点,包括 EFA 网络开启、基于内存的调度以及容量预留锁定。

    推荐理由:原文给出了多团队共享 GPU 集群时的 ParallelCluster 与 Slurm QoS 详细配置,工程团队可直接借鉴多租户调度与防资源垄断策略。

8月19日周三
  1. MIT News · AI70

    MIT CSAIL 研究发现大模型生成图像常无法溯源至训练数据,版权归属面临归因衰减

    MIT CSAIL 研究团队在《Nature Communications》发表论文,发现生成式模型存在“归因衰减”现象,在大规模数据训练下生成的图像往往无法溯源至任何单一训练样本。

    推荐理由:原文通过反事实消融实验揭示了归因衰减现象,为探讨大规模训练数据与生成内容侵权判定提供了可验证的技术依据。

7月18日周六
  1. Sebastian Raschka69

    大语言模型如何控制推理算力预算与思考模式

    Sebastian Raschka 撰文详解大语言模型中推理努力程度(Reasoning Effort)与思考开关的训练与推理机制。模型通常通过系统提示词结合特定长度惩罚的 RLVR、混合思考样本的 SFT 或不同预算专家蒸馏来实现多档推理控制。

    推荐理由:文章横向拆解了前沿模型控制推理预算的后训练方案与推理开关,为开发者理解和设计灵活的推理计算机制提供了清晰参考。

7月6日周一
  1. Hugging Face63

    Photoroom 详解文生图模型 PRX 数据工程策略:从 VLM 重打标到流式训练

    Photoroom 详细公开了 7B 文生图模型 PRX 的预训练数据流水线,通过 Lance 进行海量样本检索与管理,并使用 Qwen3-VL-8B 为图片重新生成详细的长段落描述。

    推荐理由:文章系统复盘了文生图模型预训练的数据工程全流程,为处理大规模图文重打标与流式存储提供了可落地的实操参考。

4月22日周三
  1. Google DeepMind75

    Google DeepMind 发布 Decoupled DiLoCo:跨远距离数据中心的弹性分布式 AI 训练架构

    Google DeepMind 提出全新分布式训练架构 Decoupled DiLoCo,通过异步数据流将大规模训练解耦到独立的算力单元中,实现跨全球数据中心的高容错与低通信开销训练。

    推荐理由:原文给出了跨数据中心训练的异步解耦方案和实测数据,读者可以了解如何在低广域网带宽与异构硬件条件下维持高效预训练。

3月12日周四
  1. Google Research61

    Google 推出 Groundsource 框架并开源 260 万条全球突发洪水数据集

    Google 推出 Groundsource 框架,利用 Gemini 将多语言新闻报道转化为结构化的自然灾害历史数据,并公开发布包含 150 多个国家、260 万条记录的城市突发洪水数据集。

    推荐理由:该成果展示了利用大语言模型从全球多语言新闻中批量提取高精度时空历史数据的工程化路径。