Cerebras 实测 Karpathy 的 autoresearch:如何防止 AI 自主研究闭环失控与偏离目标
Cerebras 针对 Karpathy 提出的 autoresearch 框架开展了 71 次实测,开源了 codex-autoresearch-harness 和 reap-expert-swap 工具,并总结了防止智能体自主实验偏离目标的工程实践。
推荐理由:原文通过两组真实任务实测了自主研究智能体的边界,给出了约束环境漂移和控制算力开销的具体方案。
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
Cerebras 针对 Karpathy 提出的 autoresearch 框架开展了 71 次实测,开源了 codex-autoresearch-harness 和 reap-expert-swap 工具,并总结了防止智能体自主实验偏离目标的工程实践。
推荐理由:原文通过两组真实任务实测了自主研究智能体的边界,给出了约束环境漂移和控制算力开销的具体方案。
vLLM 推出原生 RL API,提供标准化的权重同步接口并增强对大规模异步强化学习推理服务的支持。
推荐理由:文章系统介绍了该接口的分层设计与两阶段暂停协议,为大规模强化学习训练与推理协同提供了标准化的工程参考方案。
vLLM 社区正式发布开源大语言模型强化学习后训练框架 vime,将 slime 的训练架构与 vLLM 的推理引擎连接至统一的 Megatron 强化学习流水线。
推荐理由:框架将成熟训练栈与 vLLM 推理引擎打通,读者可借此了解如何在统一硬件与解耦架构下保障强化学习训推一致性。
vLLM 团队宣布强化学习框架 vime 正式支持 AMD ROCm 生态,可在 AMD Instinct MI355X 等 GPU 上开箱即用运行端到端强化学习后训练。
推荐理由:官方提供了预构建容器与端到端实测数据,开发者可直接在 AMD 硬件上复用 vLLM 的强化学习后训练工作流。
VeRL-Omni 正式发布 v0.2.0 版本,重点提升扩散模型与全模态强化学习的训练吞吐与系统稳定性。
推荐理由:该版本通过请求级批处理和标准化适配器,解决了扩散模型与全模态大模型强化学习中高延迟和架构耦合的问题。
vLLM 团队通过 Speculators 训练库与 Mooncake 传输引擎,在 Verda 提供的 GB300 NVL72 机架上完成了 2.8T 参数 Kimi K3 模型的 DSpark 投机草稿模型训练与部署。
推荐理由:原文给出了基于 Mooncake 跨节点传输隐藏状态训练超大模型投机草稿模型的完整拓扑,读者可直接参考其多机训练与部署配置。
Google 推出开源项目 autofinetune,利用 Gemini Flash 3.7、Tunix 与 Cloud TPU 驱动 AI 智能体自主闭环完成大语言模型的监督微调(SFT)与 GRPO 强化学习后训练。
推荐理由:展示了如何通过规范配置让智能体在硬件集群上自主调优并验证变更,为模型后训练提供了可复用的自动化实践路径。
Google 团队使用基于 JAX 的 MaxText 框架与 Cloud TPU,从头完整复现了 Ai2 的 Olmo 3 7B 第一阶段约 5.9T token 预训练与第二阶段 mid-training 退火训练。
推荐理由:原文系统复盘了在 TPU 上复现 PyTorch 大模型预训练的工程细节与性能调优,读者可据此参考跨框架对齐与断点续训的验证方法。
NVIDIA 正式开源表格基础模型 Kumo Tabular,支持在无需训练、微调或特征工程的前提下,通过单次前向传播直接完成表格数据的分类与回归预测。该模型包含 28M 到 215M 三种参数规模,完全基于结构因果模型生成的合成数据完成预训练,并在 TabArena、BeyondArena、TALENT 与 ScoringBench 四项基准测试中均位居榜首。
推荐理由:模型展示了完全依赖因果合成数据预训练表格大模型的可行路径,读者可以借此了解免微调与零特征工程在表格预测任务中的落地机制。
Hugging Face 在 TRL v1.14 中为 AsyncGRPOTrainer 增加了 LoRA 适配器同步支持,使训练节点与 vLLM 推理副本无需跨机 NCCL 即可跨节点独立运行。
推荐理由:原文展示了无需 NCCL 跨机通信的异步 GRPO 架构实现与调优细节,读者可据此排查强化学习训练与推理流水线的吞吐瓶颈。
Hugging Face 发布实践指南,展示在免费 GPU 上使用 TRL 库对 LFM2.5-350M 模型进行 100 步 GRPO 微调,将其在 IFStruct 基准上的得分从 22.6% 提升至 29.7%。
推荐理由:教程展示了仅用百步轻量强化学习提升端侧模型格式遵循的可行路径,为低成本专用小模型调优提供了落地参考。
AWS 正在日本与美国华盛顿州之间铺设名为 Sta’O’Nuk 的跨太平洋海底光缆,设计容量达 420 Tbps 并采用 20 对光纤,计划于 2029 年投入使用。
推荐理由:AWS通过新建海缆直连核心算力枢纽,反映出云厂商为满足分布式大模型训练正将基建拓展至跨国骨干网络。
Sentence Transformers 推出 ColBERT 风格晚期交互的多向量嵌入模型(MultiVectorEncoder)训练与微调方案,支持直接定制垂直领域检索模型。
推荐理由:原文给出了晚期交互多向量模型的完整微调路径与消融实测,读者可以据此在单卡消费级算力下低成本定制高精度领域检索器。
AWS 团队分享了在韩国国家 AI 研究项目中为多所科研机构提供 30 台 p5en.48xlarge 实例(240 张 H200 GPU)的管理实战经验。文章详细拆解了 AWS ParallelCluster 的 cluster-config.yaml 配置要点,包括 EFA 网络开启、基于内存的调度以及容量预留锁定。
推荐理由:原文给出了多团队共享 GPU 集群时的 ParallelCluster 与 Slurm QoS 详细配置,工程团队可直接借鉴多租户调度与防资源垄断策略。
MIT CSAIL 研究团队在《Nature Communications》发表论文,发现生成式模型存在“归因衰减”现象,在大规模数据训练下生成的图像往往无法溯源至任何单一训练样本。
推荐理由:原文通过反事实消融实验揭示了归因衰减现象,为探讨大规模训练数据与生成内容侵权判定提供了可验证的技术依据。
Sebastian Raschka 撰文详解大语言模型中推理努力程度(Reasoning Effort)与思考开关的训练与推理机制。模型通常通过系统提示词结合特定长度惩罚的 RLVR、混合思考样本的 SFT 或不同预算专家蒸馏来实现多档推理控制。
推荐理由:文章横向拆解了前沿模型控制推理预算的后训练方案与推理开关,为开发者理解和设计灵活的推理计算机制提供了清晰参考。
Photoroom 详细公开了 7B 文生图模型 PRX 的预训练数据流水线,通过 Lance 进行海量样本检索与管理,并使用 Qwen3-VL-8B 为图片重新生成详细的长段落描述。
推荐理由:文章系统复盘了文生图模型预训练的数据工程全流程,为处理大规模图文重打标与流式存储提供了可落地的实操参考。
Google DeepMind 提出全新分布式训练架构 Decoupled DiLoCo,通过异步数据流将大规模训练解耦到独立的算力单元中,实现跨全球数据中心的高容错与低通信开销训练。
推荐理由:原文给出了跨数据中心训练的异步解耦方案和实测数据,读者可以了解如何在低广域网带宽与异构硬件条件下维持高效预训练。
Google 宣布在 Flood Hub 中推出城市暴洪(Urban Flash Flood)预测功能,利用 AI 技术可提前至多 24 小时预测城市暴洪风险。
推荐理由:Google 利用大模型从公开新闻中提取历史灾害真值,解决了物理传感器不足区域的暴洪预测难题。
Google 推出 Groundsource 框架,利用 Gemini 将多语言新闻报道转化为结构化的自然灾害历史数据,并公开发布包含 150 多个国家、260 万条记录的城市突发洪水数据集。
推荐理由:该成果展示了利用大语言模型从全球多语言新闻中批量提取高精度时空历史数据的工程化路径。