跳到正文
原文
Google Developers · AI 筛选·· 14 小时前精选AI 评分63

Google 基于 MaxText 与 TPU 完整复现 Olmo 3 7B 预训练流程

Reproducing Olmo 3 7B Pre-training in MaxText: case study of large scale training on TPUs

AI 导读

Google 团队使用基于 JAX 的 MaxText 框架与 Cloud TPU,从头完整复现了 Ai2 的 Olmo 3 7B 第一阶段约 5.9T token 预训练与第二阶段 mid-training 退火训练。

推荐理由

原文系统复盘了在 TPU 上复现 PyTorch 大模型预训练的工程细节与性能调优,读者可据此参考跨框架对齐与断点续训的验证方法。

来源:Google Developers · AI 筛选 · developers.googleblog.com