跳到正文
原文
Hacker News · AI· KanishkIndia·· 3 小时前AI 评分33

Spectra:将大语言模型训练显存降低 50% 的即插即用优化器

Show HN: Spectra – A drop-in optimizer that cuts LLM training VRAM by 50%

AI 导读

Spectra Labs 推出混合优化器 SpectraAdamW,作为 PyTorch 中 AdamW 的即插即用替代方案,可将大语言模型训练的优化器状态显存开销降低 50% 并保持全精度收敛特性。该技术通过分解方差近似与基于 FFT 的频域动量压缩实现,微调 8B 模型时优化器显存可由约 32GB 降至约 16GB。目前 Python POC 已开放验证,C++ CUDA 后端处于闭测阶段。

来源:Hacker News · AI · github.com