arXiv 机器学习· Robert Hu·· 5 小时前AI 评分42
面向快速 FP4 预训练的格式感知融合技术
Format-Aware Fusion for Fast FP4 Pretraining
AI 导读
研究人员提出格式感知融合(format-aware fusion)技术,通过协同设计量化与布局加速 FP4 模型预训练。在 Llama-3 家族 8B 模型的 160B tokens 预训练评测中,该方案最快达到 37.9K tokens/s/GPU,远超 bfloat16 的 18.8K tokens/s/GPU。
来源:arXiv 机器学习 · arxiv.org