跳到正文
原文
arXiv 机器学习· Robert Hu·· 5 小时前AI 评分42

面向快速 FP4 预训练的格式感知融合技术

Format-Aware Fusion for Fast FP4 Pretraining

AI 导读

研究人员提出格式感知融合(format-aware fusion)技术,通过协同设计量化与布局加速 FP4 模型预训练。在 Llama-3 家族 8B 模型的 160B tokens 预训练评测中,该方案最快达到 37.9K tokens/s/GPU,远超 bfloat16 的 18.8K tokens/s/GPU。

来源:arXiv 机器学习 · arxiv.org