Hugging Face·· 2026-08-10AI 评分48
如何大幅降低大语言模型知识蒸馏成本以实现规模化运行
Making Knowledge Distillation Cheap Enough to Run at Scale
AI 导读
研究提出通过离线 Top-K logits 缓存与融合分块 KL 散度损失(Fused Chunked KL Loss),大幅降低大语言模型知识蒸馏成本。该方案无需常驻教师模型并避免物化全词表矩阵,将训练显存峰值从约 250GB 降至约 128GB,低于单张 H200 的 141GB 显存上限。这使长上下文修复能在单张 GPU 上完成,显著提升了大规模实验的可行性。
来源:Hugging Face · huggingface.co