Hugging Face·· 2026-08-25AI 评分46
Quantization-Aware Healing 让压缩 4-bit 模型性能超越全精度原版
Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
AI 导读
Quantization-Aware Healing(QAH)通过直接利用原始未压缩模型向结构压缩且量化至 MXFP4 的学生模型蒸馏来修复性能。在 GPT-OSS 120B 压缩至 60B 的测试中,所得 4-bit 模型在 9 项评测基准中有 7 项超越其自身的 bfloat16 全精度版本。该方案还借助分块 KL 散度损失,支持在固定显存下进行 32k tokens 长上下文修复。
来源:Hugging Face · huggingface.co