跳到正文
原文
arXiv 机器学习· Xinyu Wang, Sicheng Lyu, Xiao-Wen Chang·· 7 小时前AI 评分36

JARQ:面向大语言模型量化的联合交替精炼方法

JARQ: Joint Alternating Refinement for Quantization

AI 导读

JARQ 是一种面向大语言模型的分组量化即插即用精炼方法,无需反向传播即可通过交替优化尺度与编码提升量化精度。在 Llama-2、Llama-3 和 Qwen 搭配 RTN、GPTQ 等方案的测试中,JARQ 在 96 组对比中有 90 组降低了困惑度,并将 3-bit RTN 困惑度最高降低 36%。该方案在 7B 模型上每 block 优化耗时不足 1 分钟,且完全保持原位宽与推理成本。

来源:arXiv 机器学习 · arxiv.org