跳到正文
原文
arXiv 机器学习· Ahmad S. Tarawneh·· 2 天前AI 评分36

已训练神经网络精度下限的深度法则:放大效应、残差缩放与感知量化训练悖论

Depth Laws for the Precision Floor of Trained Neural Networks: Amplification, Residual Scaling, and a Quantization-Aware Training Paradox

AI 导读

研究提出了已训练神经网络精度下限的深度法则,并在 12 至 48 层的 GPT-2 等模型中证实预测放大效应决定了量化崩溃阈值。采用 $1/\sqrt{D}$ 残差分支缩放与 Pre-norm 可消除深度惩罚,使临界位宽对深度呈对数增长。研究还发现了 QAT 悖论:噪声感知训练虽让浅层网络耐受噪声翻倍,但增益随深度衰减,导致深度指数比值达 1.45-1.47。

来源:arXiv 机器学习 · arxiv.org