arXiv 自然语言处理· Beatriz Almeida Felicio·· 3 小时前AI 评分47
压缩大语言模型中散度如何转化为决策翻转
How Divergence Becomes Decision Flips in Compressed Language Models
AI 导读
研究表明全变差(Total Variation)相比 KL 散度能更直接预测压缩大语言模型的 token 决策翻转率,两者比值中位数达 1.05 且无需拟合常数。
来源:arXiv 自然语言处理 · arxiv.org