arXiv 人工智能· Matthew Finlayson, Francisco Pernice, Eric Todd, Amir Zur, Daniel Wurgaft, Fenil R. Doshi, Vasudev Shyam, Matt Feiszli, Satchel Grant, Lucius Bushnaq, Tal Haklay, Usha Bhalla, Matthew Kowal, Thomas Fel, Jack Merullo, Atticus Geiger, Xiang Ren, Owen Lewis, Ekdeep Singh Lubana·· 7 小时前AI 评分41
大语言模型激活值处于特权纠错吸引盆中
Language Model Activations Inhabit Privileged Error-Correcting Basins
AI 导读
研究发现大语言模型的激活值分布于一组离散的吸引盆中,该前向传播约束机制使模型在激活值受扰动时仍能自动纠错并保持连贯输出。语义引导操作本质上是在这些特征专属的吸引盆之间转移激活值。实验表明,通过自适应调节引导强度实现跨盆地传输,相比固定强度引导能显著提高跨语言引导中目标语言 token 的采样概率。
来源:arXiv 人工智能 · arxiv.org