跳到正文
原文
arXiv 机器学习· Johnny Jingze Li, Abdulla Kuleib, Kalyan Basu, Gabriel A. Silva·· 1 天前AI 评分39

大语言模型在串行需求下如何差异化重新分配注意力头活跃度

How Language Models Differ in Redistributing Attention-Head Activity Under Serial Demand

AI 导读

一项针对 17 个开源权重模型的研究表明,随着任务串行步骤增加,多数大语言模型在近中间层集中注意力头活跃度、在后序层分散,但各模型机制差异明显。Qwen2.5 系列在模型后半段倾向集中活跃度,而 Llama 系列与 OLMo-2 则倾向分散。消融实验证实活跃度越集中的模型越依赖关键头得出答案,且后训练会保留该模式。

来源:arXiv 机器学习 · arxiv.org