热点事件观察中
研究揭示开源大模型串行任务下的注意力头活跃度分配机制
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年9月30日,一项针对17个开源权重模型的研究揭示了大语言模型在多步串行任务下的注意力分配机制差异。研究表明,随着任务串行步骤增加,多数大语言模型在近中间层集中注意力头活跃度,并在后序层分散,但不同模型机制差异明显。其中,Qwen2.5系列在模型后半段倾向于集中活跃度,而Llama系列与OLMo-2则倾向于分散。消融实验进一步证实,活跃度越集中的模型越依赖关键头得出答案,且后训练会保留该模式。
AI 根据报道生成 · 2 小时前更新
最新进展9月30日 12:00
研究显示多数开源大模型在串行任务中注意力头分布各异,且后训练会保留该特征。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv 机器学习大语言模型在串行需求下如何差异化重新分配注意力头活跃度
一项针对 17 个开源权重模型的研究表明,随着任务串行步骤增加,多数大语言模型在近中间层集中注意力头活跃度、在后序层分散,但各模型机制差异明显。Qwen2.5 系列在模型后半段倾向集中活跃度,而 Llama 系列与 OLMo-2 则倾向分散。消融实验证实活跃度越集中的模型越依赖关键头得出答案,且后训练会保留该模式。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。