arXiv 自然语言处理· Yuanhe Zhang, Xinyao Zhou, Haoran Gao, Yuyao Zhang, Zhenhong Zhou, Fanyu Meng, Li Sun, Sen Su·· 1 天前AI 评分37
基于残差流动态揭示与缓解大模型不受控重复机制
Uncovering Uncontrolled Repetition through Residual Stream Dynamics
AI 导读
研究人员提出逐 token 残差比较方法 TRC,通过分析生成过程中注意力与 MLP 向残差流的写入动态来定位并抑制失控重复。实验显示 TRC 可使循环重复率平均降低 57%,并揭示出重复语义在浅层萌生并沿残差流传播破坏正常表征。该方法成功泛化至视觉语言模型(LVLM)、LLM 及大推理模型(LRM),有效防御潜在的资源消耗攻击。
来源:arXiv 自然语言处理 · arxiv.org