arXiv 人工智能· Jinha Kim, Taksh Kothari·· 2 天前AI 评分39
面向测试期语言模型的延迟监督机制研究
Delayed Supervision for Test-Time Language Models
AI 导读
研究人员提出面向测试期语言模型的延迟监督后训练方法,在长间隔无关事件后通过一次性分支提问并监督答案,以此强化记忆的保留与修正能力。实验表明,该方法使 LaCT-760M 和 DeltaNet-1.3B 的 BABILong 分别提升 5.48 与 1.32 个百分点,单针 RULER 提升 1.45 与 3.27 个百分点,并在 RWKV-7 对比中取得最高 7.00 个百分点增益。
来源:arXiv 人工智能 · arxiv.org