arXiv 自然语言处理· Wang Bojun, Holly Jenkins, Elizabeth Wonnacott·· 2 天前AI 评分34
神经网络语言模型学习轨迹中的泛化与记忆:范畴化的几何解释
Generalization and Memorization along the Learning Trajectory of Neural Language Models: A Geometric Account of Categorization
AI 导读
神经网络语言模型在学习初期便通过表征空间的范畴级几何结构形成了泛化能力,而非在大量记忆后才产生。随着训练持续进行,较大模型开始区分已观测与未观测的语法组合,支持泛化的连续几何结构也逐步被打破。这表明神经网络语言模型的学习路径呈现出先建立基于范畴化的泛化、随后转向特定样本记忆的演变过程。
来源:arXiv 自然语言处理 · arxiv.org