arXiv 机器学习· Arian Raje, Anupam Nayak, Anthony Fei, Akaash Parthasarathy, Mohamed Abdelfattah, Gauri Joshi·· 1 天前AI 评分43
在策略注意力线性化(OPAL)研究
On-Policy Attention Linearization
AI 导读
研究团队提出在策略注意力线性化方法(OPAL),通过让混合注意力学生模型采样长上下文轨迹并接受冻结的全注意力教师模型密集监督,解决蒸馏模型在长序列中的状态漂移与性能崩溃问题。
来源:arXiv 机器学习 · arxiv.org