跳到正文
原文
arXiv 人工智能· Aayush Mishra, Arnau Padr\'es Masdemont, Victor Conchello Vendrell, Jordi Ros Giralt, Arash Behboodi, Fabio Valerio Massoli·· 6 小时前AI 评分39

在 Looped LM 中实现动态计算

Enabling Dynamic Computation in Looped LMs

AI 导读

研究人员针对循环大语言模型(Looped LM)提出一种开箱即用的最优可用 KV cache 策略,解决了 Ouro 模型因缓存依赖与均匀先验而无法在实际中动态计算的局限。该方法同时优化了早期退出机制,使 token 能根据计算难度在不同深度异构退出,在保持全深度性能的同时实现最高 30% 的 FLOPs 和 KV 内存削减。

来源:arXiv 人工智能 · arxiv.org