跳到正文
热点事件持续更新

研究团队提出Transformer新架构机制LayerRoPE

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月8日,arXiv刊载研究提出了LayerRoPE架构机制。该机制将Transformer隐藏状态随深度的增长转化为显式深度位置编码,通过单个共享向量和深度调节标量替代了传统的逐层归一化权重。实验表明,在超过100B tokens的训练中,LayerRoPE仅带来小于0.02%的FLOPs变化,并能够以减少3.4倍的计算量达到Pre-Norm 1.3B模型的损失水平。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv 机器学习
    LayerRoPE:动态深度幅度与角度叠加

    研究人员提出 LayerRoPE,将 Transformer 隐藏状态随深度增长转化为显式深度位置编码,用单个共享向量和深度调节标量替代逐层归一化权重。在 100B+ tokens 训练中,LayerRoPE 仅产生小于 0.02% 的 FLOPs 变化,并以减少 3.4x 的计算量达到 Pre-Norm 1.3B 的损失水平。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。