跳到正文
热点事件持续更新

研究探索Tiny Transformer算术推理与课程设计

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月8日,arXiv发布一项关于Tiny Transformer算术推理机制的研究。该研究在约10.6M非嵌入参数(总计49.3M)的模型上,利用算法草稿本与4阶段分级课程,将4,000题测试集的除法准确率从4.0%大幅提升至86.7%。实验表明,RoPE、RMSNorm、SwiGLU与MoE等技术能显著改善加法推理能力;但模型泛化能力仍有明显局限,在未见过的4位数运算上准确率降至0.00%,且在无缓冲训练时会出现灾难性遗忘。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv 机器学习
    Tiny Transformer 算术推理中的算法草稿本与分级课程设计

    一项研究在约 10.6M 非嵌入参数(总计 49.3M)的 Tiny Transformer 上,通过算法草稿本与 4 阶段分级课程将 4,000 题测试集的除法准确率从 4.0% 提升至 86.7%。实验表明 RoPE、RMSNorm、SwiGLU 与 MoE 能显著改善加法推理,但模型在未见过的 4 位数运算上准确率跌至 0.00%,且无缓冲训练会导致灾难性遗忘。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。