热点事件持续更新
研究探索Tiny Transformer算术推理与课程设计
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月8日,arXiv发布一项关于Tiny Transformer算术推理机制的研究。该研究在约10.6M非嵌入参数(总计49.3M)的模型上,利用算法草稿本与4阶段分级课程,将4,000题测试集的除法准确率从4.0%大幅提升至86.7%。实验表明,RoPE、RMSNorm、SwiGLU与MoE等技术能显著改善加法推理能力;但模型泛化能力仍有明显局限,在未见过的4位数运算上准确率降至0.00%,且在无缓冲训练时会出现灾难性遗忘。
AI 根据报道生成 · 3 小时前更新
最新进展10月8日 12:00
研究通过算法草稿本与分级课程将Tiny Transformer除法准确率提至86.7%,但外推仍存局限。报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv 机器学习Tiny Transformer 算术推理中的算法草稿本与分级课程设计
一项研究在约 10.6M 非嵌入参数(总计 49.3M)的 Tiny Transformer 上,通过算法草稿本与 4 阶段分级课程将 4,000 题测试集的除法准确率从 4.0% 提升至 86.7%。实验表明 RoPE、RMSNorm、SwiGLU 与 MoE 能显著改善加法推理,但模型在未见过的 4 位数运算上准确率跌至 0.00%,且无缓冲训练会导致灾难性遗忘。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。