热点事件持续更新
亚马逊与杜克大学提出大模型极端稀疏监督后训练方法
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月,杜克大学与亚马逊发布最新联合研究成果。该研究发现在大模型后训练的在线策略蒸馏(OPD)中,采用极端稀疏监督依然能够显著提升模型的推理能力。实验表明,即便每条生成轨迹仅保留1到2个token的梯度信号(稀疏程度低至0.025%),模型在数学与代码推理上的性能不仅能够匹配甚至超过全密集监督训练,其最终表现甚至超越了教师模型本身。
AI 根据报道生成 · 2 小时前更新
最新进展10月4日 22:19
联合研究表明后训练仅保留0.025%的梯度信号仍可显著提升推理性能。报道时间线
沿着报道,了解事件的不同侧面。
10月4日
- AITNT · AI头条杜克大学与亚马逊研究发现大模型后训练采用极端稀疏监督仍可显著提升推理能力
杜克大学与亚马逊的一项最新研究表明,在大模型后训练的在线策略蒸馏(OPD)中,即便每条生成轨迹仅保留 1 到 2 个 token 的梯度信号(低至 0.025%),模型的数学与代码推理性能依然能够匹配甚至超过全密集监督训练,且表现甚至超越教师模型本身。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。