AITNT · AI头条(网页)·· 3 小时前AI 评分59
杜克大学与亚马逊研究发现大模型后训练采用极端稀疏监督仍可显著提升推理能力
万分之一——大模型后训练中的极端稀疏监督
AI 导读
杜克大学与亚马逊的一项最新研究表明,在大模型后训练的在线策略蒸馏(OPD)中,即便每条生成轨迹仅保留 1 到 2 个 token 的梯度信号(低至 0.025%),模型的数学与代码推理性能依然能够匹配甚至超过全密集监督训练,且表现甚至超越教师模型本身。
来源:AITNT · AI头条(网页) · aitntnews.com