热点事件观察中
大模型后训练框架ROSS发布:通过选择性监督利用自生成轨迹
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年9月30日,arXiv机器学习领域发布了关于ROSS框架的研究。该方法旨在有效重新利用大语言模型后训练阶段的自生成轨迹经验,其核心在于保留完整历史轨迹作为上下文,并仅对选定的模型生成片段施加loss。实验结果显示,在Qwen3.6-35B-A3B模型上应用ROSS后,六项基准MOPD平均分从58.40%提升至62.20%,SWE-bench Verified得分从64.20%提升至68.40%。
AI 根据报道生成 · 2 小时前更新
最新进展9月30日 12:00
ROSS框架发布,通过选择性监督自生成轨迹提升大模型后训练表现与基准得分。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv 机器学习ROSS:通过选择性监督重新学习大模型自生成轨迹
ROSS 方法通过保留完整历史轨迹作为上下文并仅对选定的模型生成片段施加 loss,有效重新利用了大语言模型后训练阶段的自生成轨迹经验。在 Qwen3.6-35B-A3B 上,ROSS 将六项基准 MOPD 平均分从 58.40% 提升至 62.20%,SWE-bench Verified 得分从 64.20% 提升至 68.40%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。