跳到正文
原文
arXiv 机器学习· Chiwun Yang, Xiaoyu Li·· 5 小时前AI 评分44

预训练与中训练能让模型从奖励中学会什么?

What Pretraining and Midtraining Make Learnable from Rewards?

AI 导读

一项新研究揭示了预训练与中训练(midtraining)如何提供必要的信息与计算基础,从而使模型能够有效完成基于奖励的自适应学习。基于 Qwen2.5 预训练检查点的实验显示,具备正确源监督的序列模型在 8 个测试环境中取得 82.61% 的成功率(对照组为 44.15%),引入记忆回放后任务成功率达到 75.32%。

来源:arXiv 机器学习 · arxiv.org