热点事件观察中
研究团队提出分布校准强化学习框架MaD-RL
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年9月29日,研究人员在arXiv发表论文,提出基于强化学习的分布匹配框架MaD-RL。该框架旨在将大语言模型输出的潜在分类属性分布与指定目标分布进行匹配。针对GRPO等主流后训练方案因策略概率过度集中而削弱输出多样性的问题,MaD-RL引入了支持KL散度和Jensen-Shannon散度等的新奖励函数。相关方法已在数学推理与编程实验中验证了有效性。
AI 根据报道生成 · 5 小时前更新
最新进展9月29日 12:00
研究人员提出强化学习框架MaD-RL,通过匹配目标分布提升模型输出多样性。报道时间线
沿着报道,了解事件的不同侧面。
9月29日
- arXiv 机器学习MaD-RL:通过强化学习匹配分布以校准大语言模型
研究人员提出基于强化学习的分布匹配框架 MaD-RL,可将大语言模型输出的潜在分类属性分布与指定目标分布进行匹配。针对 GRPO 等主流后训练方案因策略概率过度集中而削弱输出多样性的问题,该框架引入了支持 KL 散度和 Jensen-Shannon 散度等的新奖励函数,并在数学推理与编程实验中验证了其有效性。
本事件热度走势
当前热度 5·可比范围峰值 5(9月30日 12:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。