跳到正文
原文
arXiv 机器学习· Sourabh Kulkarni, Ksheeraj Sai Vepuri, Basar Demir, Jason Bohrer, Emily Shen, Jianfa Chen, Nan Jiang, Ankit Jain, Harihar Subramanyam, Mannat Singh, Chirag Nagpal·· 1 天前AI 评分36

MaD-RL:通过强化学习匹配分布以校准大语言模型

MaD-RL: Matching Distributions for Calibrating LLMs with Reinforcement Learning

AI 导读

研究人员提出基于强化学习的分布匹配框架 MaD-RL,可将大语言模型输出的潜在分类属性分布与指定目标分布进行匹配。针对 GRPO 等主流后训练方案因策略概率过度集中而削弱输出多样性的问题,该框架引入了支持 KL 散度和 Jensen-Shannon 散度等的新奖励函数,并在数学推理与编程实验中验证了其有效性。

来源:arXiv 机器学习 · arxiv.org