跳到正文
原文
arXiv 机器学习· Matthieu Zimmer, Xiaotong Ji, Tu Nguyen, Haitham Bou-Ammar·· 3 小时前AI 评分36

基于最坏情况约束强化学习蒸馏 LLM 推理能力

The Weakest Link: Distilling LLM Reasoning with Worst-Case Constrained Reinforcement Learning

AI 导读

针对 LLM 推理蒸馏中纯强化学习容易引发奖励作弊、软散度惩罚掩盖局部逻辑错误的问题,新研究提出了基于最坏情况约束强化学习的推理蒸馏方法。该方法将任务奖励最大化建立在轨迹各前缀的教师对数似然最坏情况约束下,通过无状态增强约束 MDP 保持硬约束语义。在数学推理与代码生成任务中,该方法在保持高最终答案正确率的同时大幅降低违规,取得了最高的严谨推理成功率。

来源:arXiv 机器学习 · arxiv.org