arXiv 人工智能· Miaobo Hu, Shuhao Hu, Xiaobo Guo, Xin Wang, Bokun Wang, Daren Zha, Jun Xiao·· 3 小时前AI 评分34
FSPO:面向预算受限大语言模型强化学习后训练的策略一致风险与帕累托可行控制
FSPO: Policy-Consistent Risk and Pareto-Feasible Control for Budgeted LLM RL Post-Training
AI 导读
研究人员提出用于预算受限大语言模型强化学习后训练的反馈状态控制器 FSPO。在匹配的 GRPO 资源包络下,FSPO 取得 66.11% 保留集和 59.43% OOD 准确率,超越最强自适应基线 PB2(64.47% 与 57.03%)。通过结合策略一致风险模型、DCTC 校准及 PRCC 证书,该方法将轨迹失败率从 0.181 降至 0.083。
来源:arXiv 人工智能 · arxiv.org