arXiv 机器学习· Yifan Zhang·· 6 小时前AI 评分42
论 KL 正则化策略优化(KLPO)
On KL-Regularized Policy Optimization
AI 导读
针对大语言模型智能体异步强化学习中的策略更新偏差与高成本问题,研究者提出了 KL 正则化策略优化(KLPO)框架。该框架将 KL 正则化项锚定在采样器上,利用最小二乘法拟合对数比最优条件,无需重要性权重与 Critic,每个提示词仅需单次 rollout 即可计算更新梯度。研究证明 SPPO、GPO、REBEL 和 BPO 均为 KLPO 的特例。
来源:arXiv 机器学习 · arxiv.org