arXiv 人工智能· Hangzhan jin, Mohammad Hamdaqa, Doina Precup·· 5 小时前AI 评分37
ExPPO:保留探索能力的强化学习策略优化方法
Exploration-Preserving Policy Optimization
AI 导读
研究提出了 Exploration-Preserving Policy Optimization(ExPPO),通过响应惊奇度与提示词通过率重塑优势以重新分配信用。该方法在保留验证器极性的同时维持序列优势总量,可促进熵增并加速正确解发现。实验表明 ExPPO 提升了域内外推理覆盖率、总体准确率与正确响应的多样性,相关代码已开源。
来源:arXiv 人工智能 · arxiv.org