arXiv 机器学习· T. Y. Tsui, Zihao Ye, Pengxiang Cai, Yanchao Li, Yuqiang Li, Zhehong Ai·· 4 小时前AI 评分36
极小见证强化学习(MWRL)
Minimal Witness Reinforcement Learning
AI 导读
研究人员提出极小见证强化学习(MWRL),旨在解决传统强化学习在寻找充分条件与机制时仅能输出单解或冗余解的问题。MWRL 仅基于单一黑盒验证器反馈,推导出可恢复完整见证族的值迭代规划器以及可扩展至大语言模型的策略梯度方法。实验表明 MWRL 能恢复绝大多数极小见证,相关代码已开源。
来源:arXiv 机器学习 · arxiv.org