arXiv 机器学习· Shripad V. Deshmukh, Yaswanth Chittepu, Dhawal Gupta, Philip Thomas, Scott Niekum·· 6 小时前AI 评分40
凸-凹强化学习(CCRL)
Convex-Concave Reinforcement Learning
AI 导读
研究者提出凸-凹强化学习(CCRL),将策略学习每轮迭代的精确目标建模为带差凸约束的差凸规划(DC-constrained DC),把 CPI、NPG、TRPO 和 AWR 纳入统一框架。该方法采用序列凸规划(SCP)求解并提供收敛保证,支持多步决策耦合。实验显示,CCRL 在医疗场景中比调优后的 PPO 更快收敛至近最优生存率,训练曲线下面积提升 11.3%。
来源:arXiv 机器学习 · arxiv.org