arXiv 机器学习· Enes Arda, Atilla Eryilmaz·· 7 小时前AI 评分31
平均奖励 MDP 下策略镜像下降算法的精确收敛性与样本复杂度分析
Sharp Convergence and Sample Complexity of Policy Mirror Descent for Average-Reward MDPs
AI 导读
针对遍历平均奖励马尔可夫决策过程(MDPs),该研究给出了策略镜像下降(PMD)算法在无需外部正则化下的有限时间与有限样本分析。在精确、非精确表格及线性函数近似(LFA)设置下,PMD 均实现了线性收敛速率。
来源:arXiv 机器学习 · arxiv.org