跳到正文
原文
arXiv 机器学习· Amirparsa Bahrami, Oliver Mortensen, Mohammad Sadegh Talebi·· 2 小时前AI 评分26

生成模型下递归熵风险强化学习的近最优样本复杂度

Near-Optimal Sample Complexity for Recursive Entropic Risk Reinforcement Learning with a Generative Model

AI 导读

针对生成模型下的递归熵风险强化学习,研究人员通过对 MB-RS-QVI 算法的精细分析,给出了学习最优 Q 值函数与 $\varepsilon$-最优策略的 $(\varepsilon,\delta)$-PAC 样本复杂度保证。

来源:arXiv 机器学习 · arxiv.org