arXiv 机器学习· Amirparsa Bahrami, Oliver Mortensen, Mohammad Sadegh Talebi·· 2 小时前AI 评分26
生成模型下递归熵风险强化学习的近最优样本复杂度
Near-Optimal Sample Complexity for Recursive Entropic Risk Reinforcement Learning with a Generative Model
AI 导读
针对生成模型下的递归熵风险强化学习,研究人员通过对 MB-RS-QVI 算法的精细分析,给出了学习最优 Q 值函数与 $\varepsilon$-最优策略的 $(\varepsilon,\delta)$-PAC 样本复杂度保证。
来源:arXiv 机器学习 · arxiv.org