arXiv 机器学习· Zhaojun Peng·· 11 小时前AI 评分30
MDP 稀疏策略部署中的 Bellman 认证舍入
Bellman-Certified Rounding for Sparse Policy Deployment in MDPs
AI 导读
研究针对有限 MDP 中连续策略向稀疏二值策略舍入时的回报保留问题,提出了通过 2d+2 次 Bellman 求解构建可复用包络线的认证舍入方法。该方法引入候选特定界限,将结构化测试集上的舍入前认证覆盖率从 48.2% 提升至 74.1%。在 γ=0.95 且存在状态耦合的实例中,局部曲率积分进一步将界限与损失比的中位数从 402.3 降至 2.08。
来源:arXiv 机器学习 · arxiv.org