arXiv 机器学习· Junwei Quan, Evgenii Opryshko, Nicholas Rhinehart, Igor Gilitschenski·· 4 小时前AI 评分34
用于目标导向强化学习的世界模型策略仲裁器 WMPA
World-Model Policy Arbiter for Goal-Conditioned Reinforcement Learning
AI 导读
研究者提出测试期框架世界模型策略仲裁器(WMPA),利用学到的状态空间世界模型推演一组冻结策略,并通过共享目标条件价值函数评估并执行最优策略。该方法无需重新训练策略或引入任务特权知识。在 OGBench 的 18 个状态数据集评测中,WMPA 将宏平均成功率从单一最佳策略的 44% 提升至 58%,在 12 个数据集上取得显著增益。
来源:arXiv 机器学习 · arxiv.org