arXiv 机器学习· Tianwei Ni, Vineet Jain, Akash Karthikeyan, Pierre-Luc Bacon·· 1 天前AI 评分33
离线强化学习:从静态策略走向自适应先验
From Static Policies to Adaptive Priors in Offline Reinforcement Learning
AI 导读
NeurIPS 2026 观点论文提出自适应离线强化学习(AORL),主张离线 RL 的目标应从直接部署的静态策略转向学习自适应策略先验。该范式使策略在后续在线交互中,能通过记忆、探索和自我修正持续改进,以应对分布偏移与有限数据覆盖。论文还将贝叶斯离线 RL 作为构建自适应先验的关键路径并指明了研究挑战。
来源:arXiv 机器学习 · arxiv.org