arXiv 机器学习· Xinfei Wang, Shanchen Pang, Chenhao Zhang, Shudong Wang, Wenhao Ji, Haiyuan Gui, Meng Han, Xiaojian Liao·· 4 小时前AI 评分34
DaCe-DT:基于自适应提示词与轨迹校正的以数据为中心离线多任务强化学习
DaCe-DT: Data-Centric Offline Multi-Task Reinforcement Learning via Adaptive Prompts and Trajectory Correction for Heterogeneous Tasks
AI 导读
研究提出离线多任务强化学习框架 DaCe-DT,通过长度门控提示词掩码(LGPM)、检索增强提示词构建(RAPC)和价值自适应回报校准(VARC)实现以数据为中心的提示词自适应与轨迹精炼。Meta-World 实验结果显示,DaCe-DT 性能超越现有 SOTA 方法,在最优数据集和次优数据集上分别取得 11.73% 与 13.34% 的平均提升。
来源:arXiv 机器学习 · arxiv.org