跳到正文
原文
arXiv 机器学习· John L. Zhou, Yuxuan Dong, Jonathan C. Kao·· 6 小时前AI 评分38

目标条件策略学习中的信息视界诅咒

An Informational Curse of Horizon in Goal-Conditioned Policy Learning

AI 导读

研究发现目标条件策略学习中存在“信息视界诅咒”,增大目标重标记视界会导致动作与重标记目标间的条件互信息下降,显著降低策略的泛化能力与性能。该现象使 BC 和 RL 策略的敏感度从目标信息转向状态信息,导致 BC 策略出现严重退化。通过将短视界策略的输入雅可比矩阵蒸馏到长视界策略中,可显著提升组合操作任务的性能。

来源:arXiv 机器学习 · arxiv.org