跳到正文
原文
AITNT · AI头条(网页)·· 4 小时前AI 评分42

清华AIR提出高阶动作监督:聚焦一阶时序信息,10k小数据下增益显著

清华AIR提出高阶动作监督:聚焦一阶时序信息,10k小数据下增益显著 | NeurIPS'26

AI 导读

清华大学智能产业研究院(AIR)提出高阶动作监督方法,在不改变原有策略网络架构的前提下,通过额外引入一阶动作约束项拟合动作随时间的变化。该方法可覆盖确定性、高斯随机和流匹配策略,并结合连续时间HJB框架拓展至离线强化学习的价值学习。实验显示其在OGBench的50个任务中显著提升性能,并在D4RL约10k样本的小数据设置下大幅改善表现与动作平滑度。

来源:AITNT · AI头条(网页) · aitntnews.com