跳到正文
热点事件持续更新

清华AIR提出高阶动作监督方法

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月10日,清华大学智能产业研究院(AIR)提出高阶动作监督方法。该方法在不改变原有策略网络架构的前提下,通过额外引入一阶动作约束项来拟合动作随时间的变化。该方案可覆盖确定性策略、高斯随机策略和流匹配策略,并结合连续时间HJB框架拓展至离线强化学习的价值学习。实验结果显示,该方法在OGBench基准的50个任务中取得显著性能提升,并在D4RL约10k样本的小数据设定下,大幅改善了模型表现与动作平滑度。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月10日
  1. AITNT · AI头条
    清华AIR提出高阶动作监督:聚焦一阶时序信息,10k小数据下增益显著

    清华大学智能产业研究院(AIR)提出高阶动作监督方法,在不改变原有策略网络架构的前提下,通过额外引入一阶动作约束项拟合动作随时间的变化。该方法可覆盖确定性、高斯随机和流匹配策略,并结合连续时间HJB框架拓展至离线强化学习的价值学习。实验显示其在OGBench的50个任务中显著提升性能,并在D4RL约10k样本的小数据设置下大幅改善表现与动作平滑度。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。