跳到正文
原文
arXiv 机器学习· Arthur Louette, Alejandro S\'anchez Roncero, Gaspard Lambrechts, Pascal Leroy, Julien Hansen, Petter \"Ogren, Damien Ernst·· 5 小时前AI 评分33

用于非对称 Actor-Critic 的 Memory-State Critic 及其在视觉追逃中的应用

Memory-State Critic for Asymmetric Actor-Critic with Application to Vision-Based Pursuit-Evasion

AI 导读

研究提出面向非对称 Actor-Critic 架构的 Memory-State Critic,通过将 Critic 条件化于环境真实状态与策略自身的记忆表征,无需额外循环逼近器即可实现无偏策略梯度。该架构下 Critic 损失无需反向传播至策略记忆。在双四旋翼无人机视觉追逃环境的评估中,Memory-State Critic 表现优于 History-State Critic 且收敛速度更快。

来源:arXiv 机器学习 · arxiv.org