PolicyAttention:因果Softmax注意力机制在闭环控制中实现策略镜像下降
该研究探讨了因果Softmax注意力机制能否作为循环控制器来实现闭环控制中的策略镜像下降(PMD)。基于已知的Q-TD-PMD递推关系,研究团队构建了一个固定的因果Softmax“行动者-环境-单步评论家”协议,显式建模了行动者、路由、采样和归一化残差,并将这些误差传播至最终生成的策略中,为Transformer注意力机制在强化学习闭环控制中的理论表征提供了新视角。
推荐理由从理论层面严谨论证了注意力机制与强化学习策略镜像下降的等价性,对理解Transformer做闭环决策有一定理论价值。
原标题:PolicyAttention: Softmax Attention Implements Policy Mirror Descent for Closed-Loop Control
阅读 arXiv 机器学习 原文 ↗