arXiv 机器学习· Sreejeet Maity, Aritra Mitra·· 4 小时前AI 评分34
从不可靠轨迹中学习:对抗鲁棒的联邦 Q 学习
Learning from Unreliable Trajectories: Adversarially-Robust Federated Q-Learning
AI 导读
研究提出了 Robust Async-Fed-Q 算法,结合智能体端方差缩减估计与服务端鲁棒聚合,在存在对抗节点破坏信息时仍能保障联邦 Q 学习的样本效率。该方法建立了首个几乎匹配的信息论上下界,证明对抗影响随诚实数据增加最终消失。该算法还显著改善了异步采样下联邦 Q 学习的通信复杂度,并支持单轨迹马尔可夫采样与异构部分覆盖。
来源:arXiv 机器学习 · arxiv.org