跳到正文
原文
arXiv 机器学习· Michael Tang, Mahmoud Abdelgalil, Jorge I. Poveda·· 7 小时前AI 评分33

欺骗性多臂老虎机问题:探索耦合与多智能体学习的脆弱性

The Deceptive Bandit Problem: Exploratory Coupling and the Fragility of Multi-Agent Learning

AI 导读

研究揭示了多智能体学习中随机探索隐私性的安全漏洞,展示了对抗方如何利用受害者泄露的探索相关信号实施操控。在双人强单调博弈设定下,欺骗方通过将自身探索动作与泄漏信息耦合,可将学习动态引导至欺骗性纳什均衡(DNE)。该欺骗性老虎机学习(DBL)动态在放宽二阶平滑度条件的同时,能以最优收敛率收敛至 DNE。

来源:arXiv 机器学习 · arxiv.org