arXiv 人工智能· Avyay M. Casheekar, Hariganesh Tangirala·· 5 小时前AI 评分34
多智能体博弈中学习举报不安全任务
Learning to Report Unsafe Tasks in a Multi-Agent Game
AI 导读
研究分析了共享奖励多智能体博弈中智能体举报不安全任务的学习机制,推导了策略梯度更新实现完全举报的审计条件。在 24 个见证图上训练 PPO 策略的结果显示,分离共同见证者相比打乱分组可将不安全任务完成率降低 33.59 个百分点(95% 置信区间 21.03-45.13)。在相同审计预算下,仅 9/48 次见证组运行同时达成低于 1% 不安全完成率与至少 90% 合法完成率。
来源:arXiv 人工智能 · arxiv.org