跳到正文
原文
arXiv 机器学习· Dongsu Lee, Haoran Xu, Amy Zhang·· 3 小时前AI 评分34

基于分解价值梯度流的测试时多智能体协同

Test-time Multi-agent Coordination by Decomposed Value Gradient Flow

AI 导读

研究提出离线 MARL 框架 SCOUT,首次通过测试时动作精炼将生成基础模型与分解价值函数相结合。该框架解耦训练 flow-matching 行为先验与价值函数,并在测试时通过 Stein 变分梯度下降引导样本,以传输步数实现自适应测试时扩展。实验表明,SCOUT 在离散与连续离线 MARL 基准中取得最佳平均表现,并在所有 offline-to-online 配置中均提升性能。

来源:arXiv 机器学习 · arxiv.org