arXiv 机器学习· Dongsu Lee, Haoran Xu, Amy Zhang·· 3 小时前AI 评分34
基于分解价值梯度流的测试时多智能体协同
Test-time Multi-agent Coordination by Decomposed Value Gradient Flow
AI 导读
研究提出离线 MARL 框架 SCOUT,首次通过测试时动作精炼将生成基础模型与分解价值函数相结合。该框架解耦训练 flow-matching 行为先验与价值函数,并在测试时通过 Stein 变分梯度下降引导样本,以传输步数实现自适应测试时扩展。实验表明,SCOUT 在离散与连续离线 MARL 基准中取得最佳平均表现,并在所有 offline-to-online 配置中均提升性能。
来源:arXiv 机器学习 · arxiv.org