跳到正文
热点事件持续更新

研究者提出离线MARL框架SCOUT

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月5日,相关研究提出了离线多智能体强化学习(MARL)框架SCOUT。该框架首次通过测试时动作精炼,将生成基础模型与分解价值函数相结合。在具体实现上,SCOUT解耦训练了flow-matching行为先验与价值函数,并在测试时通过Stein变分梯度下降引导样本,利用传输步数实现自适应测试时扩展。实验结果显示,SCOUT在离散与连续离线MARL基准测试中均取得了最佳平均表现,并在所有离线转在线(offline-to-online)配置中均实现了性能提升。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv 机器学习
    基于分解价值梯度流的测试时多智能体协同

    研究提出离线 MARL 框架 SCOUT,首次通过测试时动作精炼将生成基础模型与分解价值函数相结合。该框架解耦训练 flow-matching 行为先验与价值函数,并在测试时通过 Stein 变分梯度下降引导样本,以传输步数实现自适应测试时扩展。实验表明,SCOUT 在离散与连续离线 MARL 基准中取得最佳平均表现,并在所有 offline-to-online 配置中均提升性能。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。