跳到正文
热点事件持续更新

研究者提出联邦强化学习框架Fed-GRPO

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月9日,研究者在arXiv发布论文,提出奖励信号驱动的联邦群组相对策略优化框架Fed-GRPO。该框架旨在不共享原始数据的前提下协同训练大语言模型的推理能力,包含信号加权聚合、全局奖励校准与自适应稀疏通信机制,利用零成本的奖励统计量指导模型聚合与参数传输。在数学推理任务的评估中,Fed-GRPO的性能优于FedAvg并接近中心化训练水平,同时实现了32倍无损通信缩减,最高支持621倍压缩。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv 人工智能
    Fed-GRPO:奖励信号驱动的联邦群组相对策略优化框架

    Fed-GRPO 是一种奖励信号驱动的联邦 GRPO 训练框架,可在不共享原始数据的前提下协同训练大语言模型的推理能力。该框架包含信号加权聚合、全局奖励校准与自适应稀疏通信机制,利用零成本的奖励统计量指导模型聚合与参数传输。在数学推理任务中,Fed-GRPO 性能优于 FedAvg 并接近中心化训练,实现 32x 无损通信缩减且最高支持 621x 压缩。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。