跳到正文
原文
arXiv 人工智能· Pengxin Guo, Shuang Zeng, Zonggen Li, Weiying Zheng, Mengting Liu, Liangqiong Qu·· 6 小时前AI 评分33

Fed-GRPO:奖励信号驱动的联邦群组相对策略优化框架

Fed-GRPO: Reward-Signal-Driven Federated Group Relative Policy Optimization

AI 导读

Fed-GRPO 是一种奖励信号驱动的联邦 GRPO 训练框架,可在不共享原始数据的前提下协同训练大语言模型的推理能力。该框架包含信号加权聚合、全局奖励校准与自适应稀疏通信机制,利用零成本的奖励统计量指导模型聚合与参数传输。在数学推理任务中,Fed-GRPO 性能优于 FedAvg 并接近中心化训练,实现 32x 无损通信缩减且最高支持 621x 压缩。

来源:arXiv 人工智能 · arxiv.org