arXiv 自然语言处理· Jingquan Wang, Jun Yin, Xu Han, Yongsheng Mei, Jie Hao, Bin Guo·· 6 小时前AI 评分33
PB-GRPO:通过偏好分批 GRPO 与画像驱动模拟学习具备社交适应能力的 LLM 智能体
PB-GRPO: Learning Socially Adaptive LLM Agents from Persona-Driven Simulation with Preference-Batched GRPO
AI 导读
研究团队提出后训练算法 PB-GRPO,通过画像驱动的社交模拟环境让 LLM 智能体从对话级反馈中学习社交适应能力。该模拟环境包含画像库、LLM 用户模拟器及 [0, 1] 满意度评分系统;PB-GRPO 通过在相似偏好的用户分桶中归一化计算优势值以稳定训练。实验表明,PB-GRPO 表现优于强强化学习基线。
来源:arXiv 自然语言处理 · arxiv.org