跳到正文
原文
arXiv 自然语言处理· Lingzhe Zhang, Yunpeng Zhai, Tong Jia, Kening Zheng, Chiming Duan, Minghua He, Zhaoyang Liu, Bolin Ding, Philip S. Yu, Ying Li·· 6 小时前AI 评分41

基于强化微调的大语言模型在社交推理游戏中的表现

Playing social deduction games with reinforcement fine-tuned large language models

AI 导读

研究通过社交推理游戏探讨了强化微调(RFT)对大语言模型社交行为的影响,发现仅优化最终胜负无法让模型稳定获得社交推理能力。但 RFT 能显著提升模型推断隐藏角色的社交洞察力,以及引导投票等社交影响力。结合两者的多智能体社交认知 RFT 进一步提升了游戏表现,并在策略能力与说服力上获得了更高的人类评估得分。

来源:arXiv 自然语言处理 · arxiv.org