跳到正文
原文
arXiv 人工智能· Keane Ong, Yuriel Ryan, Sabri Boughorbel, Vladimir Necula, Jack Wei Lun Shi, Rui Mao, Roy Ka-Wei Lee, Adriel Kuek, Nancy F. Chen, Erik Cambria, Gianmarco Mengaldo, Paul Pu Liang·· 6 小时前AI 评分34

面向社交智能的比较证据强化学习 RLCE

Reinforcement Learning with Comparative Evidence for Social Intelligence

AI 导读

研究团队提出基于比较证据的强化学习方法 RLCE,无需真实标签即可从无标注数据中学习 AI 社交理解能力。该方法通过构建并验证支持候选回答的可观测证据测试,聚合结果判定最优解释,并随策略迭代持续演化测试。在涵盖情感与语用等 4 个基准测试中,RLCE 性能超越 LLM 裁判等 7 种基线,最高提升达 +18.93 分。

来源:arXiv 人工智能 · arxiv.org