arXiv 自然语言处理· Kamile Dementaviciute, Julija Vaitonyte, Tijl De Bie·· 4 小时前AI 评分41
LLM 说服力取决于评测方式
LLM Persuasion Is in the Eye of the Evaluation
AI 导读
一项针对 15 个 LLM 的研究将 9 种自动化说服力评测方法置于统一设置下对比,发现各评测方法给出的模型排名一致性较弱(平均 Spearman $\rho = 0.25$)。分析指出,模型在操纵性任务上的拒答使一致性降低约四分之一,且说服力评分实际混合了能力与配合意愿,单一评分无法代表跨任务的综合说服水平。
来源:arXiv 自然语言处理 · arxiv.org