跳到正文
原文
arXiv 自然语言处理· Tobias Hallmen, Elisabeth Andr\'e·· 2 小时前AI 评分34

量表锚定的大语言模型评审可实现咨询质量跨域迁移评估且优于域内训练

Language Carries the Expert's Impression: Instrument-Anchored LLM Judges Transfer Counseling-Quality Assessment and Beat In-Domain Training

AI 导读

研究表明基于量表锚定的大语言模型评审在咨询沟通质量评估中展现出优越的跨领域迁移能力,效果击败域内训练。在 3 个德语模拟咨询语料库(共 195 场专家评分会话)上,留一领域迁移评估达到嵌套 Spearman $\rho = 0.54$(域内 $\le 0.48$),在匹配训练集规模下仍保持 $+0.12$ 优势。来自 3 个模型家族的开源模型集成仅凭文本评分即可达 $0.51$。

来源:arXiv 自然语言处理 · arxiv.org