跳到正文
原文
arXiv 自然语言处理· Longwei Cong, Sonja Hahn, Sebastian Gombert, Leon Camus, Fabian Zehner, Hendrik Drachsler, Ulf Kroehne·· 5 小时前AI 评分35

超越分数对齐评估 LLM-as-a-Judge:残差评判难度的心理测量学分析

Evaluating LLM-as-a-Judge Beyond Score Alignment: A Psychometric Analysis of Residual Judging Difficulty

AI 导读

针对 LLM-as-a-Judge 的心理测量学研究发现,大模型与人类评分在潜在质量上的对齐并不代表残差评判难度一致。在 SummEval 上对 17 个开源权重 LLM 裁判的测试表明,评判难度不匹配具有强维度依赖性,一致性(Consistency)偏向 LLM 难评,而连贯性(Coherence)偏向人类难评。人类易评但 LLM 难评的案例可部分被预测,为针对性人机协同提供了新依据。

来源:arXiv 自然语言处理 · arxiv.org