跳到正文
原文
Hacker News · AI· viridianassuran·· 2 小时前AI 评分27

尝试复现大语言模型裁判位置偏差

We tried to reproduce LLM judge position bias

AI 导读

针对 GPT-5.6 Sol 成对评估位置偏差的复现实验显示,反转候选回答呈现顺序后 95%(19/20)的比对维持相同胜者,未发现系统性位置偏差的充分证据。在 20 组固定提示词测试中,同序对照一致性达 100%(20/20),仅 1 组(5%)出现第二位置偏好。作者指出该小样本结果既未确立系统性偏差,也无法证明 GPT-5.6 Sol 普遍具备位置鲁棒性。

来源:Hacker News · AI · github.com