arXiv 人工智能· Junxuan Li, Arko Mukherjee, Soumyabrata Pal·· 2 天前AI 评分47
稀疏重叠下的 LLM 裁判验证:从推断到设计
LLM Judge Validation Under Sparse Overlap: From Inference to Design
AI 导读
标注重叠稀疏度是导致大语言模型裁判(LLM-as-a-judge)部署决策错误的首要因素:在成对重叠率仅为 5% 时,错误决策率达 25%,从 10 个候选者中选错最佳裁判的概率达 65%。研究推导公式证明 $\rho \geq 0.25$ 即可满足非边界裁判验证,其零成本分层分配方案较随机抽样将错误拒绝率减半,并在 10 个 LLM 裁判上完成验证。
来源:arXiv 人工智能 · arxiv.org