AIDC
← 返回全部动态
arXiv 人工智能AI 评分 72/10009月29日 12:00

稀疏重叠下大模型裁判验证方法研究:从推断到设计

在评估LLM作为裁判(LLM-as-a-judge)与人类评估的一致性时,标注预算通常限制了样本的重复标注率。研究证明,这种“重叠稀疏性”是导致错误部署决策的首要因素:在5%的配对重叠率下,错误决策率达25%,在10个候选模型中选错最优裁判的概率高达65%。为此,研究提出了重叠数量与分配策略,并推导出最小重叠公式,指出常规场景下重叠率需达到25%以上才能保证评估可靠性。

推荐理由针对当前大模型评测中广泛使用的LLM-as-a-judge方案,系统分析了数据标注重叠稀疏带来的评测偏差并给出了量化设计指导,具备较高实用价值。

原标题:LLM Judge Validation Under Sparse Overlap: From Inference to Design

阅读 arXiv 人工智能 原文 ↗