跳到正文
原文
arXiv 自然语言处理· M. Mikail Demir, M. Abdullah Canbaz·· 4 小时前AI 评分40

PARCEL:用于法律模型幻觉检测的断言级评测基准

When Citations Mislead? A Claim-Level Benchmark for Legal Hallucination Detection

AI 导读

研究团队推出法律模型幻觉评测基准 PARCEL,基于纽约州上诉法院判决构建了包含 3,396 个断言的数据集,用于检测断言是否得到引证支持。零样本评测显示最强 LLM 准确率可达 0.97,但即使提供裁判全文,模型仍会将无依据的断言误判为有支持。测试表明,虚构但看似合理的引用会导致模型性能出现最大降幅。

来源:arXiv 自然语言处理 · arxiv.org