热点事件持续更新
研究团队推出法律模型幻觉评测基准PARCEL
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
研究团队推出用于法律模型幻觉检测的断言级评测基准 PARCEL。该基准基于纽约州上诉法院的判决,构建了包含 3,396 个断言的数据集,主要用于检测断言是否获得引证支持。零样本评测结果显示,最强大的大语言模型准确率可达 0.97。然而测试发现,即使向模型提供裁判全文,模型仍会将无依据的断言误判为有支持;此外,虚构但看似合理的引用会导致模型性能出现最大程度的下降。
AI 根据报道生成 · 3 小时前更新
最新进展10月9日 12:00
研究团队推出法律幻觉评测基准PARCEL,包含3396个断言数据集。报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv 自然语言处理PARCEL:用于法律模型幻觉检测的断言级评测基准
研究团队推出法律模型幻觉评测基准 PARCEL,基于纽约州上诉法院判决构建了包含 3,396 个断言的数据集,用于检测断言是否得到引证支持。零样本评测显示最强 LLM 准确率可达 0.97,但即使提供裁判全文,模型仍会将无依据的断言误判为有支持。测试表明,虚构但看似合理的引用会导致模型性能出现最大降幅。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。