用于系统文献综述自动化筛选的大模型评测基准框架
系统文献综述(SR)是循证研究的基础,但其文献初筛阶段极度耗时耗力。大语言模型虽有望用于文章相关性分类,但由于SR筛选数据集高度不平衡,传统评估指标往往存在误导性。该论文提出了一个包含32项二级研究、共计45,064条标注条目的基准测试框架,旨在更客观、准确地评估大语言模型在文献自动筛选场景下的实际表现。
推荐理由针对特定学术工作流(系统文献综述)构建的LLM自动化筛选评测基准,解决了样本不平衡评估问题,具参考价值。
原标题:A Benchmark Framework for Screening Automation in Systematic Reviews
阅读 arXiv 自然语言处理 原文 ↗