AIDC
← 返回全部动态
arXiv 自然语言处理AI 评分 58/10009月28日 12:00

用于系统文献综述自动化筛选的大模型评测基准框架

系统文献综述(SR)是循证研究的基础,但其文献初筛阶段极度耗时耗力。大语言模型虽有望用于文章相关性分类,但由于SR筛选数据集高度不平衡,传统评估指标往往存在误导性。该论文提出了一个包含32项二级研究、共计45,064条标注条目的基准测试框架,旨在更客观、准确地评估大语言模型在文献自动筛选场景下的实际表现。

推荐理由针对特定学术工作流(系统文献综述)构建的LLM自动化筛选评测基准,解决了样本不平衡评估问题,具参考价值。

原标题:A Benchmark Framework for Screening Automation in Systematic Reviews

阅读 arXiv 自然语言处理 原文 ↗

同一事件的其他来源

arXiv 人工智能09月28日 12:00

HARDEN:通过约束进化搜索生成高难度且保真答案的大模型评测用例

针对现有基准测试难以反映企业实际部署复杂度的问题,研究人员提出了 HARDEN 方法。该方法利用约束进化搜索技术,在保持预期输出答案不变的前提下,沿特定领域复杂度维度对评估输入进行改造,同时严格遵循任务语义、真实性与执行有效性约束。在 FinQA、PubMedQA、ContractNLI 基准及不同规模 Qwen3.5 模型上的实验表明,该方法能有效提升评测难度并暴露模型在复杂场景下的局限性。