arXiv 自然语言处理· Joyanta Jyoti Mondal, Md. Shifatul Ahsan Apurba, Mridul Banik, Md Masud Al Mahmud, Ibne Farabi Shihab·· 1 天前AI 评分35
回答之前:基于等大小记忆构建的证据充分性评估
Before Answering: Evidence Sufficiency under Size-Matched Memory Construction
AI 导读
新研究指出通过删除段落构建记忆不足样本会泄露标签,并提出消除该捷径的等大小记忆构建方法与 MemSafe 评估器。MemSafe 在 MuSiQue 和 HotpotQA 数据集上分别取得 0.968 和 0.983 的 AUROC。将其作为 7B 阅读器的门控时,在 5% 覆盖率下将回答错误率从 0.850 降至 0.631。
来源:arXiv 自然语言处理 · arxiv.org