跳到正文
原文
arXiv 自然语言处理· Benjamin Wilcox, Dawei Gao, Pradeeban Kathiravelu, Douglas Causey, Kewei Sha, Yunhe Feng·· 6 小时前AI 评分34

北极科学大语言模型弃权能力评测:ArcticQA 数据集与 ArcticAbstain 基准

Arctic Questions, Missing Answers: A Dataset and Benchmark for LLM Abstention in Arctic Science

AI 导读

研究团队推出北极科学问答数据集 ArcticQA 及评测基准 ArcticAbstain,用于评估大语言模型在无有效选项时的弃权表现。评测针对 Gemini、Claude 和 ChatGPT 家族的 8 个模型并记录了 9,312 次回答。测试显示有答案时模型弃权率为 0.0% 至 63.0%,而在移除正确答案后弃权率平均仅上升 5.05 个百分点。

来源:arXiv 自然语言处理 · arxiv.org