arXiv 自然语言处理· Hui Dai, Lina Piao, Nick Merrill, Nadja Flechner, Ezra Karger, Haifeng Xu·· 1 天前AI 评分45
CruxBench:信息发现能力评测基准
CruxBench: A Benchmark of Information Discovery
AI 导读
研究人员推出评测基准 CruxBench,通过信息价值(VOI)评估大语言模型分解并提出关键子问题的信息发现能力。该基准利用未来真实事件构建以防止数据污染,并在 293 个目标预测问题上测试了 8 个模型。结果显示 VOI 与模型能力指标高度相关(r=0.90),但即使前沿 LLM 在该任务上也仅略微优于随机时间基线。
来源:arXiv 自然语言处理 · arxiv.org