arXiv 自然语言处理· Yingzhu Zhao, Vlad Pandelea, Han Yuan, Bo Hu, Wuqiong Luo, Li Zhang, Zheng Ma·· 6 小时前AI 评分35
面向大语言模型财报电话会议记录分析的引用溯源评测基准 ECTs-100
A Citation-Grounded Benchmark for Trustworthy Earnings Call Transcript Analysis with Large Language Models
AI 导读
研究人员提出了一种无需专家标注的数值证据评估方法及自动化流程,用于评测大语言模型在财报电话会议记录分析中的引用依据与正确性。该研究基于 S&P 500 前 100 家成分股构建了 ECTs-100 数据集,并测试模型在信息不足时拒绝生成幻觉的自觉无能能力。实验表明,大语言模型在引用依据上表现良好,但在回答正确性上仍面临显著局限。
来源:arXiv 自然语言处理 · arxiv.org