arXiv 自然语言处理· Divya Godara, Sachin Gupta·· 1 天前AI 评分26
证据优先,算术在后:DocSem 系统报告与失败分析
Evidence First, Arithmetic Second: A System Report and Failure Analysis for DocSem
AI 导读
EVICALC 系统在 DocSem 官方最终测试的 1,730 项任务中取得了 8.61% 的联合准确率。该系统通过读取 PDF 筛选段落,由语言模型生成算术表达式并在本地代码中求值。事后分析显示 OCR 与分块合并错误会导致系统误用无关文本作答,而在 100 份文档图像的探索测试中仅 22 份成功返回了证据标识符。
来源:arXiv 自然语言处理 · arxiv.org