跳到正文
热点事件观察中

研究团队发布DocSem任务系统EVICALC及失败分析

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年10月1日,研究团队在arXiv发布关于DocSem任务系统EVICALC的系统报告与失败分析。在DocSem官方最终测试的1,730项任务中,EVICALC系统取得了8.61%的联合准确率。该系统的工作流程是通过读取PDF筛选相关段落,再由语言模型生成算术表达式并在本地代码中求值。事后分析指出,OCR与分块合并错误会导致系统误用无关文本进行回答;而在针对100份文档图像的探索测试中,仅有22份成功返回了证据标识符。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv 自然语言处理
    证据优先,算术在后:DocSem 系统报告与失败分析

    EVICALC 系统在 DocSem 官方最终测试的 1,730 项任务中取得了 8.61% 的联合准确率。该系统通过读取 PDF 筛选段落,由语言模型生成算术表达式并在本地代码中求值。事后分析显示 OCR 与分块合并错误会导致系统误用无关文本作答,而在 100 份文档图像的探索测试中仅 22 份成功返回了证据标识符。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。