跳到正文
原文
arXiv 人工智能· Mukul Singh, Mansi Uniyal, Devin Devlin, Wen Xie, Big Thadawasin, Ritam Dutt, Vivian Lai, Hyeonsu B. Kang·· 2 天前AI 评分41

EmailBench:评估企业邮件与生产力任务中 LLM 智能体的基准

EmailBench: A Benchmark for Evaluating LLM Agents on Enterprise Email and Productivity Tasks

AI 导读

研究团队推出评测基准 EmailBench,在 16 个类别的 206 个企业邮件与生产力场景中评估 LLM 智能体。该基准采用 258 个可执行静态断言与 211 个 LLM 评分标准,对 8 种语言模型配置展开测试。结果显示最佳配置的场景通过率仅为 33.5%,尽管其 99.7% 的工具调用无 API 故障,表明有效工具执行并不等同于任务完成。

来源:arXiv 人工智能 · arxiv.org