arXiv 人工智能· Mukul Singh, Mansi Uniyal, Devin Devlin, Wen Xie, Big Thadawasin, Ritam Dutt, Vivian Lai, Hyeonsu B. Kang·· 2 天前AI 评分41
EmailBench:评估企业邮件与生产力任务中 LLM 智能体的基准
EmailBench: A Benchmark for Evaluating LLM Agents on Enterprise Email and Productivity Tasks
AI 导读
研究团队推出评测基准 EmailBench,在 16 个类别的 206 个企业邮件与生产力场景中评估 LLM 智能体。该基准采用 258 个可执行静态断言与 211 个 LLM 评分标准,对 8 种语言模型配置展开测试。结果显示最佳配置的场景通过率仅为 33.5%,尽管其 99.7% 的工具调用无 API 故障,表明有效工具执行并不等同于任务完成。
来源:arXiv 人工智能 · arxiv.org