AIDC
← 返回全部动态
arXiv 人工智能AI 评分 68/10009月29日 12:00

EmailBench:面向企业邮件与办公生产力场景的智能体评测基准

研究团队推出针对大模型智能体企业邮件与生产力任务的评测基准 EmailBench。该基准包含16个任务类别的206个实际场景,结合了类型化邮件API规范与中立命名标准,并构建了基于Enron衍生的确定性合成语料库。其核心目标在于解决此前评测缺乏独立环境的问题,重点检验智能体在信息检索、结构化状态更新、时序推理及多步复杂协同工作流中的执行能力。

推荐理由聚焦企业邮件这一高频复杂场景的垂直智能体评测工具,填补了端到端办公自动化工作流的评估空缺。

原标题:EmailBench: A Benchmark for Evaluating LLM Agents on Enterprise Email and Productivity Tasks

阅读 arXiv 人工智能 原文 ↗

同一事件的其他来源

arXiv 机器学习09月29日 12:00

EEGAgentBench:面向短时与长时脑电图分析的LLM智能体评测基准

脑电图(EEG)分析正从短时片段分类转向需要迭代证据积累、多步推理及协调使用专业信号处理工具的长时解释。尽管大语言模型在作为脑电分析自主智能体方面展现出潜力,但现有评估协议碎片化且范围狭窄。为此,研究人员推出了EEGAgentBench评测基准,旨在全面评估大模型智能体在脑电图分析中的复杂推理、工具调用及工作流构建能力,填补了长短期任务系统性评测的空白。