跳到正文
原文
arXiv 人工智能· Lei Ma, Dennis Hofmann, Haowen Xu, Joshua DeOliveira, Peter VanNostrand, Lei Cao, Elke Rundensteiner·· 9 小时前AI 评分44

MAADBench:面向多智能体系统异常检测的可刷新基准

MAADBench: The Refreshable Paradigm for Anomaly Detection in Multi-Agent Systems

AI 导读

研究人员推出首个面向多智能体系统的可刷新异常检测基准 MAADBench,以应对大语言模型系统 41%-87% 的高故障率。该基准构建了约 10^37 任务空间并支持自动化步骤级标注,同时开源了包含 5,200 条标注轨迹的 MAADBench-Full 数据集。对 25 种异常检测方法的评测表明,现有方案高度依赖监督且缺乏跨 LLM 鲁棒性。

来源:arXiv 人工智能 · arxiv.org