跳到正文
热点事件持续更新

研究者推出首个多智能体异常检测基准MAADBench

1 篇报道1 个报道来源10 小时前更新

先了解这件事

AI 综述

2026年9月,研究人员推出首个面向多智能体系统的可刷新异常检测基准 MAADBench,旨在应对大语言模型系统 41% 至 87% 的高故障率。该基准构建了约 10^37 的任务空间,并支持自动化步骤级标注。同时,研究团队开源了包含 5,200 条标注轨迹的 MAADBench-Full 数据集。针对 25 种异常检测方法的评测结果显示,现有方案高度依赖监督,且普遍缺乏跨大语言模型的鲁棒性。

AI 根据报道生成 · 8 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv 人工智能
    MAADBench:面向多智能体系统异常检测的可刷新基准

    研究人员推出首个面向多智能体系统的可刷新异常检测基准 MAADBench,以应对大语言模型系统 41%-87% 的高故障率。该基准构建了约 10^37 任务空间并支持自动化步骤级标注,同时开源了包含 5,200 条标注轨迹的 MAADBench-Full 数据集。对 25 种异常检测方法的评测表明,现有方案高度依赖监督且缺乏跨 LLM 鲁棒性。

本事件热度走势

当前热度 8·可比范围峰值 9(9月30日 14:00)·近 24 小时可比范围变化 –

02.557.5109月30日14:009月30日16:009月30日19:009月30日21:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。