热点事件持续更新
研究者推出首个多智能体异常检测基准MAADBench
1 篇报道1 个报道来源10 小时前更新
先了解这件事
AI 综述
2026年9月,研究人员推出首个面向多智能体系统的可刷新异常检测基准 MAADBench,旨在应对大语言模型系统 41% 至 87% 的高故障率。该基准构建了约 10^37 的任务空间,并支持自动化步骤级标注。同时,研究团队开源了包含 5,200 条标注轨迹的 MAADBench-Full 数据集。针对 25 种异常检测方法的评测结果显示,现有方案高度依赖监督,且普遍缺乏跨大语言模型的鲁棒性。
AI 根据报道生成 · 8 小时前更新
最新进展9月30日 12:00
研究人员推出可刷新基准MAADBench,并开源包含5200条标注轨迹的数据集。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv 人工智能MAADBench:面向多智能体系统异常检测的可刷新基准
研究人员推出首个面向多智能体系统的可刷新异常检测基准 MAADBench,以应对大语言模型系统 41%-87% 的高故障率。该基准构建了约 10^37 任务空间并支持自动化步骤级标注,同时开源了包含 5,200 条标注轨迹的 MAADBench-Full 数据集。对 25 种异常检测方法的评测表明,现有方案高度依赖监督且缺乏跨 LLM 鲁棒性。
本事件热度走势
当前热度 8·可比范围峰值 9(9月30日 14:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。