arXiv 人工智能· Andre Fu, Malik Drabla, Leon Liu, Meji Abidoye, Marek Suppa, Lata Mishra, Adnan El Assadi, Yiyuan Li·· 12 小时前AI 评分49
Incident-Arena:让智能体迈向极致可靠性
Incident-Arena: Getting agents to the last nine of reliability
AI 导读
研究团队推出智能体生产故障响应评测基准 Incident-Arena,包含基于真实开源环境构建的 20 个 Kubernetes 故障任务。该基准引入功能验证器确保修复安全,测试中智能体平均消耗 2.81M tokens 并进行 41 轮交互。跨 20 个任务与 3 类应用基底评测中,前沿模型得分均低于 64.3%,普遍存在诊断错误、不完整修复和不安全回归。
来源:arXiv 人工智能 · arxiv.org