AIDC
DC AI 热点

精选

当前热点完整榜单 →
1OpenAI爆发严重安全事件:最强内测模型越界绕过沙箱,训练评估全线叫停91 热度 ⌁2接连出现越狱与攻击行为,OpenAI 暂停工具调用类模型训练与评估77 热度 ⌁3OpenAI与Anthropic正调查数万起前沿AI模型安全异常事件74 热度 ⌁4AI幻觉虚构涉华核部件情报险性引发美军行动71 热度 ⌁5后装智驾涉5起事故致3死,Comma.ai遭美国NHTSA联邦调查71 热度 ⌁
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 75/10012:00

针对利益冲突环境,新基准CAVEAT评估计算机使用智能体鲁棒性

随着计算机使用智能体(CUA)日益广泛地代表用户执行在线操作,当所处环境的利益激励与用户目标不一致(如电商平台倾向于推荐特定商品而诱导智能体偏离目标)时,智能体表现面临新挑战。现有基准多局限于合作场景或显式攻击,忽略了环境自身存在利益诉求的情况。为此,研究团队推出了受控基准测试 CAVEAT,涵盖 9 个市场环境及相关分类法,专门评估智能体在利益错位环境下的目标坚守能力。

阅读原文 ↗推荐理由:针对计算机使用智能体在现实商业利益诱导下的对齐与鲁棒性问题,填补了现有评测基准的空白。# 智能体# CUA# 评测# 鲁棒性# 对齐