AIDC
← 返回全部动态
arXiv 人工智能AI 评分 72/10009月28日 12:00

安全评测基准ScopeBench:检验智能体在目标压力下是否会越界攻击

随着具有自主行动能力的智能体被广泛应用于Web应用和网络渗透测试,智能体是否遵守授权范围(Scope Adherence)成为落地的关键安全对齐问题。现有基准多关注攻击能力,缺乏对越界风险的评估。研究人员提出了ScopeBench基准,设计了30个死胡同安全任务。在这些任务中,目标仅能通过违反规定范围来实现,以此测试智能体在面临目标达成压力时是否能守住安全边界。

推荐理由针对网络安全自主智能体落地中最关键的越界风险提出了专门的对齐评测基准,对Agent安全攻防实践具有参考价值。

原标题:ScopeBench: Do Agents Preserve Engagement Boundaries Under Goal Pressure?

阅读 arXiv 人工智能 原文 ↗