跳到正文
热点事件持续更新

研究提出多轮LLM智能体安全防御框架DART

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月2日,相关研究在arXiv发布,针对多轮LLM智能体中涌现的安全风险提出了运行时防御框架DART。该框架通过检测并去噪多轮智能体在上下文更新过程中的内部表征转变,实现对攻击的识别与拦截。实验表明,DART在6个模型上的表现均超越了现有SOTA防御方法ToolShield,成功在MT-AgentRisk基准上将攻击成功率从84%降至25%,并在ASEval上将攻击成功率从97%降至52%。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv 机器学习
    表征转变揭示多轮 LLM 智能体中涌现的安全风险

    研究提出运行时防御框架 DART,通过检测并去噪多轮 LLM 智能体在上下文更新中的内部表征转变来识别和拦截攻击。DART 在 MT-AgentRisk 上将攻击成功率从 84% 降至 25%,在 6 个模型上均超越现有 SOTA 防御 ToolShield,并在 ASEval 上将攻击成功率从 97% 降至 52%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。