arXiv 机器学习· Haoyu Wang, Wei Zhao, Yedi Zhang, Christopher M. Poskitt, Jun Sun·· 4 小时前AI 评分43
表征转变揭示多轮 LLM 智能体中涌现的安全风险
Representation Transitions Reveal Emerging Safety Risks in Multi-Turn LLM Agents
AI 导读
研究提出运行时防御框架 DART,通过检测并去噪多轮 LLM 智能体在上下文更新中的内部表征转变来识别和拦截攻击。DART 在 MT-AgentRisk 上将攻击成功率从 84% 降至 25%,在 6 个模型上均超越现有 SOTA 防御 ToolShield,并在 ASEval 上将攻击成功率从 97% 降至 52%。
来源:arXiv 机器学习 · arxiv.org