arXiv 人工智能· Michael Lee, Zhipeng Wei, Yue Dong, N. Benjamin Erichson·· 18 小时前AI 评分48
分而注入:AI 智能体能否从片段中重构间接提示词注入?
Divide and Inject: Can Agents Reconstruct an Indirect Prompt Injection from Fragments?
AI 导读
研究提出自适应长上下文提示词注入(AdaLCPI),证实 AI 智能体能够将长上下文中分散的不完整片段重构成恶意攻击目标。该方法通过工具检索嵌入碎片,并利用 OpenEvolve 结合目标智能体的执行反馈迭代优化线索,宏平均攻击成功率(ASR)达 61.4%,大幅超越 Trojan Hippo 风格(32.8%)与 AgentVigil(30.0%)。
来源:arXiv 人工智能 · arxiv.org