arXiv 机器学习· Zixuan Wang, Hao Li, Fengyu Gao, G. Edward Suh, Yi Zeng, Yevgeniy Vorobeychik, Ning Zhang, Chaowei Xiao·· 8 小时前AI 评分40
自我反思微调(SRFT):通过失败经验增强 AI 智能体防御提示词注入攻击的能力
Self-Reflection Fine-Tuning: Enhancing Agent Security against Prompt Injection Attacks from Failure Experience
AI 导读
研究人员提出自我反思微调(SRFT)训练框架,通过让 AI 智能体从对抗环境下的失败轨迹中学习,利用结构化反思推理对比不安全与最优动作,以抵御提示词注入攻击。该框架已基于 Llama-3.1-8B-Instruct 和 Qwen3-8B 构建为 SR-Agent 并开源代码。实验表明,SRFT 在保持任务性能的同时显著降低了攻击成功率,且对自适应攻击具有强泛化能力。
来源:arXiv 机器学习 · arxiv.org