跳到正文
原文
arXiv 人工智能· Zhankai Ye, Yanning Wang, Yukai Jin, Bo Mei, Fangyi Li, Wei Wang, Shangqian Gao, Xin Liu·· 4 小时前AI 评分43

叙事包装如何影响大语言模型拒绝:跨语言基准 GUISE 与防御方法 AXIS

How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense

AI 导读

角色扮演与叙事包装会显著削弱大语言模型的安全拒绝能力,在 Qwen3-1.7B 上的攻击成功率在英语、现代汉语及文言文中分别达 89.4%、93.0% 和 95.7%。研究团队据此构建了跨语言基准 GUISE,并提出防御方法 AXIS。在 Qwen3-1.7B、Qwen3-4B 和 GLM-4-9B 上,AXIS 均取得了最高的综合安全与可用性评分。

来源:arXiv 人工智能 · arxiv.org