跳到正文
原文
arXiv 自然语言处理· Parisa Salmani, Peter R. Lewis·· 1 天前AI 评分50

长对抗对话下的大语言模型安全性评测

Evaluating Language Model Safety Across Long Adversarial Conversations

AI 导读

一项最新研究评测了 3 款开源指令微调大语言模型在多轮对抗对话中的安全性,发现单轮高安全性在持续对抗交互下会显著衰退。实验中模型的首轮安全回复率达 85% 至 100%,但对话进行至第 11 轮时骤降至 38%-61%,到第 101 轮进一步跌至 15%-44%。研究强调需开展长周期安全评测并建立对话级防护机制。

来源:arXiv 自然语言处理 · arxiv.org