arXiv 自然语言处理· Pavan Maddula·· 5 小时前AI 评分38
开放权重 LLM 在非规范输入下的四态安全评测研究
Quad-State Safety Evaluation of Open-Weight Large Language Models on Non-Canonical Inputs
AI 导读
研究提出包含 2,100 个提示词的 ASRD 数据集与四态评估标准,对 5 款开放权重 LLM 在非规范输入下的安全性展开评测。结果显示,Emoji 和不可见 Unicode 变体的有害依从率分别达 20.27% 和 17.20%,而编码包装等转换使模型理解失败率升至 65.60%。分析还揭示了模型在扰动下存在幻觉良性、结构崩溃与语言漂移三种响应行为。
来源:arXiv 自然语言处理 · arxiv.org