跳到正文
原文
MIT Technology Review AI· Arthur Holland Michel·· 4 小时前精选AI 评分63

MIT科技评论:我们对大模型的“拒绝能力”寄予了过高期望

We’re putting too much faith in AI’s ability to say no

AI 导读

大语言模型将“拒绝机制”作为核心安全防线的做法存在本质脆弱性与潜在危害。由于拒绝机制在底层本质上是基于概率的激活特征,它不仅难以彻底防范越狱攻击,还容易导致过度拒绝并衍生出更隐蔽的审查机制;随着大模型被逐步接入关键基础设施与智能体系统,仅靠训练拒绝行为将难以保障长期的系统可控性与安全性。

推荐理由

文章剖析了当前大语言模型安全防御过度依赖拒绝机制的概率漏洞与审查风险,为评估模型安全对齐提供了系统视角。

来源:MIT Technology Review AI · technologyreview.com