热点事件持续更新
MIT科技评论关注大模型“拒绝机制”的安全局限
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
2026年10月9日,《麻省理工科技评论》(MIT Technology Review AI)发文指出,当前大语言模型将“拒绝机制”作为核心安全防线的做法存在本质脆弱性与潜在危害。报道称,由于拒绝机制在底层本质上属于基于概率的激活特征,它不仅难以彻底防范越狱攻击,还容易导致过度拒绝,并衍生出更为隐蔽的审查机制。文章进一步指出,随着大模型逐步接入关键基础设施与智能体系统,仅靠训练拒绝行为将难以保障系统长期的可控性与安全性。
AI 根据报道生成 · 2 小时前更新
最新进展10月9日 17:00
MIT科技评论发文指出大模型依赖“拒绝机制”存在安全防线脆弱等局限。报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- MIT Technology Review AI精选MIT科技评论:我们对大模型的“拒绝能力”寄予了过高期望
大语言模型将“拒绝机制”作为核心安全防线的做法存在本质脆弱性与潜在危害。由于拒绝机制在底层本质上是基于概率的激活特征,它不仅难以彻底防范越狱攻击,还容易导致过度拒绝并衍生出更隐蔽的审查机制;随着大模型被逐步接入关键基础设施与智能体系统,仅靠训练拒绝行为将难以保障长期的系统可控性与安全性。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。