跳到正文
热点事件持续更新

MIT科技评论关注大模型“拒绝机制”的安全局限

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月9日,《麻省理工科技评论》(MIT Technology Review AI)发文指出,当前大语言模型将“拒绝机制”作为核心安全防线的做法存在本质脆弱性与潜在危害。报道称,由于拒绝机制在底层本质上属于基于概率的激活特征,它不仅难以彻底防范越狱攻击,还容易导致过度拒绝,并衍生出更为隐蔽的审查机制。文章进一步指出,随着大模型逐步接入关键基础设施与智能体系统,仅靠训练拒绝行为将难以保障系统长期的可控性与安全性。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. MIT Technology Review AI精选
    MIT科技评论:我们对大模型的“拒绝能力”寄予了过高期望

    大语言模型将“拒绝机制”作为核心安全防线的做法存在本质脆弱性与潜在危害。由于拒绝机制在底层本质上是基于概率的激活特征,它不仅难以彻底防范越狱攻击,还容易导致过度拒绝并衍生出更隐蔽的审查机制;随着大模型被逐步接入关键基础设施与智能体系统,仅靠训练拒绝行为将难以保障长期的系统可控性与安全性。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。