跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 21–34 条 · 共 34 条
9月30日周三
  1. The Verge · AI 筛选67

    Sam Altman 称 OpenAI 在确保模型安全前不会上市

    OpenAI 首席执行官 Sam Altman 在 DevDay 媒体问答中表示,在公司能够对模型安全做出确切承诺前不会推进 IPO,目前尚无明确上市时间表。Altman 强调当前需将安全与对齐置于能力扩展之前,担忧此时上市可能因安全考量让华尔街支持者失望。他也同时指出,如果 OpenAI 过度拖延上市对世界同样不利。

    推荐理由:原文呈现了前沿大模型厂商在资本化与模型安全约束之间的权衡,有助于理解模型能力跃升对公司上市节奏的影响。

  2. Gary Marcus73

    Gary Marcus 评《纽约时报》报道:OpenAI 在 Hugging Face 事件数月前曾收到安全警告

    《纽约时报》报道披露,OpenAI 在 Hugging Face 事件发生数月前便已收到员工与安全研究人员的内部预警,但公司在模型测试等多个业务环节中未将安全置于优先地位。Gary Marcus 据此发文批评 OpenAI 管理层忽视安全风险且缺乏有效监管,并反驳了此前呼吁公众信任 AI 企业的观点。

    推荐理由:原文梳理了针对 OpenAI 安全治理机制的外部质疑,读者可据此了解行业对模型安全预警与监管责任的争议焦点。

  3. The Decoder70

    佛罗里达州向法院申请禁令要求阻止 ChatGPT 拟人化并限制向未成年人提供

    美国佛罗里达州总检察长向法院申请临时禁令,要求阻止 OpenAI 让 ChatGPT 具备拟人特征并向未成年人提供服务。该动议指控 OpenAI 利用第一人称和模拟情感伪造信任以增加用户黏性并收集训练数据,并要求禁止其在未经第三方批准安全护栏的情况下开发新模型。OpenAI 发言人表示已暂停训练其能力最强的模型,并希望与该州合作制定行业 AI 指导方针,目前法院尚未作出裁决。

    推荐理由:佛罗里达州针对拟人化和未成年人保护申请临时禁令,展示了地方司法对大模型拟人交互与安全护栏的具体诉求。

9月29日周二
  1. Simon Willison65

    OpenAI 安全人员谈模型能力突发跃升带来的安全与组织挑战

    OpenAI Agent Security 成员 @joedaroo 表示,团队对模型在网络攻防和群体协同等能力的突发跃升感到意外,这种剧烈变化对防御构成了极大挑战。他强调安全态势不仅是加固系统,更需要组织文化和人员同步演进,并呼吁各机构评估自身面对 AI 能力突变时的系统韧性与应急响应能力。

    推荐理由:原文来自一线安全人员的反思,呈现了模型能力突飞猛进对企业安全建设与应急响应机制带来的组织挑战。

9月24日周四
9月10日周四
9月1日周二
8月27日周四
  1. Google DeepMind64

    Google DeepMind 试点双盲 AI 评测以防止基准污染

    Google DeepMind 联合新加坡 AI 安全研究所、OpenMined、AVERI 及 MLCommons 试点双盲 AI 评测机制,旨在解决基准污染问题。该方案将外部评测置于密码学安全环境中,确保模型在测试前无法接触保密题目以人为刷高分数,本次试点已在隐私保护环境中对 Gemini Flash Lite 模型展开保密基准测试。

    推荐理由:原文介绍了用密码学安全环境隔离测试集以防止基准污染的机制,读者可以了解前沿模型第三方评测如何提升真实可信度。

  2. AWS Architecture64

    AWS 提出渐进式自治架构模式:用六层机制化解 AI Agent 信任鸿沟

    AWS 架构博客提出了名为“渐进式自治”(graduated autonomy)的架构模式,通过持续可靠性动态授予或收回 AI Agent 权限,解决全量访问与只读的两极分化困境。

    推荐理由:原文给出了基于持续可靠性动态分配 Agent 权限的六层架构设计,读者可以据此搭建告别全量放行或只读两极分化的安全治理机制。

8月25日周二
  1. Anthropic News(RSS)62

    Anthropic 设立 500 万美元资助计划支持 AI 身心健康影响评估研究

    Anthropic 宣布推出一项 500 万美元的资助计划,支持关于 AI 如何影响用户身心健康的独立研究,并提供资金、模型访问权限及技术支持。入选研究者将完全独立开展工作,产出面向全行业的开源评估基准,重点应对心理危机、情感陪伴及长程多轮对话中的风险评估难题。申请截止日期为 9 月 21 日,获选提交完整提案的申请者将于 10 月 5 日收到通知。

    推荐理由:资助计划将资金与模型权限开放给独立研究者构建开源基准,有助于推动多轮对话中心理健康与情感依赖等复杂安全评估的标准化。

8月14日周五
  1. 智谱 公众号82

    智谱发布 GLM-5.3,提升编程与网络安全防御能力

    智谱正式发布新模型 GLM-5.3,在与 GLM-5.2 相同基座上通过强化学习与长程后训练扩展,显著提升了复杂编程与网络安全防御能力。该模型在 Terminal-Bench 3.0 等基准上取得开源领先,并协助安全团队挖掘出多项高危系统与底层协议漏洞;相关能力已接入 ZCode 等工具,完整模型权重计划在两周内开源。

    推荐理由:原文阐述了基于相同基座进行后训练扩展的技术路径,为开发者评估大模型在代码工程与网络安全防御中的实际可用性提供了参考。

7月16日周四
  1. Hugging Face89

    Hugging Face 披露 2026 年 7 月安全入侵事件

    Hugging Face 披露其生产基础设施遭遇到由自主 AI 智能体系统驱动的入侵攻击,导致部分内部数据集及多组凭据发生未授权访问。攻击者利用数据集处理流程中的远程代码加载及模板注入漏洞获取初始权限并横向移动,公开模型、数据集和软件供应链未受篡改。官方已修复漏洞、轮换凭据并重建节点,并在调查中利用自建部署的开源模型分析了超 1.7 万条攻击日志,同时建议用户轮换访问 Token。

    推荐理由:官方披露了由自主智能体发动的多阶段入侵实况,为防御方提供了本地部署模型应对安全分析与护栏限制的可迁移经验。

6月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 AI 控制路线图以保障智能体系统安全

    Google DeepMind 发布 AI 控制路线图(AI Control Roadmap)与智能体安全技术框架,提出将潜在失齐的 AI 智能体视为内部威胁的系统级纵深防御体系。

    推荐理由:文章提出了将潜在失齐智能体视为内部威胁的系统级防御框架,为自主系统的实时监督与分级拦截提供了落地参考。

5月17日周日
  1. Google DeepMind65

    Google 扩展内容透明度与溯源工具,覆盖 Search、Gemini、Pixel 及云端 API

    Google 宣布全面扩展内容透明度与验证工具,在 Search、Gemini、Chrome、Pixel 及 Google Cloud 中深入集成 SynthID 水印与 C2PA 溯源技术。

    推荐理由:原文给出了从端侧拍摄到多平台搜索验证的技术落地细节,读者可以了解主流平台如何统一推进生成式内容溯源与真伪识别。