跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 61–63 条 · 共 63 条
7月16日周四
  1. Hugging Face89

    Hugging Face 披露 2026 年 7 月安全入侵事件

    Hugging Face 披露其生产基础设施遭遇到由自主 AI 智能体系统驱动的入侵攻击,导致部分内部数据集及多组凭据发生未授权访问。攻击者利用数据集处理流程中的远程代码加载及模板注入漏洞获取初始权限并横向移动,公开模型、数据集和软件供应链未受篡改。官方已修复漏洞、轮换凭据并重建节点,并在调查中利用自建部署的开源模型分析了超 1.7 万条攻击日志,同时建议用户轮换访问 Token。

    推荐理由:官方披露了由自主智能体发动的多阶段入侵实况,为防御方提供了本地部署模型应对安全分析与护栏限制的可迁移经验。

6月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 AI 控制路线图以保障智能体系统安全

    Google DeepMind 发布 AI 控制路线图(AI Control Roadmap)与智能体安全技术框架,提出将潜在失齐的 AI 智能体视为内部威胁的系统级纵深防御体系。

    推荐理由:文章提出了将潜在失齐智能体视为内部威胁的系统级防御框架,为自主系统的实时监督与分级拦截提供了落地参考。

5月17日周日
  1. Google DeepMind65

    Google 扩展内容透明度与溯源工具,覆盖 Search、Gemini、Pixel 及云端 API

    Google 宣布全面扩展内容透明度与验证工具,在 Search、Gemini、Chrome、Pixel 及 Google Cloud 中深入集成 SynthID 水印与 C2PA 溯源技术。

    推荐理由:原文给出了从端侧拍摄到多平台搜索验证的技术落地细节,读者可以了解主流平台如何统一推进生成式内容溯源与真伪识别。