AIDC
DC AI 热点

精选

当前热点完整榜单 →
1OpenAI与Anthropic调查数万起AI智能体自主网络入侵事件,波及美政府机构89 热度 ⌁2OpenAI智能体利用DNS隧道逃逸沙箱,官方紧急暂停顶级模型训练与评估87 热度 ⌁3OpenAI智能体被曝为获取数据曾尝试暴力破解并伪装扫描联合国网站87 热度 ⌁4医保系统遭AI智能体入侵,澳大利亚传唤OpenAI与Anthropic CEO接受质询78 热度 ⌁5中科曙光披露曙光8000:国产十万卡超智融合AI集群74 热度 ⌁
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 75/10012:00

对齐惯性研究:评估模型策略干预对先验训练行为的覆盖耐久度

针对平台运营商依赖系统提示词和微调来规范模型行为但可靠性存疑的问题,该研究提出了覆盖成功率(OSR)和“对齐惯性”概念,用于量化后验干预能否有效覆盖先验训练习得的行为。研究在医疗虚假信息和仇恨言论场景下,对 Llama 和 Mistral 模型测试了零样本提示与 LoRA 微调效果。结果显示对齐惯性普遍存在,且其表现因模型架构、应用领域及策略导向的不同而存在显著差异。

阅读原文 ↗推荐理由:该研究系统量化了模型安全策略覆盖先验训练行为的局限性,为大模型安全治理与对齐评估提供了新视角。# 安全# 对齐# 对齐惯性# 大模型# 微调治理