跳到正文
热点事件持续更新

大模型安全对齐框架DNAlign发布并开源代码

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月5日,arXiv发布了关于大语言模型安全对齐框架DNAlign的研究成果。DNAlign是一种轻量级对齐框架,结合了控制论优化与零空间投影技术。该框架通过将可控扰动限制在有害相关子空间中以保留模型的通用能力,并利用基于人类偏好训练的价值函数自适应优化控制信号。在多个大语言模型基座上的测试结果表明,DNAlign在显著减少有害输出的同时,保持了流畅度、事实准确性与生成多样性。目前,该项目的相关代码已开源。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv 人工智能
    DNAlign:大语言模型的动态零空间安全对齐框架

    DNAlign 是一种结合控制论优化与零空间投影的轻量级 LLM 安全对齐框架。该框架将可控扰动限制在有害相关子空间以保留通用能力,并通过基于人类偏好训练的价值函数自适应优化控制信号。在多个 LLM 基座上的测试表明,其在显著减少有害输出的同时保持了流畅度、事实准确性与生成多样性,相关代码已开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。