跳到正文
原文
arXiv 人工智能· Jisheng Dang, Yushuo Zhao, Dewei Liu, Junfeng Fang, Bimei Wang, Tiantian Rao, Hong Peng, Bin Hu, Tat-Seng Chua·· 4 小时前AI 评分34

DNAlign:大语言模型的动态零空间安全对齐框架

DNAlign: Dynamic Null-Space Safe Alignment for LLMs

AI 导读

DNAlign 是一种结合控制论优化与零空间投影的轻量级 LLM 安全对齐框架。该框架将可控扰动限制在有害相关子空间以保留通用能力,并通过基于人类偏好训练的价值函数自适应优化控制信号。在多个 LLM 基座上的测试表明,其在显著减少有害输出的同时保持了流畅度、事实准确性与生成多样性,相关代码已开源。

来源:arXiv 人工智能 · arxiv.org