arXiv 机器学习· Lena Libon, Alexander Panfilov, Ben Rank, Xin Chen, Jonas Geiping, Maksym Andriushchenko·· 5 小时前AI 评分52
arXiv 论文提出对抗探针训练的对齐方法:在提升模型安全性的同时保留可监控性
Alignment via Training Against Probes Without Losing Monitorability
AI 导读
研究团队提出基于探针引导的微调方法,利用检测模型内部激活中不良属性的探针作为直接训练信号进行对齐。实验显示,采用持续更新的动态探针能显著降低有害性并提升真实性,在安全与实用性权衡上优于 DPO 和推理期引导,且对越狱与消融攻击更具鲁棒性。微调后目标概念仍保持线性编码,确保了对模型内部状态的持续监控能力。
来源:arXiv 机器学习 · arxiv.org