跳到正文
原文
arXiv 人工智能· Marco Biroli·· 2 天前AI 评分43

逃逸对齐:Best-of-N 越狱攻击的物理势阱模型

Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking

AI 导读

研究提出一种基于热激活势垒的物理模型来解析大模型 Best-of-N(BoN)越狱攻击,仅用 4 个可解释参数即可确定包含增强数 N、采样数 M 和生成温度 T 的完整攻击面。该模型纠正了攻击成功率(ASR)遵循幂律的传统假设,能将 N ≤ 100 的预测外推至 N = 10^4,并成功将 5 个不同模型的数据收敛至同一缩放函数。

来源:arXiv 人工智能 · arxiv.org