跳到正文
原文
arXiv 自然语言处理· Muhammad Usama, Dong Eui Chang·· 1 天前AI 评分64

研究揭示系统提示词机制:安全指令难以深入重构大语言模型内部表征

The System Prompt Illusion: How Instruction Preambles Modify Computation in Language Models

AI 导读

一项针对 17 个指令微调模型的研究发现,角色与格式类系统提示词会深度重构中间层表征,而安全指令对内部计算的改变极小,甚至与极简基线无统计学差异。实验显示限制性安全指令与完全放开限制的指令激活了几乎相同的计算路径,平均 CKA 相关度达 0.997,且该现象在 70B-72B 规模下依然存在。

来源:arXiv 自然语言处理 · arxiv.org