冻结BERT中AI文本检测神经元的机制可解释性研究
该研究基于RAID基准,利用稀疏探测与激活修补等机制可解释性方法,探究冻结的BERT编码器如何实现AI生成文本检测。通过对涵盖基座与指令微调等6种生成模型的测试分析,研究覆盖了12层共9216个CLS隐藏状态维度。实验发现,每个文本生成器仅需不到1%的稳定神经元集合即可支撑AI文本检测,揭示了检测器内部表征的高度稀疏性。
推荐理由采用机制可解释性方法定位判别模型中的关键神经元,对理解AI文本检测机制具有一定学术参考价值。
原标题:A Mechanistic Study of AI-Text Detection Neurons in Frozen BERT: Sparse Probing and Activation Patching on RAID
阅读 arXiv 自然语言处理 原文 ↗