arXiv 人工智能· Adam Elimadi·· 13 小时前AI 评分33
表征简洁性与回路规模存在阈值依赖的分离:基于对抗训练的对照测试
Representational Simplicity and Circuit Size Dissociate in a Threshold-Dependent Way: A Controlled Test via Adversarial Training
AI 导读
研究人员基于 GPT-2 Small 通过对抗训练开展对照测试,探究表征简洁性是否等同于因果回路层面的简洁性。测试显示鲁棒模型具有更高的稀疏自编码器(SAE)可解构性,并在任务归因中涉及更少 SAE 特征。因果回路规模呈现阈值依赖性,鲁棒模型在 90% 与 95% 的高忠实度下所需回路边数显著更少。
来源:arXiv 人工智能 · arxiv.org