跳到正文
原文
arXiv 人工智能· Adam Elimadi·· 13 小时前AI 评分33

表征简洁性与回路规模存在阈值依赖的分离:基于对抗训练的对照测试

Representational Simplicity and Circuit Size Dissociate in a Threshold-Dependent Way: A Controlled Test via Adversarial Training

AI 导读

研究人员基于 GPT-2 Small 通过对抗训练开展对照测试,探究表征简洁性是否等同于因果回路层面的简洁性。测试显示鲁棒模型具有更高的稀疏自编码器(SAE)可解构性,并在任务归因中涉及更少 SAE 特征。因果回路规模呈现阈值依赖性,鲁棒模型在 90% 与 95% 的高忠实度下所需回路边数显著更少。

来源:arXiv 人工智能 · arxiv.org