arXiv 机器学习· Hanwei Zhang, Tianma Hu, Gaojie Jin, Xu Cheng, Ronghui Mu·· 6 小时前AI 评分35
可解释但脆弱?几何与语义扰动下概念瓶颈模型的鲁棒性研究
Interpretable but Fragile? Robustness of Concept Bottlenecks under Geometric-Semantic Perturbations
AI 导读
研究团队提出一种基于生成器的评估框架,在隐空间连续几何扰动与概念空间离散语义干预下评估概念瓶颈模型(CBM)的鲁棒性。该框架结合经验敏感性指标与随机平滑认证方法,统一解释了此前关于 CBM 鲁棒性相互矛盾的研究结论。实验表明可解释性不会必然带来鲁棒性,概念瓶颈只是重新分配了敏感性在扰动空间中的表现形式。
来源:arXiv 机器学习 · arxiv.org