arXiv 人工智能· Faezeh Dehghan Tarzjani, Mevan Wijewardena, Alexander Romanus, Sampad Mohanty·· 1 天前AI 评分39
从局部证据到安全判决:视觉语言模型中的因果追踪
From Local Evidence to Safety Verdicts: Causal Tracing in Vision-Language Models
AI 导读
研究人员提出基准数据集 SSU-Bench,通过因果追踪揭示了 3 个视觉语言模型将图文线索转化为联合安全判决的内部机制。实验发现,在修改输入位置进行状态干预在较早解码器层有效,而对最终输入 token 的干预在较晚层生效。此外,最终 token 状态的线性读取可预测模型自身判决(包含错误判断),且跨模型呈现出相似规律。
来源:arXiv 人工智能 · arxiv.org