arXiv 机器学习· Domenic Rosati, Alessa Carbo, Ali Dadsetan, Hong Huang, Matthew Young, Subhabrata Majumdar, Frank Rudzicz, Hassan Sajjad·· 6 小时前AI 评分38
移除信息内容无法保证开源权重模型的防篡改能力
Removing Information Content Does Not Certify Tamper Resistance in Open-Weight Models
AI 导读
研究表明仅靠在发布时降低互信息或移除有害信息,无法普遍保证开源权重模型能抵御微调攻击。保功能重参数化会在不改变信息量的情况下改变梯度下降几何结构,特定构造甚至在互信息为 0 的情况下仅用 1 步梯度即可恢复能力。这表明对模型防篡改性的认证必须引入发布时互信息之外的攻击动态约束。
来源:arXiv 机器学习 · arxiv.org