arXiv 自然语言处理· Haohan Yuan, Simin Chen, Xi Niu, Hanqing Guo, Depeng Xu, Haopeng Zhang·· 1 天前AI 评分43
通过定向重写伪造大语言模型作者指纹
Forging LLM Authorship Fingerprints with Targeted Rewriting
AI 导读
研究提出 ForgePrint 框架,通过定向重写将大语言模型的输出伪造为目标模型的写作指纹,并蒸馏至单次推理的 4B Student 模型。在 CNN/DM 上,该 4B 模型面对留出分类器实现了 70.2% 的目标成功率,优于 Teacher 模型的 54.1% 和最佳基线的 39.3%。在将开源模型摘要伪造为商业模型时成功率达 68.3%,表明纯文本指纹归属易被定向重写误导。
来源:arXiv 自然语言处理 · arxiv.org