arXiv 自然语言处理· Tao Shi, Chaoyi Xiang, Qiongkai Xu, Jey Han Lau·· 5 小时前AI 评分44
OLMo-Detect:面向大语言模型成员推断的多阶段抗混杂评测基准
OLMo-Detect: A Multi-Stage, Confounder-Controlled Benchmark for Membership Inference on Large Language Models
AI 导读
研究者基于 OLMo 2 流程推出大语言模型成员推断评测基准 OLMo-Detect,覆盖预训练、中间训练与后训练多阶段,并通过 infini-gram 严格过滤非成员样本。在 OLMo 2 系列上评估 15 种无监督和 3 种监督攻击(MIA)显示,最佳 MIA 的 AUC 仅达 0.68,且无监督 MIA 对分布偏移均不具鲁棒性(AUC 偏移最高达 0.42)。
来源:arXiv 自然语言处理 · arxiv.org