跳到正文
原文
arXiv 机器学习· Joss Armstrong·· 3 小时前AI 评分41

合成数据溯源研究:来源识别不等于适用性测试

Source Identification Is Not Fitness Testing: Measuring the Limits of Synthetic-Data Attribution

AI 导读

一项关于合成数据溯源的研究表明,数据来源识别与判断其是否适合模型训练是两个独立的问题。实验显示,生成来源归属准确率在原始文本上达 98.7%,但在意译和风格重写后分别降至 53.1% 与 29.0%。在 3 轮生成与重训练测试中,基于来源信息的样本筛选并未能有效减缓模型的退化。

来源:arXiv 机器学习 · arxiv.org