arXiv 自然语言处理· Jonathan Graehl·· 1 天前AI 评分45
以 Encoder 速度实现高精度多语言隐私标注
Strong Multilingual Privacy Tagging at Encoder Speed
AI 导读
研究团队提出一种基于多语言 Encoder 与仿射 span 标注头的隐私实体标注方法,在 35 种语言数据上微调以实现高速精准脱敏。在 7 种语言测试集上,该模型脱敏 F1 达到 88.8,显著优于 GLiNER2(69.1)、Microsoft Presidio(57.3)及 OpenAI Privacy Filter 微调模型(35.8)。
来源:arXiv 自然语言处理 · arxiv.org