跳到正文
原文
arXiv 自然语言处理· Jonathan Graehl·· 1 天前AI 评分45

以 Encoder 速度实现高精度多语言隐私标注

Strong Multilingual Privacy Tagging at Encoder Speed

AI 导读

研究团队提出一种基于多语言 Encoder 与仿射 span 标注头的隐私实体标注方法,在 35 种语言数据上微调以实现高速精准脱敏。在 7 种语言测试集上,该模型脱敏 F1 达到 88.8,显著优于 GLiNER2(69.1)、Microsoft Presidio(57.3)及 OpenAI Privacy Filter 微调模型(35.8)。

来源:arXiv 自然语言处理 · arxiv.org