基于语音大模型的推理期目标说话人遗忘识别技术
该研究针对多说话人场景提出了目标说话人遗忘自动语音识别(TSU-ASR)任务,以满足特定用户不希望自身语音被转录的隐私需求。系统需转录未退出的说话人内容,同时仅标记退出者的发音区间而不转录其文本。研究团队设计了一种轻量级的注册条件门控(ECG)模块,可直接附加到冻结的双流语音大模型上,在推理阶段动态实现对新增退出说话人的选择性遗忘与转录过滤。
推荐理由提出了一种在语音大模型推理期实现特定说话人隐私擦除的轻量级方案,兼具隐私保护与工程实用性。
原标题:Inference-Time Target Speaker Unlearning in LLM-Based Automatic Speech Recognition
阅读 arXiv 自然语言处理 原文 ↗