基于语音大模型的推理期目标说话人遗忘识别技术
该研究针对多说话人场景提出了目标说话人遗忘自动语音识别(TSU-ASR)任务,以满足特定用户不希望自身语音被转录的隐私需求。系统需转录未退出的说话人内容,同时仅标记退出者的发音区间而不转录其文本。研究团队设计了一种轻量级的注册条件门控(ECG)模块,可直接附加到冻结的双流语音大模型上,在推理阶段动态实现对新增退出说话人的选择性遗忘与转录过滤。
该研究针对多说话人场景提出了目标说话人遗忘自动语音识别(TSU-ASR)任务,以满足特定用户不希望自身语音被转录的隐私需求。系统需转录未退出的说话人内容,同时仅标记退出者的发音区间而不转录其文本。研究团队设计了一种轻量级的注册条件门控(ECG)模块,可直接附加到冻结的双流语音大模型上,在推理阶段动态实现对新增退出说话人的选择性遗忘与转录过滤。