跳到正文
热点事件观察中

研究者提出无需ASR的流式语音端点检测模型FD-VAD

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年9月30日,arXiv刊载研究提出面向流式全双工语音的语义端点检测模型FD-VAD。该模型无需依赖自动语音识别(ASR),可将因果音频窗口直接映射为Continue或Stop决策,以实现全双工语音交互中的语义端点判断。在模型设计上,FD-VAD结合了冻结语音编码器、轻量适配器与参数高效语言模型,并引入了置信度门控端点提交与边界难负例采样机制。在TurnBench开发集的零样本评测中(FP<=0.10),FD-VAD取得了合格系统中最高的0.853 EOT召回率。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv 自然语言处理
    FD-VAD:面向流式全双工语音的语义端点检测

    FD-VAD 是一种无需 ASR 的流式端点检测器,可将因果音频窗口直接映射为 Continue 或 Stop 决策,实现全双工语音交互的语义端点判断。模型结合冻结语音编码器、轻量适配器与参数高效语言模型,并引入置信度门控端点提交与边界难负例采样。在 TurnBench 开发集零样本评测中(FP<=0.10),FD-VAD 取得合格系统最高的 0.853 EOT 召回率。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。