热点事件观察中
研究者提出无需ASR的流式语音端点检测模型FD-VAD
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年9月30日,arXiv刊载研究提出面向流式全双工语音的语义端点检测模型FD-VAD。该模型无需依赖自动语音识别(ASR),可将因果音频窗口直接映射为Continue或Stop决策,以实现全双工语音交互中的语义端点判断。在模型设计上,FD-VAD结合了冻结语音编码器、轻量适配器与参数高效语言模型,并引入了置信度门控端点提交与边界难负例采样机制。在TurnBench开发集的零样本评测中(FP<=0.10),FD-VAD取得了合格系统中最高的0.853 EOT召回率。
AI 根据报道生成 · 2 小时前更新
最新进展9月30日 12:00
研究者发布FD-VAD模型,在TurnBench零样本评测中取得0.853最高EOT召回率。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv 自然语言处理FD-VAD:面向流式全双工语音的语义端点检测
FD-VAD 是一种无需 ASR 的流式端点检测器,可将因果音频窗口直接映射为 Continue 或 Stop 决策,实现全双工语音交互的语义端点判断。模型结合冻结语音编码器、轻量适配器与参数高效语言模型,并引入置信度门控端点提交与边界难负例采样。在 TurnBench 开发集零样本评测中(FP<=0.10),FD-VAD 取得合格系统最高的 0.853 EOT 召回率。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。