AIDC
← 返回全部动态
arXiv 自然语言处理AI 评分 63/10009月29日 12:00

IndicFDB:面向印度十种语言的全双工语音智能体评测基准

全双工语音智能体需在实时交互中处理停顿、轮次交替、反馈应答及打断。现有评测基准Full-Duplex-Bench局限于英语且高度依赖词级时间戳ASR与英文LLM裁判。研究团队提出IndicFDB基准,将其拓展至10种印度主要语言,包含12350个样本(规模约为原基准的17倍),并针对多语种语音交互事件检测及缺乏高精度词级对齐下的时序评估等难题提出了针对性方案。

推荐理由填补了非英语多语种全双工语音交互评测基准的空白,对低资源语言实时语音智能体研究有参考价值。

原标题:IndicFDB: Benchmarking Full-Duplex Voice Agents across Indian Languages

阅读 arXiv 自然语言处理 原文 ↗

同一事件的其他来源

arXiv 人工智能09月28日 12:00

实时语音智能体评估:从组件质量到实际落地效果

随着实时语音智能体从研究走向实际部署,其评估标准仍割裂在语音基础模型、轮次转换心理语言学与智能体基准三个领域之间。架构论文常关注延迟,轮流对话研究关注预测准确度,而智能体基准则侧重任务成功率,缺乏统一评价体系。该论文通过梳理38篇核心文献,提出了系统性的三维评估证据链框架,旨在为实际部署的实时语音智能体提供从单点性能到落地效果的全流程评估方法。