跳到正文
原文
arXiv 自然语言处理· Bhavik Mangla·· 1 天前AI 评分61

研究提出语音智能体音频决策评测基准 VoxParity

Almost Human, Except When It Matters: VoxParity and the Decisions a Voice Should Change

AI 导读

研究提出语音智能体决策评测基准 VoxParity,测试系统能否依据音频中的声音线索而非仅靠文本转写做出正确的工具调用决策。该基准构建了来自 14 个行业的 183 个场景,在转写文本保持不变的前提下改变音频内容,结果显示 23 个参评系统中仅 11 个通过纯文本零假设检验。当音频线索要求触发安全保护时,受测系统普遍倾向于依赖字面意思执行常规请求,相关代码与评测数据已公开。

来源:arXiv 自然语言处理 · arxiv.org