arXiv 人工智能· Terumi Chiba, Guangzhi Sun, Zheqi Yuan, Chao Zhang·· 5 小时前AI 评分38
Talk2Agent:文本智能体语音接口评测基准
Talk2Agent: Benchmarking Voice Interfaces for Text Agents
AI 导读
Talk2Agent 是一项用于评估语音接口向 LLM 计算机使用智能体传达口语指令有效性的评测基准。它基于 WildClawBench 和 OSWorld 构建真实语音任务,并提出了无需重复运行复杂任务的免执行评估框架。在 32 小时真实语音测试中,该框架与下游任务完成度紧密关联,皮尔逊相关系数较传统 WER/CER 提升了 0.246。
来源:arXiv 人工智能 · arxiv.org