arXiv 人工智能· Joshua Meyer, Sahar Shayegan, Ritiz Tambi, Ali Khan, Sun Kim, Victor Shih, Mehdi Jamei, Andi Partovi·· 6 小时前AI 评分54
语音智能体仿真评测基准 VAmoS Energy 发布
VAmoS Part Deux: Harder, More Realistic Voice-Agent Simulation
AI 导读
研究团队推出语音智能体仿真评测基准 VAmoS Energy,包含 100 场涉及多请求、身份核验和 16 种后台工具调用的公用事业账单通话。在 14 种语音技术栈的测试中,任务完成率介于 17.3% 至 44.7% 之间,Grok Voice 处于领先位置,Gemini 3.8 Live 与 GPT-Live 紧随其后。
来源:arXiv 人工智能 · arxiv.org