跳到正文
原文
arXiv 自然语言处理· Andrea Li (UC Berkeley), Soham Ray (Sierra AI)·· 2 天前AI 评分46

mu-bench:多语言话语转写评测基准

mu-bench: A Multilingual Utterance Transcription Benchmark

AI 导读

研究团队推出多语言语音转写评测基准 mu-bench,包含面向 AI 银行智能体的英语、西班牙语、土耳其语、越南语和普通话 5 种语言共 4,270 条真实通话话语。该基准同步提出基于 LLM judge 的语义评估指标 UER,与人类标注者的一致性达 κ = 0.78;公开排行榜评测了 6 家商业供应商,其中最佳 UER 达 11.9%,且普通话转写难度最高。

来源:arXiv 自然语言处理 · arxiv.org