arXiv 自然语言处理· David Porte\v{s}, Ale\v{s} Hor\'ak·· 4 小时前AI 评分34
Prosody-to-Text:从低通滤波语音预测文本
Prosody-to-Text: Predicting text from low-pass filtered speech
AI 导读
研究人员探索了 Prosody-to-Text 任务,仅使用 12 个最低 Mel 频段(约 450Hz 截止频率低通滤波)微调 Whisper 模型,成功从语音韵律中预测文本。实验取得 36% 的 WER,10% 的话语实现完全恢复,40% 的话语 WER ≤ 25%,且在给定正确前缀时预测下一 token 的准确率达 79%。
来源:arXiv 自然语言处理 · arxiv.org