Hugging Face 推出开源语音合成评测榜单 Open TTS Leaderboard
Hugging Face 正式上线 Open TTS Leaderboard,旨在通过自动化客观指标为开源多语种文本转语音(TTS)与声音克隆模型提供可扩展的标准化评测。
推荐理由:原文详细说明了自动化客观指标如何解决人工竞技场在开源语音模型评测中扩展性不足的问题,便于开发者快速对比多语种模型的延迟与清晰度。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
Hugging Face 正式上线 Open TTS Leaderboard,旨在通过自动化客观指标为开源多语种文本转语音(TTS)与声音克隆模型提供可扩展的标准化评测。
推荐理由:原文详细说明了自动化客观指标如何解决人工竞技场在开源语音模型评测中扩展性不足的问题,便于开发者快速对比多语种模型的延迟与清晰度。
东京地方法院裁定未经授权使用 AI 克隆演员声音进行商业变现侵犯了其公开权,成为日本首例保护个人声音标识免受 AI 侵权的司法判决。该诉讼由知名声优津田健次郎提起,指控一匿名 TikTok 账号在 188 条视频中克隆其标志性音色并以此获利。法院认定声音与肖像一样象征人格并受法律保护,但因涉事账号已在起诉后自行删除视频,驳回了要求平台删视频的诉求。
推荐理由:判决明确了日本法院首次将声音纳入公开权保护范畴的法律依据,为生成式 AI 声音克隆的商业侵权界定提供了司法参考。
豆包输入法正式补齐 HarmonyOS NEXT 与 Windows 版本,实现 iOS、Android、HarmonyOS NEXT、macOS 及 Windows 五大平台全覆盖。新版本支持账号多端实时对齐个人词库、跨设备文字与图片超级互传,并升级了气声与方言识别、离线语音以及长语音结构化文字整理功能。此外,键盘端还加入了行内计算、语义续写及手势快捷删除等交互特性。
推荐理由:原文详细梳理了跨端词库同步与 AI 文字整理等实测细节,展示了端侧大模型如何降低日常多设备输入阻力。
vLLM 团队发布了 vLLM-Omni 针对语音合成(TTS)模型的全套推理优化方案,支持 Qwen3-TTS、VoxCPM2、Higgs Audio V3 和 Fish Speech S2 Pro。
推荐理由:文章详细拆解了四种不同架构 TTS 模型的推理瓶颈与定制优化方案,为多模态语音服务部署提供了系统的工程参考。
vLLM-Omni 针对 Qwen3-Omni 提出了涵盖阶段拆分、CUDA Graph、异步分块传输、异步输出与按需副本扩展的全栈在线推理优化方案。该方案将 Thinker(多模态推理)、Talker(Codec 预测)与 Code2Wav(波形重建)流水线解耦,消除了跨阶段全载荷等待与 Python 调度开销。
推荐理由:文章拆解了语音多模态模型分阶段推理的延迟瓶颈,所提出的异步流水线与阶段级扩展方案可直接迁移至同类实时全模态架构。
ElevenLabs 正式发布文本转语音模型 Eleven v4 及其低延迟版本 Eleven v4 Turbo,采用全新架构以提升语调、节奏与情绪表现力。模型支持通过自然语言提示词及行内标签精细控制情绪和音效,并覆盖超过 90 种语言的多语种克隆;Eleven v4 Turbo 中位推理延迟约 100ms、首字发音中位时间约 150ms,重点面向实时对话智能体场景。
推荐理由:新模型在保留音色一致性的基础上强化了多角色对话情绪表达,为实时语音智能体提供了低延迟参考方案。
ElevenLabs 正式发布 Eleven v4 语音模型及面向实时语音智能体的 Turbo 版本,能更精准地遵从笑声、耳语等脚本情绪与音效指令。新模型支持超过 90 种语言,单次请求最高支持 10,000 字符,发音基准得分提升至 91.7%,Turbo 版本响应延迟低至约 150 毫秒。两款模型现已上线 API、ElevenAgents 和 ElevenCreative,并推出限时折扣。
推荐理由:新架构提升了长文本一致性与情感指令遵从度,配合 150 毫秒低延迟的 Turbo 版本,适合兼顾表现力与实时交互的语音场景。
Google 在 ADK 中引入了原生实时评测功能,支持利用模拟用户以音频交互驱动实时语音智能体并自动打分。评测体系支持动态情景模拟与固定脚本两种用例,结合 Gemini TTS 合成多种音色输入,并通过基于规则的 LLM 评委对多轮轨迹和工具调用质量进行判定。开发者可通过 CLI 运行评测将其接入 CI/CD 流程,也可在 ADK Web 中查看逐轮文字转录与可内嵌播放的音频回放。
推荐理由:文章演示了在 ADK 中通过模拟用户与 LLM 裁判端到端评测实时语音智能体的工作流,便于开发者将语音交互测试接入工程化流水线。
意大利最大银行 Intesa Sanpaolo 旗下私人银行部门 Fideuram 总裁遭遇 WhatsApp 伪造信息与 Deepfake 语音组合诈骗,导致该机构转出 9500 万欧元(约 1.08 亿美元)巨款。诈骗分子使用 AI 模型仿冒律所高级合伙人声音诱导转账至中国大陆与香港账户,事后该高管辞职。在多国机构协助下已追回 5300 万欧元,其余款项被洗入加密货币。
推荐理由:该案例展现了针对金融高管的深度伪造语音与即时通信组合欺诈链条,可作为评估生成式 AI 对大额资金审批风控影响的参考。
腾讯正式上线“腾讯Hy翻译” APP,同步支持小程序、插件和 PC 端体验。该应用基于腾讯混元 Hy-MT2 翻译模型构建,支持 33 种语言互译及 5 种中国少数民族语言与方言,提供语音翻译、拍照翻译以及通过本地模型实现的离线翻译功能,已在美国、日韩、东南亚多国及中国港澳台等 12 个国家和地区推出。
推荐理由:该应用基于混元翻译模型提供了离线端侧能力,读者可以据此了解其在无网出国场景下的实用表现。
Simon Willison 推出交互式测试工具 Gemini 3.8 TTS Playground,支持用户接入自身 API Key 测试 Google 新发布的 gemini-3.8-flash-tts 与 gemini-3.8-flash-lite-tts 文本转语音模型。
推荐理由:该工具提供了多说话人对话配置与 URL 分享能力,读者可以直接接入自身 API Key 体验并评估 Google 语音模型的生成速度与成本。
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音并逐行掌控对话演绎。
推荐理由:两款模型将语音生成拓展至基于自然语言的精细表演控制与多角色编排,为多语种配音和语音智能体开发提供了高可控性方案。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款近实时对话模型,主打面向企业与开发者的端到端语音智能体构建。
推荐理由:两款模型展示了近实时语音交互与后台复杂推理并行执行的技术路径,为构建低延迟端到端语音智能体提供了参考基准。
阶跃星辰正式发布 StepAudio 3 系列语音大模型,涵盖 Realtime、ASR、TTS、Gen 和 Music 五款模型并上线开放平台。
推荐理由:原文给出了五款音频模型在实时交互与全链路生成上的评测表现,读者可以据此了解原生语音模型在复杂任务中的落地能力。
OpenAI 正式在 API 中推出 GPT-Live-1 模型,为开发者提供自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信集成。
推荐理由:该模型将全双工语音对话接入API并提供电话支持,方便开发者直接构建实时语音交互应用。
Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,提供实时双向流式与预录音频处理两条 API 路线,支持 85 种以上语言并具备口误自我修正与填充词过滤能力。
推荐理由:新模型将实时语音转录与格式化及工具调用结合,展现了语音识别向上下文理解与工作流调度演进的具体路径。
Hugging Face 发布研究评估了 11 款主流开源 ASR 模型的基准过拟合现象,发现部分低 WER 高分模型会依据声学线索复现基准参考文本中的错误甚至补全被静音的数字。研究设计了参考文本不一致、掩码实体检索和正字法切换三项测试,并在 Open ASR Leaderboard 上线了基准拟合分析标签页与开源脚本。
推荐理由:研究设计了量化 ASR 模型刷榜过拟合的具体探针方法,读者可据此审视公开基准分数的真实泛化能力。
Google Research 与 Google DeepMind 推出基于 Gemini 和 Project Astra 的医疗 AI 系统 AMIE (Video),实现了专家级实时音视频临床问诊。
推荐理由:研究通过解耦对话、规划与感知的异步多智能体架构,首次实现了音视频多模态下的实时医疗问诊与查体引导。
NVIDIA 推出 364M 参数的开源多语言文本转语音模型 Magpie TTS Multilingual,开放模型权重并提供生产就绪的 NIM 推理微服务。
推荐理由:模型开源权重并提供生产级推理微服务,帮助开发者在私有基础设施上自控语音延迟预算与定制发音。
腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 的 MoE 架构融合高精度语音识别与深度语义理解。在开源评测集中,其中文普通话 WER 为 3.34%、英语为 2.62%、粤语为 3.12%,并在复杂声学场景与长尾方言识别上获得专项优化。目前该模型已上线腾讯云 API 接口,并首发接入腾讯元宝 App。
推荐理由:模型结合大语言模型底座与语音联合训练,展示了利用上下文语义提升复杂场景语音识别准确率的技术路径。