跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

29条精选相关主题多模态AI 视频产品更新

最新精选

第 21–29 条 · 共 29 条
8月4日周二
  1. 腾讯混元 公众号65

    腾讯混元发布语音识别模型 Hy ASR 3.0 preview

    腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 的 MoE 架构融合高精度语音识别与深度语义理解。在开源评测集中,其中文普通话 WER 为 3.34%、英语为 2.62%、粤语为 3.12%,并在复杂声学场景与长尾方言识别上获得专项优化。目前该模型已上线腾讯云 API 接口,并首发接入腾讯元宝 App。

    推荐理由:模型结合大语言模型底座与语音联合训练,展示了利用上下文语义提升复杂场景语音识别准确率的技术路径。

7月30日周四
  1. Google DeepMind64

    Google DeepMind 推出音乐生成模型 Lyria 3.5 并在 Google Flow Music 上线

    Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并正式在 Google Flow Music 中上线。新模型在旋律结构复杂度与自然度、歌词质量与结构感知、以及人声发音和情感表现力上均有提升。同时,它增强了创作控制能力,方便用户调整生成音频的节奏和时长。

    推荐理由:原文列举了旋律、歌词、人声表现力与节奏时长控制等维度的升级,读者可以据此评估 AI 音乐生成的可用性变化。

7月20日周一
  1. 通义实验室 公众号73

    通义实验室发布 Qwen-Audio-3.0-TTS 语音合成模型

    通义实验室正式发布实时语音合成模型 Qwen-Audio-3.0-TTS,推出首包延迟约 300ms 的 Flash 版与注重音色还原度的 Plus 版。模型覆盖 16 种语言及 20 种中文方言,支持自然语言指令控制与呼吸、笑场等结构化标签嵌入调控,单次合成支持最长 3 分钟并升级至 48kHz 音频输出,现已在阿里云百炼平台上线。

    推荐理由:模型提供兼顾实时与高音质的两个版本并支持指令控制情感,有助于开发者评估其在多语种及复杂场景的落地表现。

7月17日周五
  1. 通义实验室 公众号79

    通义实验室发布实时多模态交互模型 Wan-Streamer v0.2

    通义实验室发布实时双工全模态交互模型 Wan-Streamer v0.2,端到端响应延迟约 550ms,输出视频分辨率提升至 640×368 @ 25FPS。模型将传统流水线重构为基于 160ms 流式单元的原生因果流,并采用单卡 Thinker 与多卡 Performer 双通路硬件解耦与 Ulysses 序列并行机制,实现低延迟感知与重载视频生成的时序重叠。

    推荐理由:原文给出了双通路硬件解耦与时序重叠调度方案,展示了在大幅提升视频分辨率时维持超低交互延迟的具体工程路径。

7月15日周三
  1. Hugging Face60

    Hugging Face 推出 Real World VoiceEQ 语音 AI 评测基准

    Hugging Face 推出 Real World VoiceEQ 评测基准,旨在衡量语音 AI 在真实复杂对话中的拟人交互质量。该基准基于超过 100 万次人类评分,包含 78.5 万条 TTS 和 4.8 万条 STS 评分,涵盖 15 个以上评估维度与 60 多项指标,对 40 多个主流开源及专有模型展开了评测。

    推荐理由:该基准基于超百万次人类评分评估语音交互的拟人表现,揭示了传统指标高估现实能力的短板,为检验语音感知提供了新参考。

7月1日周三
  1. Hugging Face74

    Hugging Face 联合 Cerebras 推出基于 Gemma 4 的实时语音流水线

    Hugging Face 联合 Cerebras 推出开源端到端实时语音流水线,通过 Cerebras 加速推理消除语言模型的响应延迟瓶颈。该系统采用模块化设计,串联了 Nvidia Parakeet 语音识别、运行于 Cerebras 上的 Google DeepMind Gemma 4 31B 以及 Qwen3-TTS 语音合成。

    推荐理由:原文展示了结合开源模型与专用推理硬件的实时语音级联方案,读者可参考其模块化堆栈解决语音交互的长尾延迟问题。

6月9日周二
  1. Google DeepMind83

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate 支持 70 多种语言近实时语音互译

    Google DeepMind 正式发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时端到端流式语音互译,并在生成翻译时保留原说话人的语调、节奏和音高。

    推荐理由:模型突破了传统轮流对话式翻译的延迟限制,通过流式生成保留说话人语调与节奏,为实时跨语言沟通提供了新方案。

4月16日周四
  1. Google DeepMind75

    Google DeepMind 推出 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 正式推出文本转语音模型 Gemini 3.1 Flash TTS,支持原生多说话人对话与 70 多种语言。该模型引入了音频标签功能,允许用户在输入文本中嵌入自然语言指令来精确控制语音风格、语速与停顿,在 Artificial Analysis TTS 榜单上取得了 1211 的 Elo 分数。

    推荐理由:模型引入自然语言音频标签来实现句中语气与语速控制,为开发者精细调节多角色拟真对话提供了直接参考。