跳到正文
7月17日周五
  1. 通义实验室 公众号79

    通义实验室发布实时多模态交互模型 Wan-Streamer v0.2

    通义实验室发布实时双工全模态交互模型 Wan-Streamer v0.2,端到端响应延迟约 550ms,输出视频分辨率提升至 640×368 @ 25FPS。模型将传统流水线重构为基于 160ms 流式单元的原生因果流,并采用单卡 Thinker 与多卡 Performer 双通路硬件解耦与 Ulysses 序列并行机制,实现低延迟感知与重载视频生成的时序重叠。

    推荐理由:原文给出了双通路硬件解耦与时序重叠调度方案,展示了在大幅提升视频分辨率时维持超低交互延迟的具体工程路径。

7月15日周三
  1. Hugging Face60

    Hugging Face 推出 Real World VoiceEQ 语音 AI 评测基准

    Hugging Face 推出 Real World VoiceEQ 评测基准,旨在衡量语音 AI 在真实复杂对话中的拟人交互质量。该基准基于超过 100 万次人类评分,包含 78.5 万条 TTS 和 4.8 万条 STS 评分,涵盖 15 个以上评估维度与 60 多项指标,对 40 多个主流开源及专有模型展开了评测。

    推荐理由:该基准基于超百万次人类评分评估语音交互的拟人表现,揭示了传统指标高估现实能力的短板,为检验语音感知提供了新参考。

7月6日周一
  1. 通义实验室 公众号54

    通义实验室发布 Fun-ASR-Realtime 实时语音识别模型

    通义实验室发布 Fun-ASR-Realtime 语音识别模型,单模型支持 30 种语言与 16 种方言,并在工业级方言测评中取得 87.8% 的语义准确率。该模型采用流式与非流式一体化训练,首字延迟控制在百毫秒级,支持动态注入热词与对话上下文以实现同音词和领域词消歧,相关 API 已上线阿里云百炼平台。

7月1日周三
  1. Hugging Face74

    Hugging Face 联合 Cerebras 推出基于 Gemma 4 的实时语音流水线

    Hugging Face 联合 Cerebras 推出开源端到端实时语音流水线,通过 Cerebras 加速推理消除语言模型的响应延迟瓶颈。该系统采用模块化设计,串联了 Nvidia Parakeet 语音识别、运行于 Cerebras 上的 Google DeepMind Gemma 4 31B 以及 Qwen3-TTS 语音合成。

    推荐理由:原文展示了结合开源模型与专用推理硬件的实时语音级联方案,读者可参考其模块化堆栈解决语音交互的长尾延迟问题。

6月9日周二
  1. Google DeepMind83

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate 支持 70 多种语言近实时语音互译

    Google DeepMind 正式发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时端到端流式语音互译,并在生成翻译时保留原说话人的语调、节奏和音高。

    推荐理由:模型突破了传统轮流对话式翻译的延迟限制,通过流式生成保留说话人语调与节奏,为实时跨语言沟通提供了新方案。

4月16日周四
  1. Google DeepMind75

    Google DeepMind 推出 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 正式推出文本转语音模型 Gemini 3.1 Flash TTS,支持原生多说话人对话与 70 多种语言。该模型引入了音频标签功能,允许用户在输入文本中嵌入自然语言指令来精确控制语音风格、语速与停顿,在 Artificial Analysis TTS 榜单上取得了 1211 的 Elo 分数。

    推荐理由:模型引入自然语言音频标签来实现句中语气与语速控制,为开发者精细调节多角色拟真对话提供了直接参考。