将语言模型融入 MEG 聆听与想象语音解码
研究提出在对比神经解码器训练和神经约束束搜索推理两个阶段将语言模型融入 MEG 语音解码,以提升跨被试的聆听与想象语音解码表现。实验结果显示,想象语音解码从语言模型中的获益显著大于聆听语音解码,且相比仅依赖神经信号解码带来更大增益。这表明语言先验在神经证据较弱时尤为有效,对开发想象语音脑机接口具有重要价值。
研究提出在对比神经解码器训练和神经约束束搜索推理两个阶段将语言模型融入 MEG 语音解码,以提升跨被试的聆听与想象语音解码表现。实验结果显示,想象语音解码从语言模型中的获益显著大于聆听语音解码,且相比仅依赖神经信号解码带来更大增益。这表明语言先验在神经证据较弱时尤为有效,对开发想象语音脑机接口具有重要价值。
研究人员利用机制可解释性的激活补丁技术,揭示了脑机语音解码器处理发声、模仿和想象语音时的内部表征机制。实验发现跨模态增益来自小神经元群而非单个神经元,且这些神经元在解码器早期具有模态特异性、后期则高度重叠。该发现表明可通过强化后期共享表征,主要利用发声数据提升隐匿语音解码的数据效率。
该研究提出了一种通过将易幻觉文本合成为正样本语音来抑制 Whisper 幻觉的方法,避免了单纯添加无语音音频导致的真实语音误删问题。作者收集了 100 种语言的 40,891 个幻觉短语并构建了基准测试,最佳微调模型将静音环境下的幻觉率从 61.9% 降至 2.4%,同时将真实短语召回率从 69.8% 提升至 82.7%。相关评测基准、幻觉词表和合成语料已开源。
该研究探索了面向巴萨语(Basaà)的低资源自动语音识别(ASR)方法。尽管基于深度神经网络、Transformer 架构及自监督学习的 ASR 系统在英语和法语等高资源语言上已达到接近人类的表现,但全球绝大多数语言仍未能充分受益于这些技术突破。
研究人员推出开源基准 FA-Bench,在清晰及 4 种退化音频条件下统一评估了 21 个开源模型与 9 个商业 API 的强制对齐及 ASR 时间戳性能。评测采用基于容差的 F1 分数为主指标,消除了标准 MAE 带来的 9% 至 14% 分数虚高。结果显示现有系统普遍存在时间偏差,如 Whisper 提前约 150 ms,多个商业 API 滞后超 50 ms。
研究团队推出多语言语音转写评测基准 mu-bench,包含面向 AI 银行智能体的英语、西班牙语、土耳其语、越南语和普通话 5 种语言共 4,270 条真实通话话语。该基准同步提出基于 LLM judge 的语义评估指标 UER,与人类标注者的一致性达 κ = 0.78;公开排行榜评测了 6 家商业供应商,其中最佳 UER 达 11.9%,且普通话转写难度最高。
研究人员推出评测基准 IndicFDB,将全双工语音智能体评测扩展至 10 种印度语言,共包含 12,350 个样本。该基准从约 50,000 小时对话中挖掘停顿处理、轮次转换和搭话样本,并构建了人工验证的用户打断测试。在 7 个语音智能体的评测中,商业 API 难以同时兼顾速度与停顿鲁棒性,开源全双工模型也在搭话、质量与延迟间存在权衡。
豆包输入法正式补齐 HarmonyOS NEXT 与 Windows 版本,实现 iOS、Android、HarmonyOS NEXT、macOS 及 Windows 五大平台全覆盖。新版本支持账号多端实时对齐个人词库、跨设备文字与图片超级互传,并升级了气声与方言识别、离线语音以及长语音结构化文字整理功能。此外,键盘端还加入了行内计算、语义续写及手势快捷删除等交互特性。
推荐理由:原文详细梳理了跨端词库同步与 AI 文字整理等实测细节,展示了端侧大模型如何降低日常多设备输入阻力。
vLLM 团队发布了 vLLM-Omni 针对语音合成(TTS)模型的全套推理优化方案,支持 Qwen3-TTS、VoxCPM2、Higgs Audio V3 和 Fish Speech S2 Pro。
推荐理由:文章详细拆解了四种不同架构 TTS 模型的推理瓶颈与定制优化方案,为多模态语音服务部署提供了系统的工程参考。
vLLM-Omni 针对 Qwen3-Omni 提出了涵盖阶段拆分、CUDA Graph、异步分块传输、异步输出与按需副本扩展的全栈在线推理优化方案。该方案将 Thinker(多模态推理)、Talker(Codec 预测)与 Code2Wav(波形重建)流水线解耦,消除了跨阶段全载荷等待与 Python 调度开销。
推荐理由:文章拆解了语音多模态模型分阶段推理的延迟瓶颈,所提出的异步流水线与阶段级扩展方案可直接迁移至同类实时全模态架构。
ElevenLabs 正式发布文本转语音模型 Eleven v4 及其低延迟版本 Eleven v4 Turbo,采用全新架构以提升语调、节奏与情绪表现力。模型支持通过自然语言提示词及行内标签精细控制情绪和音效,并覆盖超过 90 种语言的多语种克隆;Eleven v4 Turbo 中位推理延迟约 100ms、首字发音中位时间约 150ms,重点面向实时对话智能体场景。
推荐理由:新模型在保留音色一致性的基础上强化了多角色对话情绪表达,为实时语音智能体提供了低延迟参考方案。
ElevenLabs 正式发布 Eleven v4 语音模型及面向实时语音智能体的 Turbo 版本,能更精准地遵从笑声、耳语等脚本情绪与音效指令。新模型支持超过 90 种语言,单次请求最高支持 10,000 字符,发音基准得分提升至 91.7%,Turbo 版本响应延迟低至约 150 毫秒。两款模型现已上线 API、ElevenAgents 和 ElevenCreative,并推出限时折扣。
推荐理由:新架构提升了长文本一致性与情感指令遵从度,配合 150 毫秒低延迟的 Turbo 版本,适合兼顾表现力与实时交互的语音场景。
Google 在 ADK 中引入了原生实时评测功能,支持利用模拟用户以音频交互驱动实时语音智能体并自动打分。评测体系支持动态情景模拟与固定脚本两种用例,结合 Gemini TTS 合成多种音色输入,并通过基于规则的 LLM 评委对多轮轨迹和工具调用质量进行判定。开发者可通过 CLI 运行评测将其接入 CI/CD 流程,也可在 ADK Web 中查看逐轮文字转录与可内嵌播放的音频回放。
推荐理由:文章演示了在 ADK 中通过模拟用户与 LLM 裁判端到端评测实时语音智能体的工作流,便于开发者将语音交互测试接入工程化流水线。
AWS 演示如何在 Amazon SageMaker AI 上通过 vLLM-Omni DLC 部署 Qwen3-TTS 模型,构建实时流式文本转语音应用。方案利用基于 HTTP/2 的 WebSocket 双向流式连接,支持实时发送文本并回传 24 kHz PCM 音频块以实现边生成边播放。
腾讯正在秘密内测 AI 游戏陪伴产品“鹅次元”,主打数字人 AI 搭子,支持语音通话、画面实时识别及主流网游陪伴。产品内置谷雨、沈露白、夏夏等多位虚拟角色,并提供壁纸“时刻”与桌面宠物功能,主打情绪陪伴而非技术带飞。目前内测全部功能免费,界面已搭建单次最少消耗 10 星币兑换能量的按量付费框架。
意大利最大银行 Intesa Sanpaolo 旗下私人银行部门 Fideuram 总裁遭遇 WhatsApp 伪造信息与 Deepfake 语音组合诈骗,导致该机构转出 9500 万欧元(约 1.08 亿美元)巨款。诈骗分子使用 AI 模型仿冒律所高级合伙人声音诱导转账至中国大陆与香港账户,事后该高管辞职。在多国机构协助下已追回 5300 万欧元,其余款项被洗入加密货币。
推荐理由:该案例展现了针对金融高管的深度伪造语音与即时通信组合欺诈链条,可作为评估生成式 AI 对大额资金审批风控影响的参考。
一项试点研究评估了结合情境化反馈与示范演讲的 AI 演讲指导系统,结果显示其能有效提升演讲表现,使参与者焦虑水平下降 15.3% 至 34.4%。该系统将演讲情境纳入评估标准以提供定制反馈,并生成文本与音频格式的改进示范演讲。在 7 名本科生历时 1 至 3 周且至少练习 3 次的测试中,所有受试者表现均获改善且填充词使用减少。
AWS 官方博客介绍了如何通过 Amazon SageMaker JumpStart 部署阿里千问 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型,构建全托管的实时语音克隆推理端点。
AWS 详解了在 Amazon SageMaker AI 上部署 WhisperX 深度学习容器(DLC)的实践方案,为音频转录补充 wav2vec2 强制对齐的词级时间戳与说话人区分能力。
腾讯正式上线“腾讯Hy翻译” APP,同步支持小程序、插件和 PC 端体验。该应用基于腾讯混元 Hy-MT2 翻译模型构建,支持 33 种语言互译及 5 种中国少数民族语言与方言,提供语音翻译、拍照翻译以及通过本地模型实现的离线翻译功能,已在美国、日韩、东南亚多国及中国港澳台等 12 个国家和地区推出。
推荐理由:该应用基于混元翻译模型提供了离线端侧能力,读者可以据此了解其在无网出国场景下的实用表现。
Apple 研究人员提出通过量化前潜在空间知识蒸馏压缩端侧流式神经音频编码器,以降低设备端听写功能的内存与延迟开销。该方法训练学生编码器在均方误差目标下回归教师模型的逐帧潜在特征,并以单层仿射层解决宽度不匹配问题。在 2.8x 压缩下,学生模型无需微调即可在 6 组测试中的 5 组将相对 WER 差距控制在 1.9% 以内,较同容量独立训练模型相对提升 3.9%。
针对半监督联邦学习(SSFL)在语音识别(ASR)中伪标签误差易发散的问题,研究提出结合在线伪标签与服务端更新稳定化的训练方案。该方法通过客户端在线模型生成伪标签,并由服务端在轮次间持续训练有标签种子数据以抑制模型漂移。实验表明,该方案在 11 组对比中有 9 组超越此前最强方法,域内平均提升 20.8%,跨域平均提升 10.0%。
Simon Willison 推出交互式测试工具 Gemini 3.8 TTS Playground,支持用户接入自身 API Key 测试 Google 新发布的 gemini-3.8-flash-tts 与 gemini-3.8-flash-lite-tts 文本转语音模型。
推荐理由:该工具提供了多说话人对话配置与 URL 分享能力,读者可以直接接入自身 API Key 体验并评估 Google 语音模型的生成速度与成本。
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音并逐行掌控对话演绎。
推荐理由:两款模型将语音生成拓展至基于自然语言的精细表演控制与多角色编排,为多语种配音和语音智能体开发提供了高可控性方案。
Ringg 采用 GPT-5.6 驱动覆盖语音、聊天、WhatsApp 和 Web 的多语言 AI 智能体,可解决高达 65% 的客户电话。与 GPT-4.1 相比,该方案的运行成本降低了 90%。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款近实时对话模型,主打面向企业与开发者的端到端语音智能体构建。
推荐理由:两款模型展示了近实时语音交互与后台复杂推理并行执行的技术路径,为构建低延迟端到端语音智能体提供了参考基准。
Google 推进多语言 AI 技术,推出支持 70 种语言和 2,000+ 语言对实时翻译的 Gemini 3.5 Live Translate,以及高精度语音转文本模型 Gemini 3.5 Transcribe。为解决网络受限环境下的使用需求,Google 还发布了基于 Gemini 构建的轻量级开源翻译模型家族 TranslateGemma,覆盖 55 种语言并支持端侧离线高效运行。
阶跃星辰正式发布 StepAudio 3 系列语音大模型,涵盖 Realtime、ASR、TTS、Gen 和 Music 五款模型并上线开放平台。
推荐理由:原文给出了五款音频模型在实时交互与全链路生成上的评测表现,读者可以据此了解原生语音模型在复杂任务中的落地能力。
OpenAI 正式在 API 中推出 GPT-Live-1 模型,为开发者提供自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信集成。
推荐理由:该模型将全双工语音对话接入API并提供电话支持,方便开发者直接构建实时语音交互应用。
Hugging Face 联合 Voice Arena 在 Open ASR Leaderboard 中上线 Monsoon 评测集,将印度英语和印地语纳入开源语音识别评测体系。
Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,提供实时双向流式与预录音频处理两条 API 路线,支持 85 种以上语言并具备口误自我修正与填充词过滤能力。
推荐理由:新模型将实时语音转录与格式化及工具调用结合,展现了语音识别向上下文理解与工作流调度演进的具体路径。
Hugging Face 发布研究评估了 11 款主流开源 ASR 模型的基准过拟合现象,发现部分低 WER 高分模型会依据声学线索复现基准参考文本中的错误甚至补全被静音的数字。研究设计了参考文本不一致、掩码实体检索和正字法切换三项测试,并在 Open ASR Leaderboard 上线了基准拟合分析标签页与开源脚本。
推荐理由:研究设计了量化 ASR 模型刷榜过拟合的具体探针方法,读者可据此审视公开基准分数的真实泛化能力。
Google Research 与 Google DeepMind 推出基于 Gemini 和 Project Astra 的医疗 AI 系统 AMIE (Video),实现了专家级实时音视频临床问诊。
推荐理由:研究通过解耦对话、规划与感知的异步多智能体架构,首次实现了音视频多模态下的实时医疗问诊与查体引导。
NVIDIA 推出 364M 参数的开源多语言文本转语音模型 Magpie TTS Multilingual,开放模型权重并提供生产就绪的 NIM 推理微服务。
推荐理由:模型开源权重并提供生产级推理微服务,帮助开发者在私有基础设施上自控语音延迟预算与定制发音。
腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 的 MoE 架构融合高精度语音识别与深度语义理解。在开源评测集中,其中文普通话 WER 为 3.34%、英语为 2.62%、粤语为 3.12%,并在复杂声学场景与长尾方言识别上获得专项优化。目前该模型已上线腾讯云 API 接口,并首发接入腾讯元宝 App。
推荐理由:模型结合大语言模型底座与语音联合训练,展示了利用上下文语义提升复杂场景语音识别准确率的技术路径。
Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并正式在 Google Flow Music 中上线。新模型在旋律结构复杂度与自然度、歌词质量与结构感知、以及人声发音和情感表现力上均有提升。同时,它增强了创作控制能力,方便用户调整生成音频的节奏和时长。
推荐理由:原文列举了旋律、歌词、人声表现力与节奏时长控制等维度的升级,读者可以据此评估 AI 音乐生成的可用性变化。
通义实验室正式发布实时语音合成模型 Qwen-Audio-3.0-TTS,推出首包延迟约 300ms 的 Flash 版与注重音色还原度的 Plus 版。模型覆盖 16 种语言及 20 种中文方言,支持自然语言指令控制与呼吸、笑场等结构化标签嵌入调控,单次合成支持最长 3 分钟并升级至 48kHz 音频输出,现已在阿里云百炼平台上线。
推荐理由:模型提供兼顾实时与高音质的两个版本并支持指令控制情感,有助于开发者评估其在多语种及复杂场景的落地表现。
阶跃星辰在 WAIC 2026 展区集中展示了获得“镇馆之宝”荣誉的智能体手机 STEPX Neo、Step 系列模型矩阵、汽车智能体及多机器人具身智能项目。STEPX Neo 搭载 Step AOS 系统与 Amoo 智能体,是目前唯一获得相关国标 L3 级检测报告的智能体手机,底层由 Step Edge 与 Step 3.7 Flash 等模型驱动。
通义实验室发布实时双工全模态交互模型 Wan-Streamer v0.2,端到端响应延迟约 550ms,输出视频分辨率提升至 640×368 @ 25FPS。模型将传统流水线重构为基于 160ms 流式单元的原生因果流,并采用单卡 Thinker 与多卡 Performer 双通路硬件解耦与 Ulysses 序列并行机制,实现低延迟感知与重载视频生成的时序重叠。
推荐理由:原文给出了双通路硬件解耦与时序重叠调度方案,展示了在大幅提升视频分辨率时维持超低交互延迟的具体工程路径。
通义实验室将语音交互模型 Fun-Realtime-AudioChat 正式升级更名为 Qwen-Audio-3.0-Realtime 并上线阿里云百炼,提供 plus 和 flash 两个版本。
推荐理由:升级通过多模态双工与多教师蒸馏兼顾了低延迟抗噪和复杂工具调用,适合语音交互开发者参考。