跳到正文
今天9月30日周三
  1. Hacker News · AI35

    MeetTwins 开启免费 Beta 测试:可派 AI 分身代开 Google Meet 站会

    MeetTwins 开启免费 Beta 测试,支持用户派遣实时 AI 虚拟分身代为参加 Google Meet 站会,仅根据预先批准的笔记回答问题并在聊天区发送链接。该工具由 Sarvam AI 模型与 Simli 驱动,支持英语及印度多种语言交互。对于涉及薪资、合同等超出授权范围的隐私提问,MeetTwins 会礼貌拒绝回答。

  2. Hacker News · AI75

    东京地方法院裁定 AI 工具克隆演员声音侵犯公开权

    东京地方法院裁定未经授权使用 AI 克隆演员声音进行商业变现侵犯了其公开权,成为日本首例保护个人声音标识免受 AI 侵权的司法判决。该诉讼由知名声优津田健次郎提起,指控一匿名 TikTok 账号在 188 条视频中克隆其标志性音色并以此获利。法院认定声音与肖像一样象征人格并受法律保护,但因涉事账号已在起诉后自行删除视频,驳回了要求平台删视频的诉求。

    推荐理由:判决明确了日本法院首次将声音纳入公开权保护范畴的法律依据,为生成式 AI 声音克隆的商业侵权界定提供了司法参考。

  3. C114 通信网 · AI与算力(网页)33

    中国电信刘洋:5G-A以AI+网络融合创新重构服务范式

    中国电信在第三届5G-A万兆网产业论坛上阐述了5G-A网络智能化实践,通过核心网NWDAF与无线智算单板协同构建主动差异化服务保障体系,已完成覆盖8类36个APP及53个细分业务的动态加速验证。此外,中国电信打造了“天翼灵动窗”端网协同交互入口,并积极推进6G ADN原型系统研发与实验。

  4. IT之家 · AI 筛选42

    LG 与微软合作展示智能家居 AI 语音助手

    LG 电子展示了与微软合作研发的智能家居 AI 语音助手,应用于智能家居中枢设备 ThinQ ON。该产品基于语音到语音(Speech to Speech)智能体技术并融合微软 Voice Live,支持随时“插话”中断并理解新意图。LG 计划年内推出搭载该技术的 ThinQ ON 并向现有用户更新,后续还将拓展至酒店、办公室等 B2B 场景。

  5. arXiv 人工智能38

    AVIO:在视听场景中学习添加与移除发声物体

    AVIO 是一种可在视听场景中联合学习发声物体添加与移除的模型,通过源条件特征调制适配预训练文本到视听生成模型。配套构建的 AVIOBench 数据集包含 37.9 小时配对视听样本,覆盖 1,878 个目标物体名称。该模型结合参考帧课程学习,使单个模型即可执行纯指令编辑,并支持通过可选视觉引导控制物体的外观与位置。

  6. arXiv 机器学习38

    将语言模型融入 MEG 聆听与想象语音解码

    研究提出在对比神经解码器训练和神经约束束搜索推理两个阶段将语言模型融入 MEG 语音解码,以提升跨被试的聆听与想象语音解码表现。实验结果显示,想象语音解码从语言模型中的获益显著大于聆听语音解码,且相比仅依赖神经信号解码带来更大增益。这表明语言先验在神经证据较弱时尤为有效,对开发想象语音脑机接口具有重要价值。

  7. arXiv 机器学习34

    机制可解释性揭示脑机语音解码器中的共享因果子空间

    研究人员利用机制可解释性的激活补丁技术,揭示了脑机语音解码器处理发声、模仿和想象语音时的内部表征机制。实验发现跨模态增益来自小神经元群而非单个神经元,且这些神经元在解码器早期具有模态特异性、后期则高度重叠。该发现表明可通过强化后期共享表征,主要利用发声数据提升隐匿语音解码的数据效率。

  8. arXiv 自然语言处理61

    如何减少 Whisper 语音识别模型的幻觉问题

    该研究提出了一种通过将易幻觉文本合成为正样本语音来抑制 Whisper 幻觉的方法,避免了单纯添加无语音音频导致的真实语音误删问题。作者收集了 100 种语言的 40,891 个幻觉短语并构建了基准测试,最佳微调模型将静音环境下的幻觉率从 61.9% 降至 2.4%,同时将真实短语召回率从 69.8% 提升至 82.7%。相关评测基准、幻觉词表和合成语料已开源。

  9. arXiv 自然语言处理40

    FA-Bench:清晰与噪声条件下的词级与音素级强制对齐及 ASR 时间戳评测基准

    研究人员推出开源基准 FA-Bench,在清晰及 4 种退化音频条件下统一评估了 21 个开源模型与 9 个商业 API 的强制对齐及 ASR 时间戳性能。评测采用基于容差的 F1 分数为主指标,消除了标准 MAE 带来的 9% 至 14% 分数虚高。结果显示现有系统普遍存在时间偏差,如 Whisper 提前约 150 ms,多个商业 API 滞后超 50 ms。

  10. arXiv 自然语言处理46

    mu-bench:多语言话语转写评测基准

    研究团队推出多语言语音转写评测基准 mu-bench,包含面向 AI 银行智能体的英语、西班牙语、土耳其语、越南语和普通话 5 种语言共 4,270 条真实通话话语。该基准同步提出基于 LLM judge 的语义评估指标 UER,与人类标注者的一致性达 κ = 0.78;公开排行榜评测了 6 家商业供应商,其中最佳 UER 达 11.9%,且普通话转写难度最高。

  11. arXiv 自然语言处理43

    IndicFDB:跨印度语言全双工语音 AI 智能体评测基准

    研究人员推出评测基准 IndicFDB,将全双工语音智能体评测扩展至 10 种印度语言,共包含 12,350 个样本。该基准从约 50,000 小时对话中挖掘停顿处理、轮次转换和搭话样本,并构建了人工验证的用户打断测试。在 7 个语音智能体的评测中,商业 API 难以同时兼顾速度与停顿鲁棒性,开源全双工模型也在搭话、质量与延迟间存在权衡。

  12. 爱范儿 · AI 筛选67

    豆包输入法完成五大平台覆盖并上线跨端协同与 AI 文字整理功能

    豆包输入法正式补齐 HarmonyOS NEXT 与 Windows 版本,实现 iOS、Android、HarmonyOS NEXT、macOS 及 Windows 五大平台全覆盖。新版本支持账号多端实时对齐个人词库、跨设备文字与图片超级互传,并升级了气声与方言识别、离线语音以及长语音结构化文字整理功能。此外,键盘端还加入了行内计算、语义续写及手势快捷删除等交互特性。

    推荐理由:原文详细梳理了跨端词库同步与 AI 文字整理等实测细节,展示了端侧大模型如何降低日常多设备输入阻力。

  13. vLLM 官方博客(网页)70

    vLLM-Omni 语音合成推理工程优化实践

    vLLM 团队发布了 vLLM-Omni 针对语音合成(TTS)模型的全套推理优化方案,支持 Qwen3-TTS、VoxCPM2、Higgs Audio V3 和 Fish Speech S2 Pro。

    推荐理由:文章详细拆解了四种不同架构 TTS 模型的推理瓶颈与定制优化方案,为多模态语音服务部署提供了系统的工程参考。

  14. vLLM 官方博客(网页)66

    vLLM-Omni 部署与优化多阶段 Qwen3-Omni 的实践经验

    vLLM-Omni 针对 Qwen3-Omni 提出了涵盖阶段拆分、CUDA Graph、异步分块传输、异步输出与按需副本扩展的全栈在线推理优化方案。该方案将 Thinker(多模态推理)、Talker(Codec 预测)与 Code2Wav(波形重建)流水线解耦,消除了跨阶段全载荷等待与 Python 调度开销。

    推荐理由:文章拆解了语音多模态模型分阶段推理的延迟瓶颈,所提出的异步流水线与阶段级扩展方案可直接迁移至同类实时全模态架构。

  15. Hacker News · AI82

    ElevenLabs 发布 Eleven v4 文本转语音模型及 Turbo 版本

    ElevenLabs 正式发布文本转语音模型 Eleven v4 及其低延迟版本 Eleven v4 Turbo,采用全新架构以提升语调、节奏与情绪表现力。模型支持通过自然语言提示词及行内标签精细控制情绪和音效,并覆盖超过 90 种语言的多语种克隆;Eleven v4 Turbo 中位推理延迟约 100ms、首字发音中位时间约 150ms,重点面向实时对话智能体场景。

    推荐理由:新模型在保留音色一致性的基础上强化了多角色对话情绪表达,为实时语音智能体提供了低延迟参考方案。

  16. The Decoder78

    ElevenLabs 发布 Eleven v4 语音模型与实时 Turbo 版本

    ElevenLabs 正式发布 Eleven v4 语音模型及面向实时语音智能体的 Turbo 版本,能更精准地遵从笑声、耳语等脚本情绪与音效指令。新模型支持超过 90 种语言,单次请求最高支持 10,000 字符,发音基准得分提升至 91.7%,Turbo 版本响应延迟低至约 150 毫秒。两款模型现已上线 API、ElevenAgents 和 ElevenCreative,并推出限时折扣。

    推荐理由:新架构提升了长文本一致性与情感指令遵从度,配合 150 毫秒低延迟的 Turbo 版本,适合兼顾表现力与实时交互的语音场景。

  17. Google Developers · AI 筛选63

    如何在 Google ADK 中评测实时语音智能体

    Google 在 ADK 中引入了原生实时评测功能,支持利用模拟用户以音频交互驱动实时语音智能体并自动打分。评测体系支持动态情景模拟与固定脚本两种用例,结合 Gemini TTS 合成多种音色输入,并通过基于规则的 LLM 评委对多轮轨迹和工具调用质量进行判定。开发者可通过 CLI 运行评测将其接入 CI/CD 流程,也可在 ADK Web 中查看逐轮文字转录与可内嵌播放的音频回放。

    推荐理由:文章演示了在 ADK 中通过模拟用户与 LLM 裁判端到端评测实时语音智能体的工作流,便于开发者将语音交互测试接入工程化流水线。

  18. AITNT · AI头条(网页)43

    腾讯秘密内测 AI 游戏陪伴产品“鹅次元”

    腾讯正在秘密内测 AI 游戏陪伴产品“鹅次元”,主打数字人 AI 搭子,支持语音通话、画面实时识别及主流网游陪伴。产品内置谷雨、沈露白、夏夏等多位虚拟角色,并提供壁纸“时刻”与桌面宠物功能,主打情绪陪伴而非技术带飞。目前内测全部功能免费,界面已搭建单次最少消耗 10 星币兑换能量的按量付费框架。

9月29日周二
  1. Solidot · AI 筛选77

    意大利银行高管遭遇 Deepfake 语音诈骗被卷走逾 1 亿美元

    意大利最大银行 Intesa Sanpaolo 旗下私人银行部门 Fideuram 总裁遭遇 WhatsApp 伪造信息与 Deepfake 语音组合诈骗,导致该机构转出 9500 万欧元(约 1.08 亿美元)巨款。诈骗分子使用 AI 模型仿冒律所高级合伙人声音诱导转账至中国大陆与香港账户,事后该高管辞职。在多国机构协助下已追回 5300 万欧元,其余款项被洗入加密货币。

    推荐理由:该案例展现了针对金融高管的深度伪造语音与即时通信组合欺诈链条,可作为评估生成式 AI 对大额资金审批风控影响的参考。

  2. arXiv 自然语言处理26

    AI 辅助循证学习在公众演讲技能培养中的效果评估

    一项试点研究评估了结合情境化反馈与示范演讲的 AI 演讲指导系统,结果显示其能有效提升演讲表现,使参与者焦虑水平下降 15.3% 至 34.4%。该系统将演讲情境纳入评估标准以提供定制反馈,并生成文本与音频格式的改进示范演讲。在 7 名本科生历时 1 至 3 周且至少练习 3 次的测试中,所有受试者表现均获改善且填充词使用减少。

9月26日周六
9月25日周五
9月24日周四
  1. 腾讯混元 公众号61

    腾讯上线基于混元 Hy-MT2 的“腾讯Hy翻译” APP

    腾讯正式上线“腾讯Hy翻译” APP,同步支持小程序、插件和 PC 端体验。该应用基于腾讯混元 Hy-MT2 翻译模型构建,支持 33 种语言互译及 5 种中国少数民族语言与方言,提供语音翻译、拍照翻译以及通过本地模型实现的离线翻译功能,已在美国、日韩、东南亚多国及中国港澳台等 12 个国家和地区推出。

    推荐理由:该应用基于混元翻译模型提供了离线端侧能力,读者可以据此了解其在无网出国场景下的实用表现。

  2. Apple Machine Learning Research36

    Apple 通过潜在空间知识蒸馏压缩流式神经音频编码器

    Apple 研究人员提出通过量化前潜在空间知识蒸馏压缩端侧流式神经音频编码器,以降低设备端听写功能的内存与延迟开销。该方法训练学生编码器在均方误差目标下回归教师模型的逐帧潜在特征,并以单层仿射层解决宽度不匹配问题。在 2.8x 压缩下,学生模型无需微调即可在 6 组测试中的 5 组将相对 WER 差距控制在 1.9% 以内,较同容量独立训练模型相对提升 3.9%。

  3. Apple Machine Learning Research35

    半监督联邦 ASR 实用方案:在线伪标签与服务端更新稳定化

    针对半监督联邦学习(SSFL)在语音识别(ASR)中伪标签误差易发散的问题,研究提出结合在线伪标签与服务端更新稳定化的训练方案。该方法通过客户端在线模型生成伪标签,并由服务端在轮次间持续训练有标签种子数据以抑制模型漂移。实验表明,该方案在 11 组对比中有 9 组超越此前最强方法,域内平均提升 20.8%,跨域平均提升 10.0%。

  4. Simon Willison73

    Simon Willison 推出 Gemini 3.8 TTS Playground 测试工具

    Simon Willison 推出交互式测试工具 Gemini 3.8 TTS Playground,支持用户接入自身 API Key 测试 Google 新发布的 gemini-3.8-flash-tts 与 gemini-3.8-flash-lite-tts 文本转语音模型。

    推荐理由:该工具提供了多说话人对话配置与 URL 分享能力,读者可以直接接入自身 API Key 体验并评估 Google 语音模型的生成速度与成本。

9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 文本转语音模型

    Google DeepMind 正式推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音并逐行掌控对话演绎。

    推荐理由:两款模型将语音生成拓展至基于自然语言的精细表演控制与多角色编排,为多语种配音和语音智能体开发提供了高可控性方案。

9月16日周三
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款近实时对话模型,主打面向企业与开发者的端到端语音智能体构建。

    推荐理由:两款模型展示了近实时语音交互与后台复杂推理并行执行的技术路径,为构建低延迟端到端语音智能体提供了参考基准。

  2. Google AI50

    Google:让 AI 覆盖每一种语言,服务每一个人

    Google 推进多语言 AI 技术,推出支持 70 种语言和 2,000+ 语言对实时翻译的 Gemini 3.5 Live Translate,以及高精度语音转文本模型 Gemini 3.5 Transcribe。为解决网络受限环境下的使用需求,Google 还发布了基于 Gemini 构建的轻量级开源翻译模型家族 TranslateGemma,覆盖 55 种语言并支持端侧离线高效运行。

9月15日周二
9月10日周四
  1. OpenAI 官方动态78

    OpenAI 在 API 中上线 GPT-Live-1 语音模型

    OpenAI 正式在 API 中推出 GPT-Live-1 模型,为开发者提供自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信集成。

    推荐理由:该模型将全双工语音对话接入API并提供电话支持,方便开发者直接构建实时语音交互应用。

8月28日周五
8月27日周四
  1. Google DeepMind82

    Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,提供实时双向流式与预录音频处理两条 API 路线,支持 85 种以上语言并具备口误自我修正与填充词过滤能力。

    推荐理由:新模型将实时语音转录与格式化及工具调用结合,展现了语音识别向上下文理解与工作流调度演进的具体路径。

8月21日周五
  1. Hugging Face73

    Hugging Face 评估语音识别模型基准过拟合现象

    Hugging Face 发布研究评估了 11 款主流开源 ASR 模型的基准过拟合现象,发现部分低 WER 高分模型会依据声学线索复现基准参考文本中的错误甚至补全被静音的数字。研究设计了参考文本不一致、掩码实体检索和正字法切换三项测试,并在 Open ASR Leaderboard 上线了基准拟合分析标签页与开源脚本。

    推荐理由:研究设计了量化 ASR 模型刷榜过拟合的具体探针方法,读者可据此审视公开基准分数的真实泛化能力。

8月12日周三
8月11日周二
8月4日周二
  1. 腾讯混元 公众号65

    腾讯混元发布语音识别模型 Hy ASR 3.0 preview

    腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 的 MoE 架构融合高精度语音识别与深度语义理解。在开源评测集中,其中文普通话 WER 为 3.34%、英语为 2.62%、粤语为 3.12%,并在复杂声学场景与长尾方言识别上获得专项优化。目前该模型已上线腾讯云 API 接口,并首发接入腾讯元宝 App。

    推荐理由:模型结合大语言模型底座与语音联合训练,展示了利用上下文语义提升复杂场景语音识别准确率的技术路径。