Simple AI 推出对话感知模型 Tango,优化语音交互轮次检测
Simple AI 推出名为 Tango 的对话感知模型(Conversational Awareness Model),专注于解决语音 AI 交互中的“说话轮次结束”(End-of-Turn)检测难题。该模型旨在更精准地判断用户何时真正停止发言,减少对话过程中的不自然停顿或错误抢话,从而提升实时语音 Agent 的交互流畅度与响应自然度。
Simple AI 推出名为 Tango 的对话感知模型(Conversational Awareness Model),专注于解决语音 AI 交互中的“说话轮次结束”(End-of-Turn)检测难题。该模型旨在更精准地判断用户何时真正停止发言,减少对话过程中的不自然停顿或错误抢话,从而提升实时语音 Agent 的交互流畅度与响应自然度。
在开发者活动中,OpenAI 宣布推出名为 dots 的全天候智能体。dots 采用卡通形象界面,不仅能协助用户规划日程、设计网站、测试应用及处理生活杂务,还拥有独立的云端环境和长期记忆能力,能随使用时间加深对用户工作习惯与偏好的理解。dots 支持与 ChatGPT 平台上 4000 多款应用协同,并可通过短信、Slack、Teams 等多渠道进行交互与语音沟通,实现多任务自主推进。
OpenAI 宣布对其编程助手 Codex 进行多项重大功能扩展。新版本支持可在多设备间无缝复用的云端开发环境,并推出了集成语音控制功能的全新命令行界面(CLI)。此外,Codex 还新增了自动化代码审查工具,以及一款专注于安全的产品,能够主动扫描代码仓库漏洞并自动生成修复建议,全面强化其在开发工作流与代码安全方面的能力。
意大利最大银行联合圣保罗(Intesa Sanpaolo)旗下私人银行 Fideuram 总裁遭遇精密 AI 诈骗。骗子先通过 WhatsApp 伪造母公司 CEO 指令,随后利用 Deepfake 语音技术冒充顶级律所合伙人致电确认,诱使该高管向中国内地及香港账户转账 9500 万欧元(约 1.08 亿美元)。目前虽追回 5300 万欧元,其余资金已被兑换为加密货币,涉事高管已辞职。
语音AI创企ElevenLabs推出新一代语音模型Eleven v4。该模型能够更精准地响应笑声、耳语等情绪提示,并在有声读物等长音频制作中保持声音的一致性。同时,其Turbo变体专为实时语音智能体打造,响应延迟低至150毫秒。在权威评测机构Artificial Analysis的Voice Arena排行榜上,Eleven v4的表现已超越Cartesia及谷歌Gemini。
据外媒报道,谷歌已正式启动在安卓端停用传统语音助手 Google Assistant 的进程,由大模型驱动的 Gemini 全面取代。目前大批用户反馈已无法使用 Google Assistant,且 Gemini 应用中移除了回退切换选项。本次调整主要波及智能手机、智能手表、车载 Android Auto 及耳机等移动设备与配件,而智能音箱与智能显示屏暂不受影响。部分用户指出 Gemini 虽更智能,但仍存在幻觉且缺乏部分离线指令支持。
浙江乐清警方近日破获一起利用AI语音系统实施电信网络诈骗的案件,抓获30名嫌疑人,涉案流水超千万元。诈骗团伙在长沙设立窝点,通过非法获取的个人借贷信息,利用AI语音外呼系统批量拨号筛选意向受害人。一旦系统识别到受害者有借贷意向,便无缝转接至人工话务员,以“增加额度”、“垫资返还”等名义诱导受害人转账。该案揭示了AI技术被黑产用于低成本精准引流的新型犯罪模式。
针对传统语音识别(ASR)依赖词错误率(WER)且偏向英语朗读语音的问题,研究人员推出了多语言通话转录基准数据集 mu-bench。该数据集包含英语、西班牙语、土耳其语、越南语和普通话 5 种语言共 4,270 条 AI 银行智能体通话话语,聚焦姓名、邮箱等表单字段输入。同时提出了基于大模型裁判的语意错误率(UER)指标,旨在更准确评估转录是否保留真实语义。
开发者推出开源 macOS 应用 TalkToMe,允许 AI 智能体从当前工作会话中直接向用户拨打语音电话。用户接听后可进行实时语音对话,智能体在通话期间仍能保留工具调用权限、文件访问及上下文历史。该工具兼容 Codex、Claude Code、Hermes 等可运行 Shell 命令的智能体框架,语音部分支持接入 ElevenLabs 或本地语音模型。
腾讯正在内测一款名为“鹅次元”的 AI 游戏陪伴产品。该产品主打数字人 AI 游戏搭子,具备语音对话、游戏画面实时识别与实时互动陪伴能力。产品内置多位不同人设的虚拟角色,支持玩家闲聊互动或进入专属游戏陪伴模式,目前已适配多款主流网游。产品现处于限时免费阶段,并已展现基于虚拟代币的商业化付费框架。
AWS 发布技术教程,详细介绍如何在 Amazon SageMaker AI 上利用 vLLM-Omni 深度学习容器部署文本转语音(TTS)模型。该教程演示了部署 Qwen3-TTS 模型并通过持久双向连接向 Gradio 前端实时流式传输生成语音的全流程,为开发者构建低延迟、高并发的实时语音交互系统提供了端到端的工程化落地方案。
语音AI安全初创公司Modulate宣布完成2500万美元融资。该公司主要研发专有语音模型及语音分析套件,其核心技术被广泛部署于识别与防范音频深度伪造(Deepfake)、电信诈骗及网络欺诈等场景,为线上语音社交平台、游戏及企业级客户提供实时语音安全监测与内容治理方案。
大语言模型在离线翻译中表现出色,但在同传语音到语音翻译(Simul-S2ST)中,因缺乏高质量且因果对齐的跨语言说话人保真训练数据,且现有方案依赖固定策略或置信度启发式方法,导致翻译质量欠佳且延迟较高。研究团队提出了一种因果感知Simul-S2ST框架,通过新型数据流水线生成高保真、因果对齐的语音片段,以改善同传中的声音迁移和实时翻译效果。
该研究针对多说话人场景提出了目标说话人遗忘自动语音识别(TSU-ASR)任务,以满足特定用户不希望自身语音被转录的隐私需求。系统需转录未退出的说话人内容,同时仅标记退出者的发音区间而不转录其文本。研究团队设计了一种轻量级的注册条件门控(ECG)模块,可直接附加到冻结的双流语音大模型上,在推理阶段动态实现对新增退出说话人的选择性遗忘与转录过滤。
该论文研究了音频大语言模型(Audio LLMs)在输入语音严重失真时,能否识别出自身转录结果不可靠。实验发现,如果直接通过提示词让模型评估自身转录的可靠性,模型的判断表现很差,在绝大多数情况下都会盲目自信地预测转录是可靠的,这揭示了语音交互大模型在面对低质量输入时存在自我认知盲区的问题。
针对现代Conformer语音识别(ASR)模型因计算敏感算子依赖浮点回退而难以充分利用端侧整数加速器的问题,研究人员提出了I-Parakeet。该工作实现了英伟达0.6B参数Parakeet-CTC模型的纯整型部署,使其能够完全运行在智能手机NPU上,无需任何浮点算子或CPU回退。核心贡献包括推导了相对位置自注意力的纯整数计算公式,为大参数量语音模型在边缘设备的高效部署提供了新路径。
随着实时语音智能体从研究走向实际部署,其评估标准仍割裂在语音基础模型、轮次转换心理语言学与智能体基准三个领域之间。架构论文常关注延迟,轮流对话研究关注预测准确度,而智能体基准则侧重任务成功率,缺乏统一评价体系。该论文通过梳理38篇核心文献,提出了系统性的三维评估证据链框架,旨在为实际部署的实时语音智能体提供从单点性能到落地效果的全流程评估方法。
英伟达发布了轻量级 AI 模型 Nemotron 3 Diarization。该模型仅包含约 1 亿(100M)参数,专用于语音中的说话人日志(Diarization)任务,能够在多人对话场景中实时区分并识别最多 8 位不同的说话人,便于会议记录、语音转录与多方音频分析等应用场景。
据外媒报道,快餐连锁巨头麦当劳正进一步推进人工智能技术在核心业务中的落地应用,重点涵盖汽车穿梭餐厅(Drive-thru)、库存管理以及订单准确率的提升。相关举措涉及其推进的AI战略(如ArchIQ等方向),旨在利用自动化和智能算法优化门店日常运营与顾客点餐体验。鉴于素材仅提供标题及链接线索,关于技术供应商、落地部署周期及具体实现细节仍有待官方进一步公布。
Amazon SageMaker JumpStart 现已支持部署开源的 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型至全托管的实时终端节点。开发者可利用简短的参考音频片段快速完成声音克隆,且该模型具备跨语言克隆能力,能在不同语种切换时稳定保留说话人的独特音色特征,为构建高保真、个性化的多语言实时语音交互应用提供了便捷的落地路径。
High Fidelity 发布博文探讨如何为 AI 智能体赋予语音交互能力,使其能够像人类一样参与实时语音对话与协作沟通。由于输入仅包含文章链接与标题,具体技术方案、系统架构及实现细节等详细信息暂未完全披露。
谷歌正在测试名为“Call for Me”的新功能。该功能基于旗下大模型Gemini,能够代表用户直接拨打电话联系各类商家,以协助处理咨询或预约等事务。此举展现了谷歌在将AI助手与日常实际任务深度结合、推进自动化语音代理应用方面的最新探索与尝试。
自动语音识别(ASR)模型通常在全精度下接受人口统计公平性审查,但实际生产部署的模型大多经过量化、剪枝和蒸馏等压缩处理。该研究探索了后训练权重压缩是否会重新分配不同人口群体的识别错误负担。在Fair-Speech、Common Voice 25和AfriSpeech-200等数据集上的评测显示,对Whisper-large-v3执行50% Wanda剪枝会显著拉大黑人/非裔与亚裔群体间的词错误率差距,表明压缩会复合加剧时间成本与识别公平性差异。
针对孟加拉语在神经文本转语音(TTS)领域缺乏高质量长文本朗读资源的现状,研究人员推出了BanglaKontho数据集。该数据集源自专业有声读物录音,包含20小时单人发音数据、7050条经转写校验的24 kHz切分片段,旨在解决现有语料缺乏长文本韵律与连贯叙述的问题。此外,研究团队还发布了支持孟加拉风格数字分组、货币与日期表达的文本正则化工具。
该研究提出了用于孟加拉语对话语音话轮结束(End-of-Turn)检测的基准语料库BanglaTurn及配套模型。该语料库包含35,374段时长3至15秒的播客语音,通过说话人日志结合大语言模型初标并经人工全面核验。研究构建了结合Whisper编码器与特定任务分类头的模型,在平衡测试集上达到84.33%的准确率,较基线Smart-Turn v3的69.28%显著提升,并将假阴性率从51.57%降低至7.5%。
针对自动语音识别(ASR)在处理长音频时难以准确、一致转录专业术语的问题,研究人员提出了基于大语言模型的智能体 Agentic-GER。该系统利用完整转录文本的全局上下文与世界知识,识别可疑术语并化解歧义假设;同时通过选择性重新转录原始语音来核验候选修正结果,显著提升了长语音中领域专业术语的识别准确率与一致性。
OpenAI宣布为ChatGPT Voice上线语音执行任务功能,通过接入模型与插件体系,用户可直接通过语音指令查验邮件、制作PPT、搭建网站及追回重复扣费等。该项能力已深度整合进此前推出的ChatGPT Work Agent中,新版本应用已同步面向全球用户推送,标志着语音交互进一步向具备实际操作能力的智能体演进。
科大讯飞推出基于全国产算力训练的语音识别大模型Spark-ASR-2.0,该模型依托语音基座大模型Spark-Audio-1.0-Preview构建。新版本在方言免切换识别、嘈杂环境应对、上下文纠错以及口语书面化规范等方面实现显著提升,同时整体推理成本较上一代仅增加10%。目前,该模型已落地讯飞输入法,并通过讯飞开放平台对外提供API服务。
据报道,AI语音技术独角兽ElevenLabs估值已达220亿美元。该公司首席执行官在专访中表示,ElevenLabs目前为大量客户服务通话提供语音底层支持。他指出,在机器客服成为公众普遍预期之前,使用该技术的企业或许应当主动向用户告知对方为AI,而不是隐瞒机器身份。
该素材涉及关于 Deepgram 举办的“Speak”语音 AI 大会(Voice AI Conference)是否值得参与的讨论链接。由于当前输入内容仅包含相关链接及极简的社区互动数据,并未提供关于该大会的具体议题、嘉宾阵容、举办形式或讨论详情等实质性信息,故有效内容不足,具体情况需参考原始网页进一步了解。